Disciplina de engenharia que aplica práticas de software à operação de infraestrutura para garantir confiabilidade.
SRE (Site Reliability Engineering) é a abordagem criada pelo Google para operar sistemas em escala. Centraliza-se em SLIs (indicadores), SLOs (objetivos) e SLAs (compromissos contratuais), além de error budgets que equilibram inovação e estabilidade. Práticas-chave: automação de toil, blameless postmortems, capacity planning, on-call estruturado, observabilidade ponta-a-ponta, chaos engineering. SRE difere de DevOps por foco quantitativo em confiabilidade e por exigir engenheiros que combinam software e operações. Em ambientes corporativos brasileiros, SRE costuma conviver com Platform Engineering, entregando plataformas internas opinadas. A Nobug oferece squads de SRE para sustentação 24x7 de sistemas críticos.