Os engenheiros de confiabilidade do local (SREs) têm a difícil tarefa de resolver problemas espinhosos de desempenho e confiabilidade. Mas sua missão principal é fornecer às equipes Devops insights operacionais e sugerir melhorias de implementação no desempenho, segurança e robustez geral dos sistemas de negócios.
O Google lançou seu manual de SRE em 2003, mas levou algum tempo para que a definição, as ferramentas e as técnicas da função se tornassem populares. As startups foram as primeiras a adotar a observabilidade para aplicações nativas da nuvem e a criar posições SRE dedicadas. À medida que as ferramentas amadureceram e as responsabilidades do SRE se tornaram mais claramente definidas, as grandes empresas designaram os SREs para funcionarem como uma ponte entre as equipas de devops e de operações de TI para melhorar a resiliência numa gama mais ampla de aplicações, APIs e pipelines de dados.
SRE é um plano de carreira para engenheiros multidisciplinares com fortes instintos investigativos, habilidades afiadas de análise de dados e temperamento para atuar sob pressão. Tornou-se uma responsabilidade crítica à medida que a tecnologia se tornou crítica para as empresas, e é um papel crescente na era genAI à medida que mais empresas implementam agentes de IA.
Mas a necessidade crítica de resiliência e de maior complexidade tecnológica traz novos desafios para as SREs. De acordo com o relatório sobre o estado da confiabilidade da produção e adoção de IA de 2026, 44% dos entrevistados experimentaram uma interrupção associada a alertas ignorados ou suprimidos no ano passado, e 35% relataram que seus engenheiros ocasionalmente ignoram ou descartam alertas devido à fadiga de alertas. Mais de 70% dos alertas recebidos não são acionáveis, de acordo com 57% das organizações.
Então, a IA está facilitando o papel do SRE e ajudando as empresas a executar operações tecnológicas mais confiáveis? Por outro lado, a IA também está a gerar complexidade, à medida que as empresas implementam ferramentas genAI e agentes de IA em mais funções empresariais e procuram automatizar mais tomadas de decisão em todas as operações.
AIops e operações de agência auxiliam SREs
Ao longo da última década, as responsabilidades do SRE tornaram-se um pouco mais fáceis através de melhorias nas plataformas de monitorização, práticas de observabilidade, ferramentas para centralização de dados operacionais e IA aplicada em operações de TI (AIops). Mas durante o calor da resolução de uma interrupção ou problema de desempenho, não é fácil identificar corretamente qual sistema desencadeou o problema em comparação com outros sistemas downstream afetados por ele.
De acordo com o Relatório Komodore 2025 Enterprise Kubernetes, 79% dos incidentes de produção se originam de mudanças recentes no sistema, incluindo implantações e alterações em ambientes de computação. Mas os outros 21% dos incidentes decorrem de problemas fora do controle da empresa, incluindo falhas de rede, alterações de terceiros e falhas de provedores de nuvem.
“Os SREs que usam recursos de IA têm sucesso ou falham no momento em que um incidente se desenrola, quando os engenheiros estão decidindo o que investigar a seguir”, diz Itiel Shwartz, CTO da Komodor. “Se o sistema simplificar a detecção de causa raiz, conectar sinais a mudanças recentes e explicar seu raciocínio de uma maneira que os engenheiros reconheçam, ele ganhará confiança. Se adicionar incerteza ou exigir validação extra, ele será marginalizado, independentemente de quão personalizado seja o modelo por trás dele. O que é menos óbvio é o que é necessário para fazer a IA para SREs funcionar na produção e quão diferente essa realidade é de protótipos, demonstrações ou construções internas iniciais.”
AIops não é um recurso novo, especialmente no uso de aprendizado de máquina para correlacionar logs, métricas e rastreamentos em sistemas de monitoramento e alerta. O gerenciamento de serviços de TI e os SREs têm usado AIops para reduzir o tempo médio para resolver incidentes e para realizar análises precisas de causa raiz (RCA) com eficiência. As operações de agente são a próxima onda de recursos operacionais de genAI, incluindo ferramentas para monitorar agentes de IA, gerenciar seus direitos de acesso e detectar desvios de precisão do modelo de IA.
“A IA é útil durante grandes incidentes porque pode reunir muito contexto em algumas frases claras, que é exatamente o que um SRE precisa no momento”, sugere Shani Shoham, diretor de receitas da OpenObserve. “A complexidade da arquitetura e as diferentes ferramentas tornam tudo mais fácil para a IA do que para um ser humano, mas a resolução autônoma ainda está longe.”
O impacto da IA nas pessoas e no esgotamento
A pressão empresarial para manter os sistemas ativos, seguros e com bom desempenho é uma responsabilidade estressante 24 horas por dia, 7 dias por semana. De acordo com o Relatório SRE 2025 da Catchpoint, 36% dos SREs frequentemente ou sempre experimentam estresse elevado durante um incidente, e 28% disseram que o estresse persiste mesmo depois que o incidente é resolvido. As capacidades de IA podem revelar-se uma mudança de jogo, ajudando os SREs a evitar o esgotamento e a reduzir o stress.
“A IA pode melhorar a RCA ao considerar um contexto de incidente muito maior do que qualquer engenheiro pode suportar às 3 da manhã, raciocinando sobre rastreamentos, logs, métricas, implantações, alterações de configuração, alertas, propriedade e comportamento de produção recente”, diz Noam Levy, engenheiro fundador e CTO de campo da Groundcover. “Além de tentar uma RCA completa, seu valor imediato é destilar os sinais que realmente importam, reconstruir um cronograma claro de causa e efeito e ajudar os engenheiros a separar a correlação da provável causalidade. Depois que uma correção é implantada, os agentes também podem verificar a remediação comparando o comportamento pré e pós-correção, mas isso depende de amplo acesso a sinais de produção ricos e correlacionados e de um modelo de custo que não desencoraje a adoção ou a experimentação.”
Não apenas os incidentes são resolvidos com mais rapidez e menos estresse, mas a IA também pode liberar tempo do SRE para se concentrar no trabalho proativo e criar um plano de carreira para desenvolvedores juniores em funções de SRE. Quais Taraki, CTO da EDB Postgres AI, acrescenta: “A IA reduz o trabalho automatizando tarefas repetitivas enquanto acelera a resolução de incidentes por meio de copilotos que correlacionam sinais em sistemas distribuídos, permitindo que os SREs se concentrem mais em estratégias de resiliência, como engenharia de caos e análise de falhas”.
A IA pode ter impactos operacionais duradouros, especialmente para organizações que procuram implementar mais tecnologia de missão crítica e capacidades de IA. Dois benefícios de longo prazo da IA para SREs são a redução do número de chamadas de ponte necessárias para resposta a incidentes e o número de engenheiros necessários em “salas de guerra” para coordenar análises de causa raiz.
“Quando algo dá errado, a IA que orienta os SREs pode fazer a análise completa, chegar à causa raiz e realizar a correção”, afirma Spiros Xanthos, fundador e CEO da Resolve AI. “A IA também ajuda a evitar muitos escalonamentos e, quando são necessários escalonamentos, ela tem como alvo as pessoas certas da rede, da infraestrutura e das equipes de aplicativos. A IA para SREs centraliza a inteligência operacional, expõe o conhecimento tribal e pode orientar mais desenvolvedores juniores.”
Confiabilidade do agente de IA
Embora os recursos de IA tenham sido um fator positivo para ajudar os SREs a melhorar a confiabilidade do sistema, o crescimento dos geradores de código de IA, da codificação de vibração e do desenvolvimento orientado por especificações está aumentando suas cargas de trabalho. De acordo com um estudo, 41% de todo o código global é agora gerado por IA, e o Gartner prevê que 40% dos novos softwares de produção empresarial serão criados usando técnicas de vibe coding até 2028.
Mas a velocidade de codificação está criando novos problemas para SREs, já que as solicitações pull de IA têm 1,4 vezes mais problemas críticos e 1,7 vezes mais problemas importantes, de acordo com CodeRabbit. “O desenvolvimento assistido por IA criou uma velocidade sem precedentes de código atingindo a produção, expandindo a área de superfície, casos extremos e taxas de falha mais rapidamente do que as práticas tradicionais de SRE podem absorver”, diz Vinod Jayaraman, cofundador e CTO da NeuBird AI. “A velocidade de envio ultrapassou em muito a velocidade de compreensão do que quebra na produção. Para fechar esse ciclo, os SREs precisam de agentes corporativos que possam capturar o contexto de diagnóstico preciso, incluindo rastreamentos correlacionados, dependências de serviço e cronogramas de anomalias, e estruturá-los como informações acionáveis para os engenheiros e ferramentas de codificação de IA responsáveis pela correção.”
O número crescente de agentes de IA implantados na produção cria novos desafios. Os agentes de IA não são apenas códigos; eles têm vários pontos de falha. Eles são construídos usando modelos de linguagem, conectam-se a fontes proprietárias para obter contexto e integram-se a servidores Model Context Protocol para oferecer suporte a fluxos de trabalho mais complexos. As alterações são contínuas e não eventos de implantação, portanto, o trabalho do SRE de identificar a origem dos desvios de desempenho e precisão não é trivial.
“O SRE tradicional foi construído para sistemas que falham de maneira reproduzível, mas os agentes falham de maneira diferente e se desviam quando um provedor de modelo envia uma atualização, e o comportamento muda silenciosamente, sem nenhuma linha de base para comparação”, diz Mohammed Aboul-Magd, vice-presidente de produto da SandboxAQ. “A maioria das organizações não consegue sequer responder ao básico: quantos agentes estão em execução, a que têm acesso e se ainda estão a fazer aquilo para que foram criados.”
“Cada vez que um engenheiro sênior sai, ele leva consigo anos de padrões de falha aprendidos, e a próxima interrupção começa do zero”, acrescenta Ronak Desai, cofundador e CEO da Ciroos. “Usar IA para compor mudanças na memória operacional que, e cada incidente que seu sistema resolve, a IA aprende.”
Os SREs devem assumir um papel de liderança nas melhores práticas emergentes, incluindo a definição dos seus padrões para critérios de aceitação não funcionais de agentes de IA, práticas de observabilidade e critérios de prontidão para liberação. Os SREs devem atualizar os seus objetivos de nível de serviço (SLOs) e definir orçamentos de erros para agentes de IA em produção.
Ryan Downing, vice-presidente e CIO de soluções de negócios empresariais do Principal Financial Group, afirma: “SLOs padrão e orçamentos de erros fornecem proteção às equipes, e a IA ajuda a interpretar a telemetria em relação a esses alvos, reduzindo o ruído para que os engenheiros possam chegar ao problema real mais rapidamente e automatizar partes da correção antes que os clientes sejam afetados”.
IA aumenta o impacto comercial do SRE
A mudança mais dramática na engenharia de confiabilidade de sites é uma evolução do seu escopo de negócios. Os líderes de TI se concentram no tempo de atividade, no desempenho e na resolução de problemas, bem como na compreensão de seus impactos. Os líderes empresariais recorrerão à TI e aos SREs para identificar, determinar a causa raiz e remediar uma classe mais ampla de problemas, incluindo agentes de IA desonestos e os impactos da rápida implantação de novas capacidades de agente.
“Os agentes de IA estão entregando aos SREs categorias de problemas que nunca tiveram que resolver antes, especificamente falhas definidas em termos comerciais, não técnicos”, diz Blake Sherwood, distinto tecnólogo de IA e estratégia de plataforma da Smarsh. “A engenharia de confiabilidade tradicional é construída em torno de latência, erros e falhas, mas os agentes agora falham devido a etapas de conformidade ignoradas ou resultados que pareciam bons tecnicamente, mas estavam errados contextualmente. A maioria das equipes de SRE ainda não está preparada para isso.”
A questão é se os SREs com ferramentas aumentadas de IA podem acompanhar a velocidade, a complexidade e a urgência comercial da implantação de novos recursos de negócios de IA.
