30 de julho de 2026
Agente de IA Baseado em MCP e LLM para Avaliações Consistentes de Resiliência em Nuvem
Flavio Torres; Sandro Teixeira Pinto
DOI: 10.22167/2675-6528-202600813
Artigo elaborado pela ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege voltada à síntese e redação.
Resumo
A crescente complexidade das infraestruturas em nuvem impôs desafios à resiliência operacional, demandando a substituição de intervenções manuais por automações inteligentes. A investigação analisou o desempenho e a consistência de um agente de inteligência artificial (IA) baseado em Model Context Protocol (MCP) e Large Language Models (LLM) na avaliação automatizada de resiliência em ambientes de computação em nuvem. A metodologia envolveu a configuração de um agente de IA integrado ao ecossistema Kiro, utilizando conhecimentos persistentes em Markdown e Procedimentos Operacionais Padronizados (SOPs) estruturados em XML, seguidos de 80 execuções experimentais. Os testes compararam o comportamento dos modelos Claude Opus 4.5 e Claude Sonnet 4.5 diante de diferentes serviços de infraestrutura. Os resultados demonstraram que o Claude Opus 4.5 alcançou maior estabilidade e acurácia técnica, enquanto o Sonnet 4.5 apresentou-se como uma alternativa de baixo custo, embora com maior variabilidade. O uso de SOPs e XML foi crucial para mitigar o comportamento não-determinístico dos modelos, convertendo processos consultivos manuais em execuções lógicas de alta consistência. O estudo validou que a orquestração de agentes de IA por protocolos estruturados permitiu a automação de auditorias complexas com rigor metodológico, confirmando a viabilidade de transformar o papel do engenheiro de nuvem de executor operacional para arquiteto de sistemas autônomos.
Palavras-chave: Automação; Engenharia de Software; FinOps; Governança; Inteligência Artificial.
1. Introdução
A computação em nuvem tornou-se um pilar fundamental para a infraestrutura de empresas de software, proporcionando escalabilidade e flexibilidade sem precedentes. Essa transformação impulsionou uma adoção massiva, com 70% das organizações, conforme dados do International Data Group (IDG Foundry, 2025), acelerando sua migração para a nuvem. Observa-se um crescimento significativo, passando de 57% em 2023 para 63% em 2024, o que ressalta a centralidade das plataformas em nuvem nas operações de negócios contemporâneas.
Apesar dos benefícios evidentes, a garantia da resiliência operacional e da continuidade dos negócios em ambientes de nuvem dinâmicos permanece um desafio complexo, como destacado por Kesa (2023). Estratégias tradicionais de Recuperação de Desastres (DR) e Alta Disponibilidade (HA), embora cruciais, demandam planejamento, implementação e gerenciamento que consomem tempo, são suscetíveis a erros e, muitas vezes, não se alinham plenamente às necessidades reais do negócio (Luca, 2024). A intervenção manual em processos de recuperação, em particular, frequentemente não consegue atender aos objetivos de tempo de recuperação (RTO) e de ponto de recuperação (RPO) devido à complexidade inerente dos sistemas modernos (Kim, 2024).
Nesse cenário, os Modelos de Linguagem Grandes (LLMs), uma categoria de Inteligência Artificial (IA), surgem como uma tecnologia promissora. Treinados com vastos conjuntos de dados, os LLMs são capazes de compreender e gerar linguagem natural, além de outros tipos de conteúdo, executando uma ampla gama de tarefas. Sua arquitetura baseada em redes neurais do tipo transformador permite um processamento eficiente de sequências de palavras e a identificação de padrões complexos em textos (Stryker, 2025). Entretanto, um desafio significativo na aplicação de LLMs em contextos corporativos é o fenômeno do “knowledge cutoff”, ou data de corte de conhecimento. Conforme elucidado por Lazaridou et al. (2021), a dependência de bases de dados estáticas para o treinamento desses modelos pode gerar um desalinhamento temporal entre o conhecimento do modelo e a dinâmica constante do mercado. Assim, a capacidade de direcionar o comportamento dos LLMs para produzir resultados precisos, seguros e alinhados a políticas específicas representa uma complexidade considerável.
Para superar as limitações impostas pelo “knowledge cutoff” e otimizar a aplicabilidade dos LLMs em tarefas críticas, o Protocolo de Contexto de Modelo (MCP), introduzido em novembro de 2024, apresenta-se como uma solução inovadora. Esta técnica visa fornecer contexto explícito, como regras, princípios e dados, diretamente aos LLMs, permitindo que seu comportamento seja direcionado de forma mais precisa, especialmente em atividades complexas como o planejamento da resiliência em nuvem. Por meio do MCP, aplicações de IA como Claude, ChatGPT ou Kiro podem estabelecer conexões com diversas fontes de dados, ferramentas e fluxos de trabalho. Isso as capacita a acessar informações-chave e a executar tarefas de maneira padronizada, de forma análoga a como uma porta USB conecta dispositivos eletrônicos a sistemas externos, oferecendo uma interface padronizada para a integração de IA (Anthropic, 2025).
Organizações com um alto grau de maturidade em automação de infraestrutura demonstram a capacidade de validar continuamente as mudanças e a conformidade de resiliência, o que resulta em uma estabilidade operacional superior em comparação com abordagens manuais (Google Cloud, 2024). Dada a crescente complexidade das infraestruturas em nuvem e a imperatividade de avaliações de resiliência consistentes e eficientes, torna-se crucial converter as técnicas inovadoras de IA em valor tangível para o negócio. Esta investigação justifica-se pela necessidade premente de reduzir riscos operacionais e financeiros, promovendo uma robustez estrutural superior, um pilar fundamental para a engenharia de software moderna. Assim, o presente estudo tem como objetivo analisar o desempenho e a consistência de um agente de IA baseado em Modelos de Linguagem Grandes (LLM) e no Protocolo de Contexto de Modelo (MCP) na avaliação automatizada de resiliência em ambientes de computação em nuvem.
2. Material e Métodos
A presente pesquisa caracterizou-se como um estudo de natureza aplicada, visando solucionar um problema prático na gestão de infraestrutura em nuvem. Adotou-se uma abordagem metodológica mista, combinando análises quantitativas e qualitativas. O delineamento da pesquisa foi um Estudo de Caso, conforme Gil (2008), adequado para aprofundar o conhecimento sobre o objeto de estudo por meio da análise detalhada de um sistema específico.
O desenvolvimento do sistema foi realizado de forma estruturada, iniciando-se com o levantamento de requisitos e a modelagem. Mapearam-se funcionalidades essenciais e requisitos operacionais, definindo um cenário representativo de uma aplicação corporativa de larga escala hospedada em nuvem pública, sem configuração de Recuperação de Desastres (DR). A estrutura lógica da aplicação foi elaborada, detalhando a organização dos dados e os fluxos de processamento dos componentes de infraestrutura.
A infraestrutura simulada incluiu servidores virtuais, balanceamento de carga, banco de dados relacional, cache em memória, computação “serverless”, cluster de contêineres e armazenamento de objetos estáticos. Para popular o ambiente, inseriram-se 100.000 produtos do conjunto de dados público da Olist (2018) no banco de dados. O cenário foi projetado para que falhas em componentes da infraestrutura na região primária pudessem comprometer o funcionamento dos serviços essenciais da loja virtual.
A definição da base de referência envolveu a análise da infraestrutura por um agente de IA, simulando a tarefa de um Administrador de Sistemas ou Site Reliability Engineer (SRE). Este agente foi encarregado de identificar os requisitos de continuidade do negócio e o plano de DR, com a especificação dos objetivos de tempo de recuperação (RTO) e de ponto de recuperação (RPO) para cada serviço. As definições de resiliência para o negócio foram estabelecidas com base em uma Análise de Impacto de Negócio (BIA).
A implementação do sistema utilizou o ambiente Kiro na versão 1.28.1, com acesso aos modelos de linguagem Claude Sonnet 4.5 e Claude Opus 4.5, ambos da Anthropic. Desenvolveu-se um agente de IA especializado em resiliência, configurado com o Protocolo de Contexto de Modelo (MCP) mcp-proxy-for-aws v1.1.6. Este protocolo permitiu ao agente acessar uma base de documentação de melhores práticas dos serviços da Amazon Web Services (AWS), integrando o conhecimento externo necessário para superar o “knowledge cutoff” dos modelos.
Para direcionar o comportamento dos LLMs e garantir a consistência das avaliações, empregaram-se “skills” e Procedimentos Operacionais Padronizados (SOPs). As “skills” consistiram em conhecimentos persistentes sobre o ambiente de trabalho, estruturados em arquivos Markdown, servindo como base de referência. Os SOPs, definidos em formato XML, estabeleceram o fluxo operacional esperado, descrevendo passo a passo como o agente deveria conduzir a avaliação de resiliência. Essa estruturação visou mitigar os riscos de alucinações ou desvios de protocolo técnico, orientando o raciocínio do modelo e reduzindo a variabilidade dos resultados entre as execuções. A utilização de “tags” estruturadas em XML facilitou a interpretação de prompts complexos, permitindo ao modelo distinguir claramente entre parâmetros de entrada, restrições operacionais e formatos de saída esperados (Claude, 2026).
A fase de testes e validação envolveu 80 experimentos, intercalados entre os modelos Claude Sonnet 4.5 e Claude Opus 4.5, para cada tipo de serviço avaliado (Servidores Virtuais, SGBD, Contêineres e Computação Serverless). A coleta de dados foi híbrida, abrangendo aspectos quantitativos (acurácia, tempo de execução, consumo de créditos operacionais) e qualitativos (consistência técnica, aderência às práticas de resiliência). O desempenho foi mensurado por um “scorecard” que avaliou a execução, análise e categorização. Para validar a acurácia, os serviços de teste foram configurados para atender a todos os requisitos, estabelecendo um gabarito de pontuação máxima. Registrou-se o consumo de créditos operacionais (FinOps). Os dados foram organizados para apresentar o resultado agregado por modelo e serviço, com a graduação convertida em percentual de acerto normalizado. Após a análise, o agente gerou um relatório em formato HTML, seguindo as instruções do SOP, para facilitar a interpretação visual dos resultados.
3. Resultados e Discussão
A avaliação automatizada de resiliência em ambientes de computação em nuvem, utilizando o ecossistema Kiro em conjunto com um agente de inteligência artificial baseado em Model Context Protocol (MCP) e Large Language Models (LLM), demonstrou capacidade significativa para simplificar e otimizar tarefas tradicionalmente executadas por administradores de sistemas. A pesquisa validou que o agente foi capaz de identificar serviços em escopo em um provedor de nuvem pública e verificar sua aderência às melhores práticas de resiliência da organização, respondendo a comandos descritivos em linguagem natural. As 80 execuções experimentais realizadas resultaram em respostas e relatórios que foram consistentemente plausíveis e tecnicamente acurados, evidenciando a robustez da abordagem proposta.
A natureza inerentemente probabilística dos modelos de linguagem, que pode levar a variações nas respostas mesmo sob condições idênticas, foi um aspecto crucial a ser gerenciado para garantir a consistência das avaliações. Para mitigar esse comportamento não-determinístico, foram implementados dois mecanismos complementares: o direcionamento por “skills” e os Procedimentos Operacionais Padronizados (SOPs). As “skills” forneceram ao Kiro e aos LLMs um conjunto de conhecimentos persistentes sobre o ambiente de trabalho, estruturados em arquivos Markdown, que serviram como uma base de referência estável e atualizada.
Os SOPs, por sua vez, foram definidos em XML e estabeleceram o fluxo operacional esperado, descrevendo passo a passo como o agente deveria conduzir a avaliação de resiliência. Essa estruturação atuou como um limitador de escopo, garantindo que o agente seguisse uma sequência lógica de verificação que incluía descoberta, análise e pontuação. Essa abordagem foi fundamental para mitigar os riscos de alucinações ou desvios de protocolo técnico, assegurando que o raciocínio do modelo fosse orientado e a variabilidade dos resultados entre as execuções fosse reduzida, conforme destacado pela própria documentação do Claude (2026).
A utilização de “tags” estruturadas em XML foi particularmente eficaz para que o modelo interpretasse corretamente prompts complexos, especialmente quando instruções, contexto, exemplos e variáveis eram apresentados simultaneamente. Ao encapsular cada elemento em sua própria “tag”, o prompt tornou-se mais claro, diminuindo a chance de o modelo confundir partes distintas da solicitação. Essa estruturação hierárquica permitiu ao LLM distinguir claramente entre parâmetros de entrada, restrições operacionais e formatos de saída esperados, justificando a escolha do XML para a configuração das “skills”.
Dessa forma, a necessidade de repetir requisitos de resiliência a cada interação foi eliminada, pois as “skills” forneceram o embasamento técnico necessário, enquanto o SOP garantiu o rigor metodológico e a aderência às práticas organizacionais durante a classificação. Por exemplo, ao receber um prompt para executar uma análise de resiliência em uma conta específica, o agente executou todo o fluxo de descoberta, análise e categorização conforme definido nos arquivos de “skill” e SOP, gerando resultados consistentes e alinhados aos requisitos de negócio.
Análise dos Resultados
O experimento demonstrou uma acurácia agregada de 93,6% na capacidade do agente de IA (LLM + MCP) de classificar corretamente os resultados dentro do cartão de pontuação de resiliência. Ao desmembrar os dados por modelo e serviço, observaram-se distinções críticas de performance e confiabilidade entre o Claude Opus 4.5 e o Claude Sonnet 4.5. A validação da acurácia do agente foi realizada confrontando os resultados com um gabarito de pontuação máxima, uma vez que todos os serviços de teste no ambiente da nuvem pública foram propositalmente configurados para atender a todos os requisitos definidos.
O modelo Claude Opus 4.5 apresentou o desempenho mais robusto, com uma taxa de acerto média de 95,5% em todas as execuções. Notavelmente, alcançou 100% de precisão nos serviços de Contêiner e Serverless, indicando sua alta confiabilidade para esses tipos de infraestrutura. Para o serviço SGBD, a acurácia média foi de 98,2%, e para o Servidor, de 84%. Além da eficácia, o modelo demonstrou alta eficiência temporal, com tempos médios de execução significativamente menores.
Os tempos médios de execução do Claude Opus 4.5 variaram entre 161 segundos (aproximadamente 2,7 minutos) para o serviço SGBD e 238 segundos (aproximadamente 3,9 minutos) para o serviço Servidor. O desvio padrão nas métricas de tempo para o Opus 4.5 foi consistentemente baixo, com um máximo de 25 segundos para o serviço Serverless, confirmando uma previsibilidade operacional superior. Essa estabilidade é essencial para processos de resiliência em tempo real, onde a rapidez e a consistência na resposta a incidentes são fatores críticos para a continuidade dos negócios.
Em contrapartida, o Claude Sonnet 4.5, embora mais econômico, consumindo em média 42% menos créditos operacionais que o Opus 4.5, apresentou uma acurácia inferior, com média de 89,2% em todas as execuções. Este modelo foi o único a registrar ocorrências de falhas de categorização, indicadas como “N/A”, especialmente nos serviços Servidor Virtual e Contêiner, onde a acurácia média foi de 77,72% e 90,74%, respectivamente, e de 88,57% para Serverless.
A latência do Claude Sonnet 4.5 foi significativamente maior, com tempos médios de execução variando de 330 segundos (aproximadamente 5,5 minutos) para o serviço SGBD a 545 segundos (aproximadamente 9 minutos) para o serviço Servidor. Além disso, o modelo apresentou um desvio padrão elevado nos tempos de execução, chegando a 127 segundos para o serviço Servidor. Essa alta variabilidade indica uma inconsistência rítmica no processamento das tarefas via MCP, o que pode ser um fator limitante em cenários que exigem respostas rápidas e previsíveis.
A análise do consumo de créditos operacionais também revelou diferenças notáveis. O Claude Opus 4.5 apresentou uma média de 4,988 créditos para SGBD, 7,388 para Contêiner, 9,023 para Servidor e 6,513 para Serverless. Em contraste, o Claude Sonnet 4.5 consumiu uma média de 3,59 créditos para SGBD, 4,681 para Contêiner, 5,467 para Servidor e 4,411 para Serverless. Embora o Sonnet 4.5 seja mais eficiente em termos de custo, essa economia vem acompanhada de uma menor acurácia e maior variabilidade no tempo de execução, o que deve ser considerado na escolha do modelo para diferentes aplicações.
Os dados coletados indicam que o Claude Opus 4.5 é a escolha preferencial para arquiteturas de nuvem críticas que exigem precisão absoluta, consistência e rapidez na resposta a incidentes de resiliência. Sua performance superior em acurácia e estabilidade temporal o torna adequado para ambientes de produção onde a tolerância a falhas é mínima. A previsibilidade de suas execuções, com baixo desvio padrão, é um atributo valioso para a automação de processos de missão crítica.
Por outro lado, o Claude Sonnet 4.5 posiciona-se como uma alternativa viável para cenários de FinOps orientados à redução extrema de custos, sendo aplicável a ambientes de desenvolvimento ou homologação onde a organização pode tolerar uma maior variabilidade nos resultados. Sua menor demanda por créditos o torna atraente para testes, prototipagem e ambientes não-produtivos, onde a prioridade é a otimização de custos em detrimento de uma precisão e consistência absolutas.
A integração de instruções XML e SOPs foi um fator determinante para circunscrever a natureza não-determinística dos modelos de linguagem, contribuindo para a organização e implementação da solução proposta. Essa abordagem evidenciou uma transição no papel do administrador de sistemas e/ou especialista em nuvem, onde a execução manual de comandos cede lugar à arquitetura e auditoria de sistemas inteligentes. A capacidade de orquestrar agentes de IA por meio de protocolos estruturados permitiu a automação de auditorias complexas com rigor metodológico, confirmando a viabilidade de transformar o papel do engenheiro de nuvem de executor operacional para arquiteto de sistemas autônomos.
4. Conclusão
O presente estudo analisou o desempenho e a consistência de um agente de inteligência artificial, baseado em Modelos de Linguagem Grandes (LLM) e no Protocolo de Contexto de Modelo (MCP), na avaliação automatizada de resiliência em ambientes de computação em nuvem. Verificou-se que o agente foi capaz de identificar serviços e verificar sua aderência às melhores práticas de resiliência organizacional, gerando respostas e relatórios tecnicamente acurados em 80 execuções experimentais. A natureza não-determinística dos LLMs foi mitigada com sucesso pela implementação de “skills” estruturadas em Markdown e Procedimentos Operacionais Padronizados (SOPs) definidos em XML, que direcionaram o raciocínio do modelo e reduziram a variabilidade dos resultados. A utilização de “tags” XML mostrou-se crucial para a interpretação precisa de prompts complexos, garantindo que o agente seguisse um fluxo operacional lógico de descoberta, análise e pontuação.
Na comparação entre os modelos, o Claude Opus 4.5 demonstrou maior estabilidade e acurácia técnica, com uma taxa de acerto média de 95,5% e tempos de execução mais eficientes e previsíveis, sendo a escolha preferencial para arquiteturas críticas. Em contraste, o Claude Sonnet 4.5 apresentou-se como uma alternativa de menor custo, consumindo em média 42% menos créditos operacionais, mas com acurácia inferior (89,2%) e maior variabilidade temporal, indicando sua aplicabilidade em cenários de FinOps ou ambientes não-produtivos. A principal contribuição deste estudo reside na validação da orquestração de agentes de IA por protocolos estruturados, o que permitiu a automação de auditorias complexas com rigor metodológico e confirmou a viabilidade de transformar o papel do engenheiro de nuvem de executor operacional para arquiteto de sistemas autônomos. Contudo, o estudo apresenta limitações relacionadas ao escopo dos serviços avaliados e à dependência da qualidade das instruções fornecidas ao agente. Para trabalhos futuros, recomenda-se expandir o conjunto de cenários testados, integrar novas métricas de confiabilidade e explorar agentes agnósticos ao LLM, ampliando o potencial de automação em operações de nuvens públicas.
Referências Bibliográficas
Anthropic. 2026. What is the Model Context Protocol (MCP)? Disponível em: <https://modelcontextprotocol.io/docs/getting-started/intro>. Acesso em: 6 jan. 2026.
Claude. 2026. Structure prompts with XML tags. Disponível em: <https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-prompting-best-practices#structure-prompts-with-xml-tags>. Acesso em: 22 mar. 2026.
Gil, A.C. 2008. Métodos e Técnicas de Pesquisa Social. 6ed. Atlas, São Paulo, SP, Brasil.
Google Cloud. 2024. Accelerate State of DevOps Report 2024. DORA (DevOps Research and Assessment). Disponível em: <https://dora.dev/research/2024/dora-report/2024-dora-accelerate-state-of-devops-report.pdf>. Acesso em: 10 jan. 2026.
IDG Foundry. 2026. AI Dominates the Cloud Conversation Cloud Computing Survey. New York. Disponível em: <https://resources.foundryco.com/download/cloud-computing-executive-summary>. Acesso em: 5 jan. 2026.
Kesa, D. M. 2023. Ensuring resilience: Integrating IT disaster recovery planning and business continuity for sustainable information technology operations. World Journal of Advanced Research and Reviews, 18(3): 970–992.
Kim, J.-B.; Choi, J.-B.; Jung, E.-S. 2024. Design and Implementation of an Automated Disaster-Recovery System for a Kubernetes Cluster Using LSTM. Applied Sciences 14(9): 3914.
Lazaridou, A. et al. 2021. Mind the Gap: Assessing Temporal Generalization in Neural Language Models. Disponível em: <https://arxiv.org/abs/2102.01951>. Acesso em: 26 out. 2025.
Luca. C. 2024. High Availability, Fault Tolerance, and Disaster Recovery Strategies. Disponível em: <https://www.researchgate.net/publication/388527642_High_Availability_Fault_Tolerance_and_Disaster_Recovery_Strategies>, Acesso em: 20 abr. 2026.
Olist; Sionek, A. 2018. Brazilian E-Commerce Public Dataset by Olist. Disponível em: <https://www.kaggle.com/dsv/195341>. Acesso em: 20 abr. 2026.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

