07 de outubro de 2026
Predição de resistência à ceftazidima-avibactam e suscetibilidade aos carbapenêmicos em variantes KPC
Predição de Resistência à Ceftazidima-avibactam e Suscetibilidade aos Carbapenêmicos em Variantes Kpc
Jesus Giovani Mamani Pariona; Henrique Raymundo Gioia
DOI: 10.22167/2675-6528-202603032
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A crescente disseminação global de variantes da enzima KPC associadas à resistência à ceftazidima-avibactam (CZA) representou uma ameaça crítica à terapêutica antimicrobiana, especialmente diante da possível restauração da suscetibilidade aos carbapenêmicos. Este estudo teve como objetivo desenvolver e validar modelos preditivos baseados em aprendizado de máquina capazes de inferir, a partir de mutações no gene blaKPC, os fenótipos de resistência à CZA e suscetibilidade aos carbapenêmicos. Para isso, foi construída uma base de dados com 281 variantes, das quais 162 possuíam validação fenotípica e foram utilizadas como conjunto de treinamento. Empregou-se uma abordagem genômica completa, incluindo substituições, inserções e deleções, com codificação One-Hot e modelagem supervisionada utilizando algoritmos como Random Forest, Support Vector Machines (SVM), Regressão Logística e k-Nearest Neighbors (KNN), validados por cross-validation e balanceamento com SMOTE. Os resultados demonstraram alto desempenho preditivo para o modelo SVM, com F1-score superior a 96% para resistência à CZA e aproximadamente 82% para carbapenêmicos, evidenciando a relevância de eventos estruturais (indels) na função enzimática. Observou-se um padrão consistente de trade-off evolutivo, no qual a resistência à CZA esteve frequentemente associada à perda de atividade contra carbapenêmicos. Marcadores moleculares como D179Y e inserções no loop Omega não foram identificados como determinantes críticos, sendo estatisticamente validados por teste de Fisher com correção de Bonferroni. Concluiu-se que o aprendizado de máquina permitiu prever fenótipos complexos com alta acurácia, oferecendo uma ferramenta promissora para vigilância genômica e apoio à decisão clínica em microbiologia.
Palavras-chave: aprendizado de máquina; blaKPC; mutações estruturais; resistência antimicrobiana; vigilância genômica.
1. Introdução
A disseminação global de isolados de Klebsiella pneumoniae portadores de novas variantes do gene blaKPC, que conferem resistência à ceftazidima-avibactam (CZA), representa uma ameaça crescente à terapia antimicrobiana e à saúde pública global (Ding et al., 2023).
Desde sua introdução, a CZA tem sido uma das poucas combinações de beta-lactâmico/beta-lactamase inibidor capazes de tratar eficazmente infecções causadas por produtores de carbapenemase do tipo K. pneumoniae (KPC). No entanto, o número crescente de relatos de variantes KPC resistentes à CZA evidencia o rápido potencial adaptativo desse patógeno sob pressão antibiótica (Niu et al., 2020).
Até o momento, mais de 250 variantes clínicas de KPC foram documentadas, das quais 161 foram fenotipicamente caracterizadas como resistentes à CZA (Ding et al., 2023; Niu et al., 2020). Notavelmente, aproximadamente 107 (58,5%) dessas variantes KPC resistentes à CZA apresentam atividade semelhante à de beta-lactamases de espectro estendido (ESBL), restaurando a suscetibilidade aos carbapenêmicos e sugerindo a possível reintrodução desses agentes como alternativas terapêuticas (Taracila et al., 2022).
Contudo, muitas variantes de KPC permanecem não caracterizadas ou exibem padrões de suscetibilidade imprevisíveis, o que dificulta a tomada de decisão clínica e os esforços de vigilância. Estudos anteriores demonstraram a eficácia in vitro e in vivo dos carbapenêmicos contra produtores de variantes KPC que exibem resistência fenotípica à CZA, mas suscetibilidade restaurada aos carbapenêmicos (Pariona et al., 2025). Desfechos terapêuticos bem-sucedidos foram relatados em pacientes infectados por tais variantes após tratamento com carbapenêmicos (Giddins et al., 2018; Mueller et al., 2019; Oliva et al., 2023; Shields et al., 2017; Vásquez-Ponce et al., 2023).
Em contraste, a resistência à CZA, impulsionada por mutações específicas na enzima KPC, tem sido associada à falha terapêutica e ao aumento das taxas de mortalidade (Ding et al., 2022; Nicola et al., 2022; Shi et al., 2022; Sun et al., 2020). Essa complexidade destaca um fenômeno de trade-off evolutivo, onde a aquisição de resistência a novos inibidores frequentemente ocorre em detrimento da atividade carbapenemase original, restaurando a suscetibilidade a essa classe de antibióticos (Arcari et al., 2022; Barnes et al., 2017; Ding et al., 2022; Giddins et al., 2018; Kim et al., 2022; Mueller et al., 2019; Nicola et al., 2022; Oliva et al., 2023; Pariona et al., 2025; Shi et al., 2022; Shields et al., 2017; Sun et al., 2020; Taracila et al., 2022; Vásquez-Ponce et al., 2023).
Diante dessa complexidade, a predição do fenótipo de resistência à CZA e aos carbapenêmicos, com base em mutações no gene blaKPC, representa uma necessidade crítica para a vigilância da resistência antimicrobiana e o controle de infecções. O aprendizado de máquina (ML) oferece uma abordagem poderosa e orientada por dados para modelar a relação entre a variação genética e os fenótipos de resistência antimicrobiana (Kim et al., 2022).
Assim, aprimorar a compreensão dos mecanismos de resistência, melhorar a detecção precoce de variantes emergentes e apoiar a terapia antimicrobiana guiada por precisão na microbiologia clínica são aspectos fundamentais para combater a ameaça das superbactérias. Neste estudo, buscamos desenvolver um modelo preditivo robusto baseado em aprendizado de máquina, capaz de classificar a resistência à CZA e aos carbapenêmicos em produtores de variantes KPC com base em suas mutações de aminoácidos.
2. Material e Métodos
O presente estudo caracterizou-se como uma pesquisa de natureza computacional, com abordagem metodológica quantitativa e exploratória, focada no desenvolvimento de modelos preditivos. O objetivo foi inferir os fenótipos de resistência à ceftazidima-avibactam (CZA) e suscetibilidade aos carbapenêmicos em variantes da enzima KPC, a partir de suas mutações no gene blaKPC. A pesquisa foi conduzida integralmente por meio de análise de dados secundários, disponíveis publicamente.
A base de dados genômica foi construída a partir da recuperação de sequências de proteínas variantes da Klebsiella pneumoniae carbapenemase (KPC) do Pathogen Detection Reference Gene Database do National Center for Biotechnology Information (NCBI), acessado em 25 de janeiro de 2026. Foram selecionadas exclusivamente sequências de proteínas completas e de alta qualidade, abrangendo as variantes clínicas de KPC-2 a KPC-287. Realizou-se curadoria manual, cruzando cada variante com dados experimentais validados da literatura científica e do repositório Beta-Lactamase Data Resources (BLDB), com foco na predição de resistência à CZA e suscetibilidade aos carbapenêmicos.
Para o treinamento supervisionado dos algoritmos, estabeleceu-se um protocolo de reclassificação binária baseado no comportamento fenotípico reportado. Para o modelo preditivo de resistência à CZA, variantes descritas como “Resistentes a Inibidores” foram classificadas como “Resistente”, e as com perfil clássico de carbapenemase como “Sensível”. Para o modelo de suscetibilidade aos carbapenêmicos, variantes com perda de atividade hidrolítica foram categorizadas como “Suscetíveis”, e as que conservaram a capacidade de hidrólise como “Resistentes”. Variantes com perfis fenotípicos inconclusivos ou não documentados foram segregadas para uma etapa posterior de predição cega.
A engenharia de atributos utilizou uma abordagem genômica completa para converter a informação biológica em vetores numéricos processáveis. Realizou-se o alinhamento global par-a-par das sequências coletadas contra a variante KPC-2, utilizada como referência do tipo selvagem, empregando o algoritmo de Needleman-Wunsch, implementado na biblioteca Biopython. Utilizou-se a matriz de substituição BLOSUM62 e parâmetros de penalidade ajustados (abertura de gap = -10; extensão = -0.5). Um algoritmo de mapeamento dinâmico de coordenadas extraiu substituições de aminoácidos em posições conservadas, eventos de deleção e eventos de inserção. A transformação final dos dados empregou a técnica de One-Hot Encoding, gerando uma matriz esparsa de alta dimensionalidade. A variante KPC-2 foi ponderada no conjunto de treinamento como arquétipo de sensibilidade a CZA e resistência a carbapenêmicos, calibrando o intercepto dos modelos.
A estratégia de modelagem baseou-se em um esquema de treinamento e validação supervisionada, utilizando o conjunto de dados com fenotipagem validada (Ground Truth). A avaliação de desempenho de todas as arquiteturas foi conduzida via validação cruzada estratificada de 5 particionamentos (5-fold Stratified Cross-Validation). A seleção de hiperparâmetros foi realizada por Grid Search. O tratamento do desbalanceamento de classes foi ajustado à natureza de cada algoritmo, com `class_weight=’balanced’` para Regressão Logística (associado a técnicas de regularização L1 e L2) e supramostragem sintética (SMOTE) para Random Forest, Support Vector Machines (SVM) e k-Nearest Neighbors (KNN).
Foram avaliados comparativamente quatro algoritmos de aprendizado de máquina: Random Forest, Support Vector Machines (SVM), Regressão Logística e k-Nearest Neighbors (KNN). A escolha dos modelos finais para cada desfecho clínico (resistência a CZA e suscetibilidade a carbapenêmicos) foi determinada pelo F1-Score médio obtido na validação cruzada, visando garantir o equilíbrio entre precisão e sensibilidade (recall).
Todo o processamento de dados, alinhamento de sequências e modelagem preditiva foram conduzidos em linguagem de programação Python (versão 3.10+), utilizando o ambiente de desenvolvimento Google Colab. As análises basearam-se nas bibliotecas Scikit-learn para algoritmos de aprendizado de máquina, Biopython para manipulação de sequências biológicas, Pandas para estruturação de dados e Imbalanced-learn para as técnicas de balanceamento de classes. Para assegurar a reprodutibilidade estrita dos experimentos e da amostragem sintética (SMOTE), fixou-se uma semente aleatória (random seed) de valor 42 em todas as etapas estocásticas.
A validação estatística dos resultados baseou-se na análise da média e desvio padrão das métricas de desempenho (Acurácia, Precisão, Revocação e F1-Score) obtidas através das 5 dobras da validação cruzada. Para validar estatisticamente as associações entre marcadores moleculares (mutações pontuais e indels) e os desfechos clínicos de resistência, conduziu-se um estudo de enriquecimento mutacional univariado. Utilizou-se o Teste Exato de Fisher para calcular a razão de chances (Odds Ratio – OR) e a significância estatística (P-valor), com correção de Bonferroni para ajustar os valores de P e controlar a taxa de falsos positivos (Family-Wise Error Rate). Consideraram-se estatisticamente significativos apenas os marcadores que apresentaram um P-valor ajustado < 0.05. As análises foram processadas utilizando a biblioteca SciPy (v.1.10) em ambiente Python.
A pesquisa foi conduzida exclusivamente por meio de análise computacional de dados públicos (estudo *in silico*), não envolvendo diretamente seres humanos, animais ou intervenções ambientais. Dessa forma, não foi necessária a submissão a comitê de ética. O estudo não esteve associado a coleta de dados em campo, sendo caracterizado como análise de dados secundários de acesso público. As sequências e dados fenotípicos utilizados encontram-se disponíveis publicamente no banco NCBI Pathogen Detection Reference Gene Database. Os scripts utilizados para pré-processamento, treinamento dos modelos e interpretação das variáveis serão disponibilizados mediante solicitação razoável ao autor correspondente.
3. Resultados e Discussão
O presente estudo consolidou uma base de dados genômica abrangente, totalizando 281 variantes distintas da família Klebsiella pneumoniae carbapenemase (KPC), recuperadas e processadas a partir de repositórios públicos. Deste universo total, o rigoroso processo de curadoria manual permitiu a estratificação das amostras em dois grupos fundamentais baseados na disponibilidade de evidências clínicas. Um conjunto consolidado de 162 variantes, representando 57,7% do total, possuía perfil fenotípico experimentalmente conhecido e validado na literatura, constituindo o padrão ouro para o treinamento dos modelos preditivos.
Adicionalmente, um contingente significativo de 119 variantes, correspondendo a 42,3%, cujos fenótipos permaneciam desconhecidos, ambíguos ou não caracterizados, foi segregado para compor o conjunto de predição de risco. Este cenário reflete a lacuna global na caracterização fenotípica de variantes emergentes, conforme descrito por Ding et al. (2023) e Vásquez-Ponce et al. (2023). A análise descritiva da distribuição de frequências no conjunto validado (n=162) revelou padrões distintos de pressão seletiva para cada classe de antibiótico avaliada, evidenciando a complexidade da evolução da resistência.
No que tange ao desfecho clínico de resistência à combinação ceftazidima-avibactam (CZA), observou-se uma predominância massiva de variantes resistentes no cenário global atual. Das 162 variantes validadas, 141 amostras, ou aproximadamente 87,4% do conjunto de treinamento, apresentaram o fenótipo de resistência a CZA. Este achado corrobora evidências de que a pressão seletiva exercida por novos inibidores favorece rapidamente variantes adaptadas, conforme apontado por Giddins et al. (2018) e Niu et al. (2020).
Em contraste, o grupo de variantes que manteve a sensibilidade a este inibidor representou uma classe minoritária restrita, contabilizando apenas 21 variantes, ou 13% do total. Este desequilíbrio severo entre as classes destacou a resistência a CZA como o fenótipo dominante na evolução recente da família KPC, exigindo a aplicação de técnicas de balanceamento de dados para o treinamento dos modelos de aprendizado de máquina, a fim de evitar vieses e garantir a robustez das predições.
Simultaneamente, a caracterização do perfil de suscetibilidade aos carbapenêmicos revelou um cenário epidemiológico mais heterogêneo e equilibrado. Para este desfecho, identificou-se que a maioria das variantes analisadas evoluiu para uma perda de função hidrolítica contra carbapenêmicos; especificamente, 109 variantes foram classificadas como suscetíveis a esta classe de antibióticos, representando 67,3% do conjunto de dados. Este achado alinha-se ao conceito de custo de aptidão associado à adaptação a inibidores, um fenômeno amplamente discutido na literatura.
Por outro lado, a resistência clássica aos carbapenêmicos foi conservada em 46 variantes, correspondendo a 28,4% do conjunto de dados. Diferentemente do cenário observado para a CZA, a distribuição mais balanceada neste desfecho sugere uma dinâmica evolutiva onde a aquisição de novos mecanismos de resistência a inibidores ocorre frequentemente em detrimento da atividade carbapenemase original. Este fenômeno é amplamente descrito como trade-off evolutivo em beta-lactamases (Arcari et al., 2022; Barnes et al., 2017; Ding et al., 2022; Giddins et al., 2018; Kim et al., 2022; Mueller et al., 2019; Nicola et al., 2022; Oliva et al., 2023; Pariona et al., 2025; Shi et al., 2022; Shields et al., 2017; Sun et al., 2020; Taracila et al., 2022; Vásquez-Ponce et al., 2023).
Desempenho dos modelos preditivos e validação
O experimento de benchmarking computacional, conduzido sob validação cruzada estratificada (5-Fold Stratified Cross-Validation) e otimização exaustiva de hiperparâmetros (via GridSearchCV), demonstrou que a transição para uma representação genômica completa, incluindo substituições, inserções e deleções (indels), foi determinante para o alcance de métricas elevadas de desempenho em ambos os desfechos fenotípicos. A inclusão desses eventos estruturais permitiu aos modelos capturar a complexidade das alterações na enzima KPC.
Para a predição da resistência à ceftazidima-avibactam (CZA), o algoritmo Support Vector Machine (SVM) com kernel RBF consolidou-se como a arquitetura de melhor desempenho global. Este modelo atingiu um F1-Score médio de 95,90% ± 1,75%, com uma área sob a curva ROC (ROC-AUC) de 92,04% ± 6,28%. A Regressão Logística, ajustada com regularização L1 (Lasso, C = 1) e balanceamento via class_weight=’balanced’, apresentou um desempenho altamente competitivo, alcançando um F1-Score de 94,55% ± 1,67% e ROC-AUC de 73,83% ± 9,70%.
A superioridade do SVM e da Regressão Logística foi evidente em comparação com os modelos baseados em árvores de decisão, como Random Forest, que obteve um F1-Score de 91,35% ± 3,08%, e o k-Nearest Neighbors (KNN), com F1-Score de 83,67% ± 6,60%. Esses achados confirmam que a resistência ao CZA se estrutura sob fronteiras de decisão complexas, onde o kernel RBF do SVM ofereceu a melhor capacidade de delimitação espacial, indicando sua robustez na identificação de padrões de resistência.
Para o desfecho de suscetibilidade aos carbapenêmicos, que representa um desafio biológico superior devido ao trade-off funcional entre a perda de atividade carbapenemase e o ganho de resistência ao avibactam, o algoritmo SVM (RBF) emergiu novamente como a melhor arquitetura. Ele atingiu um F1-Score de 82,71% ± 4,69% e ROC-AUC de 79,56% ± 5,15%, demonstrando sua eficácia na predição de fenótipos complexos.
A Regressão Logística, otimizada com regularização L2 (C = 50), obteve o segundo melhor F1-Score médio de 79,50% ± 6,15%, mantendo-se equivalente ao Random Forest, que registrou um F1-Score de 79,41% ± 6,65%. Ambos superaram expressivamente o KNN, que apresentou um F1-Score de 68,67% ± 8,19%. Notadamente, no desfecho de carbapenêmicos, a Regressão Logística alcançou a maior capacidade de discriminação global entre todas as arquiteturas, registrando uma ROC-AUC de 81,73% ± 5,62%, superando o SVM (79,56%), Random Forest (77,44%) e KNN (72,96%).
Predição fenotípica, confiabilidade da inferência em variantes não caracterizadas e análise de importância dos atributos
A aplicação dos modelos otimizados às variantes de KPC sem fenótipo reportado demonstrou um padrão robusto de confiabilidade na inferência, com a maioria das predições enquadrando-se em intervalos de probabilidade de alta confiança. Para o modelo de ceftazidima-avibactam (CZA), a inferência apresentou uma estabilidade excepcional, com 77,1% (91 variantes) atingindo o patamar de Alta Confiança (probabilidade de classe >80%).
Adicionalmente, 22,0% (26 variantes) situaram-se na faixa de Média Confiança (60-80%), e a zona cinza ou indeterminada (80%), 36,4% (43 variantes) apresentaram Média Confiança (60-80%) e 13,6% (16 variantes) permaneceram na zona cinza ( 1,30). Os marcadores que apresentaram maior tendência de associação foram as substituições Pos_103_P e Pos_103_R para o desfecho de resistência à ceftazidima-avibactam (CZA), e Pos_178_D para a suscetibilidade aos carbapenêmicos.
Entretanto, mesmo esses candidatos permaneceram acima do limiar de significância estatística após a correção para múltiplas comparações (p_adj > 0,05). Esse padrão era esperado considerando a elevada diversidade alélica da base de dados analisada. A maioria das variantes de KPC apresentou alterações moleculares pouco recorrentes, com baixa frequência individual de cada substituição ou indel, reduzindo o poder estatístico para identificar associações isoladas entre um único marcador e o fenótipo.
Dessa forma, embora algumas posições apresentassem tendências de associação, a distribuição heterogênea das alterações impediu que um efeito individual alcançasse significância estatística após o ajuste múltiplo. Essa limitação dos testes univariados reforça a necessidade de abordagens multivariadas, como os modelos supervisionados de aprendizado de máquina, que conseguem integrar simultaneamente múltiplas alterações da sequência proteica e capturar padrões combinatórios e possíveis interações epistáticas entre diferentes resíduos da enzima KPC, fornecendo uma visão mais completa dos mecanismos de resistência.
Em síntese, os resultados deste estudo demonstram que o aprendizado de máquina, particularmente o algoritmo Support Vector Machine, é altamente eficaz na predição dos fenótipos de resistência à ceftazidima-avibactam e suscetibilidade aos carbapenêmicos em variantes KPC, com base em mutações no gene blaKPC. A análise de importância dos atributos revelou que eventos estruturais, como inserções e deleções em hotspots críticos da enzima, são determinantes para a função enzimática e o trade-off evolutivo observado, onde a resistência a novos inibidores frequentemente se associa à restauração da suscetibilidade aos carbapenêmicos. Este trabalho oferece uma ferramenta promissora para a vigilância genômica e o apoio à decisão clínica, apesar das limitações dos testes estatísticos univariados em identificar marcadores isolados devido à alta diversidade alélica.
4. Conclusão
O estudo buscou desenvolver e validar modelos preditivos baseados em aprendizado de máquina capazes de inferir, a partir de mutações no gene blaKPC, os fenótipos de resistência à ceftazidima-avibactam (CZA) e suscetibilidade aos carbapenêmicos. Verificou-se que o algoritmo Support Vector Machine (SVM) demonstrou alto desempenho preditivo, com F1-score superior a 95% para resistência à CZA e aproximadamente 82% para suscetibilidade aos carbapenêmicos. A inclusão de uma abordagem genômica completa, abrangendo substituições, inserções e deleções (indels), foi crucial para a capacidade dos modelos de capturar a complexidade das alterações na enzima KPC. Observou-se um padrão consistente de trade-off evolutivo, no qual a resistência à CZA esteve frequentemente associada à perda de atividade contra carbapenêmicos, restaurando a suscetibilidade a essa classe de antibióticos. A análise de importância dos atributos destacou hotspots estruturais, como o loop Ômega e a região 267–275, como determinantes para a função enzimática e para esse fenômeno de trade-off.
A aplicação dos modelos otimizados permitiu a predição confiável de fenótipos em variantes KPC não caracterizadas, identificando um grupo significativo de 50 variantes com um “Duplo Perfil” de alta confiança, concomitantemente resistentes ao CZA e suscetíveis aos carbapenêmicos. Este achado valida a hipótese biológica do custo de aptidão estrutural imposto pela adaptação a novos inibidores. Embora os testes estatísticos univariados não tenham identificado marcadores individuais significativos devido à alta diversidade alélica, a abordagem multivariada do aprendizado de máquina superou essa limitação, integrando múltiplas alterações da sequência proteica. A estratificação por níveis de probabilidade das predições oferece uma estratégia eficaz para a triagem de dados, priorizando variantes na zona cinza para validação fenotípica in vitro. Assim, o aprendizado de máquina oferece uma ferramenta promissora para a vigilância genômica e o apoio à decisão clínica na microbiologia, aprimorando a compreensão dos mecanismos de resistência e a detecção precoce de variantes emergentes.
Referências Bibliográficas
Arcari et al., 2022 [Referência completa não encontrada no documento original]
Barnes, M.D.; Winkler, M.L.; Taracila, M.A.; Page, M.G.; Desarbre, E.; Kreiswirth, B.N.; Shields, R.K.; Nguyen, M.H.; Clancy, C.; Spellberg, B.; Papp-Wallace, K.M.; Bonomo, R.A. 2017. Klebsiella pneumoniae carbapenemase-2 (KPC-2), substitutions at Ambler position Asp179, and resistance to ceftazidime-avibactam: unique antibiotic-resistant phenotypes emerge from ẞ-lactamase protein engineering. mBio 8(5): e00528-17.
Ding, L.; Shen, S.; Chen, J.; Tian, Z.; Shi, Q.; Han, R.; Guo, Y.; Hu, F. 2023. Klebsiella pneumoniae carbapenemase variants: the new threat to global public health. Clinical Microbiology Reviews 36(4): e00008-
Ding, L.; Shen, S.; Han, R.; Yin, D.; Guo, Y.; Hu, F. 2022. Ceftazidime-avibactam in combination with imipenem as salvage therapy for ST11 KPC-33-producing Klebsiella pneumoniae. Antibiotics 11(5): 604.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

