Resumen Ejecutivo

Salud

10 de diciembre de 2025

Modelo de Regresión logística para clasificación de fallecimiento en pacientes con VIH en Brasil

Autor: Fabiano Gomes de Almeida — Director: João Vitor Matos Gonçalves

Resumen elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.

El objetivo de esta investigación fue desarrollar y validar un modelo de regresión logística para identificar los factores asociados a la mortalidad en pacientes adultos con VIH en Brasil, utilizando datos del Sistema de Información de Agravios de Notificación (SINAN). El análisis buscó determinar los predictores de riesgo y generar una puntuación individualizada aplicable a nuevos pacientes, sirviendo como herramienta para dirigir acciones preventivas, optimizar recursos terapéuticos y mejorar la gestión clínica en el Sistema Único de Salud (SUS). La intención es proporcionar subsidios cuantitativos para la estratificación de pacientes basada en la probabilidad de muerte, posibilitando intervenciones personalizadas para los perfiles de mayor vulnerabilidad.

La relevancia del estudio se basa en el desafío que la epidemia de VIH/SIDA representa para la salud pública. A pesar de los avances en el acceso al diagnóstico y a la terapia antirretroviral (TARV), las tasas de mortalidad aún son considerables, especialmente en poblaciones específicas y regiones con barreras de acceso (Oliveira et al., 2020). La heterogeneidad de la epidemia en Brasil exige la comprensión de los factores demográficos, clínicos y conductuales que influyen en el desenlace clínico. En este contexto, la aplicación de modelos estadísticos en grandes bases de datos gubernamentales, como las del DATASUS, es un enfoque fundamental para transformar datos en inteligencia estratégica para la toma de decisiones en salud (Souza, 2018).

La regresión logística, una técnica de aprendizaje automático supervisado, es adecuada para modelar la relación entre variables predictoras y un resultado binario, como la ocurrencia de muerte. A diferencia de los análisis descriptivos, un modelo predictivo permite anticipar escenarios e identificar patrones no aparentes, fortaleciendo la capacidad del sistema de salud para actuar proactivamente (Santos, 2019). Este trabajo se alinea con las tendencias de medicina basada en evidencia y gestión de salud orientada por datos, buscando traducir la complejidad epidemiológica en una herramienta práctica.

La base de datos utilizada, del archivo HIVA del SINAN, consolida información de notificación obligatoria de casos de VIH en adultos. La variedad de variables, abarcando características sociodemográficas, clínicas y de exposición, permitió la construcción de un modelo multifactorial robusto. El análisis de estos datos posibilita confirmar factores de riesgo conocidos e identificar nuevas asociaciones específicas del contexto brasileño, contribuyendo al conocimiento sobre la dinámica de la mortalidad por VIH en el país (Lima & Costa, 2021).

Este estudio busca fortalecer el puente entre la investigación y la práctica clínica y de gestión. Al generar un modelo validado con alto poder de discriminación, la investigación ofrece un instrumento que puede ser integrado a los procesos de monitoreo, auxiliando equipos de salud en la identificación precoz de individuos que necesitan atención intensificada. La capacidad de generar un puntaje de riesgo cuantifica la vulnerabilidad de cada paciente, permitiendo una asignación más eficiente de recursos y contribuyendo a reducir la mortalidad y mejorar la calidad de vida de las personas que viven con VIH en Brasil.

La metodología se inició con la recopilación y preparación de los datos extraídos del archivo HIVA del SINAN, comprendiendo notificaciones de VIH en adultos de 2015 a 2023. El conjunto de datos inicial contenía 76 variables, incluyendo información de notificación, demográficas (sexo, edad, raza, escolaridad), historial de exposición, comorbilidades, manifestaciones clínicas y evolución del caso (defunción y fecha).

El público objetivo se definió como pacientes adultos con VIH atendidos en la red pública, y el desenlace de interés, la mortalidad. La base se filtró por la variable EVOLUCION, seleccionando los registros “Vivo”, “Óbito por SIDA” u “Óbito por otras causas”. La variable respuesta (target) se construyó con un horizonte predictivo de 12 meses a partir del primer día del año de la notificación. Este período resultó ser el más equilibrado entre el volumen de eventos y el tiempo de maduración para la evaluación. La variable respuesta binaria asumió el valor 1 si el óbito ocurrió en 12 meses y 0 en caso contrario. Los datos se segmentaron en conjuntos de entrenamiento y prueba (cosechas 2015-2020), validación “out of time” (2021-2022) y producción (2023).

El análisis exploratorio de datos fue fundamental para la preparación de las variables. El análisis univariado evaluó la frecuencia de categorías, la prevalencia de datos ausentes e inconsistencias. Para variables cuantitativas, se calcularon estadísticas descriptivas. El análisis bivariado investigó la relación entre cada predictor potencial y la variable respuesta, utilizando el cálculo del riesgo relativo (razón entre la probabilidad de no fallecimiento y de fallecimiento). Con base en estos valores, se agruparon categorías de variables cualitativas para optimizar el poder predictivo y garantizar la monotonicidad. Para variables cuantitativas, se crearon rangos basados en cuantiles, también agrupados por riesgo relativo. El proceso resultó en 25 variables candidatas para el modelado (4 cuantitativas y 21 cualitativas).

Para la construcción del modelo, se empleó el algoritmo de regresión logística (Fávero & Belfiore, 2024). Las 25 variables seleccionadas se convirtieron en “dummies”, con una categoría de referencia omitida para cada variable original para evitar la multicolinealidad. La selección de las variables más relevantes fue automatizada por el procedimiento “stepwise”, que busca un equilibrio entre complejidad y poder explicativo. La ausencia de multicolinealidad se verificó mediante el Factor de Inflación de la Varianza (VIF). La validación del modelo se realizó con el Área Bajo la Curva ROC (AUROC) y la prueba de Kolmogorov-Smirnov (KS) para evaluar el poder de discriminación, y el Índice de Estabilidad de la Población (PSI) para monitorizar el rendimiento a lo largo del tiempo.

La preparación de los datos partió de 410.291 registros (2015-2023). Se descartaron 39 de las 76 variables originales por alta incidencia de datos ausentes (>99%) o falta de variabilidad. Tras filtros en el campo EVOLUCAO, la base se consolidó en 389.661 registros. La definición de la variable respuesta, TARGET12, con horizonte de 12 meses, garantizó volumen suficiente de eventos, permitiendo el uso de las cosechas de 2021 y 2022 como muestra “out of time”. La base final para análisis totalizó 389.038 registros.

El análisis exploratorio bivariado, sobre 272.628 registros de entrenamiento y prueba, refinó el conjunto de predictores. De 35 variables iniciales, 10 fueron excluidas por baja representatividad, ausencia de poder de discriminación o comportamiento contraintuitivo. Las 25 restantes pasaron por ingeniería de atributos, incluyendo creación de variables de tiempo, indicadores binarios (gestación) y reagrupamiento de categorías por riesgo relativo. Las cinco variables con mayor poder de discriminación mostraron correlación directa entre riesgo relativo y tasas de defunción: categorías con riesgo “Bueno” tuvieron mortalidad inferior a la media general (1,56%), mientras que las con riesgo “Malo” exhibieron tasas superiores. La variable edad (vn01_IDADE), por ejemplo, demostró ordenación decreciente del riesgo relativo (mayor probabilidad de supervivencia) con la disminución de la edad, validando su consistencia.

El modelado utilizó regresión logística binaria sobre las 25 variables. Tras la creación de “dummies”, el procedimiento “stepwise” en la base de entrenamiento (190.839 registros) seleccionó 24 “dummies” estadísticamente significativas, representando 18 variables originales. Todas presentaron un p-valor inferior a 0,01. El análisis de multicolinealidad confirmó la robustez, con todos los valores de VIF por debajo del umbral de 10, asegurando la independencia de los predictores.

La validación del modelo demostró su alto rendimiento. El análisis de congruencia confirmó que los signos de los coeficientes estaban alineados con la expectativa teórica; por ejemplo, la edad avanzada y las comorbilidades presentaron coeficientes positivos. El análisis descriptivo de la puntuación mostró una clara separación entre los grupos “óbito” y “no óbito”, con puntuaciones medias y medianas significativamente más altas para el primer grupo en todas las muestras (entrenamiento, prueba y “out of time”).

El poder de discriminación se cuantificó mediante indicadores de precisión. El Área Bajo la Curva ROC (AUROC) alcanzó 0,84 en la muestra de entrenamiento, 0,8394 en la de prueba y 0,827 en la “out of time”, valores que indican un rendimiento de clasificación muy bueno (Pereira, 2013). La prueba de Kolmogorov-Smirnov (KS) presentó valores de 0,5287 (entrenamiento), 0,5265 (prueba) y 0,5068 (“out of time”), clasificando el modelo como excelente en su capacidad de separación (Sicsú, 2010). La consistencia de los resultados entre las muestras evidencia la ausencia de “overfitting” y la capacidad de generalización del modelo.

El análisis de la distribución de la puntuación por deciles reforzó la capacidad predictiva, con una ordenación creciente de la tasa de mortalidad en deciles de puntuación más altos. Para la cosecha de producción de 2023, el Índice de Estabilidad de la Población (PSI) fue de 0,0014, valor considerado muy bajo (Dataconomy, 2025), confirmando que la población de nuevos pacientes mantuvo un perfil de riesgo similar al de la población de desarrollo, atestiguando la estabilidad del modelo.

Los resultados permitieron la identificación de nichos de riesgo con alta precisión, incluso con una tasa de mortalidad general del 1,61%. Los pacientes con transmisión probable por uso de drogas inyectables presentaron una probabilidad de fallecimiento 2,94 veces mayor que la de no fallecimiento, con una tasa de mortalidad del 171,2% por encima de la media. La presencia de síntomas como tos persistente o neumonía elevó la probabilidad de fallecimiento en 5,88 veces, con una tasa de mortalidad del 437,2% superior a la media. El diagnóstico de anemia, linfopenia o trombocitopenia aumentó la probabilidad de fallecimiento en 6,25 veces, con una tasa de mortalidad del 460,3% por encima de la media.

El modelo también identificó factores protectores. Los pacientes de hasta 24 años mostraron una probabilidad de supervivencia 3,59 veces mayor, con una tasa de mortalidad un 71,7% inferior a la media. Otros factores asociados a la mortalidad incluyeron la ausencia de declaración en variables críticas, edad superior a 42 años, baja escolaridad, tiempo prolongado hasta la prueba confirmatoria y la unidad federativa. Las tasas de mortalidad más bajas se observaron en embarazadas (0,20%), jóvenes (0,44%) e individuos con educación secundaria completa o superior (0,64%), destacando la importancia de los factores sociodemográficos y del cuidado prenatal.

Este estudio alcanzó sus objetivos al desarrollar un modelo de regresión logística robusto y con alta capacidad predictiva para los factores asociados a la mortalidad en pacientes adultos con VIH en Brasil. El análisis de la base de datos HIVA del SINAN permitió cuantificar el impacto de los factores de riesgo y consolidarlos en un puntaje de riesgo individualizado. La herramienta demostró un excelente desempeño de discriminación (AUROC y KS) y estabilidad temporal (análisis “out of time” y PSI). Los resultados ofrecen subsidios para la gestión de la salud pública, permitiendo la estratificación de pacientes y el direccionamiento de acciones para los grupos de mayor vulnerabilidad, optimizando la asignación de recursos.

Las implicaciones prácticas son significativas. El modelo puede implementarse como un sistema de alerta temprana en los servicios de salud, ayudando a los equipos clínicos a identificar pacientes que necesitan seguimiento intensivo. La identificación de factores como el uso de drogas inyectables, la anemia y la tos persistente como predictores de alto riesgo refuerza la necesidad de enfoques multidisciplinarios. La investigación evidencia el potencial del análisis de datos de salud para mejorar la vigilancia epidemiológica y la toma de decisiones basada en evidencia. Se concluye que el objetivo se alcanzó: se demostró que el modelo de regresión logística desarrollado es una herramienta robusta y con alto poder predictivo para clasificar el riesgo de muerte en pacientes adultos con VIH en Brasil, identificando factores críticos para la formulación de políticas de salud más eficaces.

Referencias:
Bueno, L. M. 2011. Análisis de crédito: medidas de evaluación de modelos y aplicación de la teoría fuzzy en la toma de decisiones. Trabajo final de Grado. Departamento de Estadística, Universidad de Brasilia, Brasilia, DF, Brasil. Disponible <https://bdm. unb. br/bitstream/10483/3508/1/2011_LoreMartinsBueno. pdf>. Acceso en: 08 de agosto de 2025.
Dataconomy. 2025. Índice de estabilidad de la población (PSI). Dataconomy PT. Disponible en: <https://pt. dataconomy. com/2025/04/18/indice-de-estabilidade-da-populacao-psi/>.
Fávero, L. P.; Belfiore, P. 2024. Manual de análisis de datos. LTC, Río de Janeiro, RJ, Brasil.
Gomes, R. & Ferreira, J. C. 2022. Análisis de Datos en Salud Pública: Métodos y Aplicaciones. Editora Saúde, São Paulo, SP, Brasil.
Lima, A. C. & Costa, M. S. 2021. Epidemiología del VIH/SIDA en Brasil: Un Análisis de Series Temporales. Cadernos de Saúde Pública, v. 37, n. 5, e00123420.
Oliveira, C. S. de et al. 2020. Perfil epidemiológico del SIDA en Brasil utilizando sistemas de información del DATASUS. Revista Brasileira de Análises Clínicas, v. 52, n. 1, p. 35–42, 2020. Disponible en: <https://www. rbac. org. br/artigos/perfil-epidemiologico-da-aids-no-brasil-utilizando-sistemas-de-informacoes-do-datasus>
Pereira, M. B. 2013. Estimación de la Sensibilidad, de la Especificidad y de la Curva ROC. Disertación de Maestría. Departamento de Matemáticas y Aplicaciones, Escuela de Ciencias, Universidad de Minho, Braga, Portugal. Disponible en: <https://repositorium. sdum. uminho. pt/handle/1822/29401>
Santos, E. M. 2019. Modelado Estadístico Aplicado. Editora Acadêmica, Belo Horizonte, MG, Brasil.
Sicsú, A. L. 2010. Credit Scoring: Desarrollo, Implementación y Seguimiento. Blucher, São Paulo, SP, Brasil.
Souza, F. L. 2018. El Papel de la Vigilancia Epidemiológica en el Sistema Único de Salud (SUS). Revista Brasileira de Epidemiologia, v. 21, e180001.


Resumen ejecutivo del Trabajo de Conclusión de Curso de Especialización en Data Science y Analytics del MBA USP/Esalq

Más información sobre el curso; haga clic aquí:

Quién editó este artículo

Más recientes

También te puede interesar