Tecnología
10 de diciembre de 2025
Desarrollo y evaluación de modelos predictivos para enfermedades cardíacas
Autor: Luis Enrique Icart Maciel — Orientador: Fábio Lima
Resumen elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.
Este estudio buscó desarrollar y evaluar modelos predictivos para enfermedades cardíacas utilizando datos abiertos, con foco en la identificación de las variables más influyentes. Construir algoritmos de aprendizaje automático con desempeño robusto y alta interpretabilidad, permitiendo la clara identificación de los factores de riesgo determinantes. El enfoque fue crear una herramienta de apoyo a la decisión clínica precisa y transparente, útil para la triagem precoz de pacientes, especialmente en contextos con recursos limitados. El énfasis en la explicabilidad buscó superar la barrera de la “caja negra” de la inteligencia artificial, promoviendo la confianza y la adopción por profesionales de la salud.
Las enfermedades cardiovasculares (ECV) son la principal causa de mortalidad mundial (Islam y Majumder, 2013), con 17,9 millones de fallecimientos anuales (Organización Mundial de la Salud, 2021). El espectro incluye cardiopatía coronaria, enfermedad cerebrovascular y enfermedad arterial periférica. Factores de riesgo conductuales como una dieta inadecuada, el sedentarismo, el consumo de alcohol y el tabaco son catalizadores reconocidos para el desarrollo de estas patologías.
En Brasil, las enfermedades cardiovasculares son la principal causa de muerte, representando el 20% de los fallecimientos en individuos mayores de 30 años, con mayor incidencia en las regiones Sur y Sudeste (Mansur y Favarato, 2016). La situación se agrava en países de bajos y medianos ingresos, que concentran más de tres cuartas partes de las muertes globales por ECV, reflejando disparidades en el acceso a la atención (Coffey et al., 2021). El crecimiento poblacional y la prevalencia de factores de riesgo presionan los sistemas de salud, convirtiendo el diagnóstico accesible en un desafío logístico y financiero (Dutta et al., 2020).
En este escenario, el aprendizaje automático surge como un enfoque para un modelo de salud más proactivo y personalizado (Sarker, 2024). La capacidad de los algoritmos para analizar grandes volúmenes de datos e identificar patrones complejos puede mejorar la predicción del riesgo cardiovascular. La digitalización del sector médico ha facilitado la recopilación de información clínica, creando un entorno propicio para modelos predictivos que optimizan la toma de decisiones clínicas y la asignación de recursos (Aljanabi et al., 2018). Sin embargo, para su aplicación clínica, la precisión de los modelos debe ir acompañada de interpretabilidad.
La naturaleza de “caja negra” de muchos algoritmos es una barrera, ya que los profesionales de la salud necesitan comprender los factores detrás de una predicción para confiar en ella (Lundberg et al., 2018). Los modelos explicables, que justifican sus predicciones, son fundamentales para el uso responsable y ético de la inteligencia artificial en diagnósticos (Yin y Bingi, 2023), alineándose con el objetivo de este estudio de equilibrar rendimiento y transparencia.
Esta investigación posee características aplicadas, con un diseño experimental y cuantitativo, adecuada para investigar relaciones de causa y efecto entre factores de riesgo y la presencia de enfermedad cardíaca (Anderson-Cook, 2005; Babbie, 2020). El estudio desarrolló y evaluó modelos predictivos utilizando el conjunto de datos abierto “Heart Disease” del “UCI Machine Learning Repository” (2007). La elección de este dataset, extensivamente utilizado en investigaciones anteriores (Ding y Sadeghi, 2019; Dhurandhar et al., 2019; Aljanabi et al., 2018; Wang, 2018), garantizó la replicabilidad y comparabilidad de los resultados.
La preparación de los datos fue una etapa crítica. Aunque el conjunto de datos original contenía 76 atributos, la versión utilizada en este estudio posee 14 variables principales, sin valores ausentes. Un análisis exploratorio identificó valores atípicos, especialmente en peso y altura. Para mitigar su impacto, se eliminaron observaciones con masa corporal inferior a 48 kg (1er percentil) y altura inferior a 148 cm (1er percentil). Esta intervención resultó en un conjunto de datos final con 66.833 registros y 14 columnas, utilizado para la modelización.
La variable objetivo se definió como binaria: presencia (1) o ausencia (0) de enfermedad cardíaca. Las variables predictoras incluyeron datos demográficos (género, edad), antropométricos (altura, peso, IMC), clínicos (presión sistólica y diastólica, niveles de colesterol y glucosa) y conductuales (actividad física, alcohol, tabaquismo). Para el modelado, las variables categóricas se transformaron en “dummies” (n-1) y las continuas se estandarizaron mediante z-score, utilizando datos de entrenamiento para evitar fugas de información. Los datos se dividieron en 80% para entrenamiento y 20% para prueba, según práctica estándar para evaluar la generalización (Catania et al., 2022).
Seis algoritmos fueron evaluados: Regresión Logística, Árboles de Decisión, Random Forest, XGBoost, AdaBoost y LightGBM. La Regresión Logística fue elegida por ser un modelo lineal interpretable (Nasarian et al., 2024), y los Árboles de Decisión por modelar relaciones no lineales (Valente et al., 2021). Random Forest y los algoritmos de boosting (XGBoost, AdaBoost, LightGBM) fueron seleccionados por su alto rendimiento predictivo en problemas complejos (Imani et al., 2025; Gao et al., 2023).
La optimización de hiperparámetros se realizó con “Randomized Search” (50 iteraciones) y validación cruzada de 5 “folds”. El rendimiento se evaluó por AUC-ROC y Recall, métricas informativas en escenarios médicos (Richardson et al., 2023). La interpretabilidad se aseguró mediante la técnica SHAP (Lundberg y Lee, 2017). El flujo se implementó en Python con Scikit-learn, XGBoost, LightGBM y SHAP.
El análisis descriptivo reveló un IMC medio de 27,5 (sobrepeso) y presiones sistólica (126,5 mmHg) y diastólica (81,3 mmHg) medias cercanas a los límites superiores de la normalidad, lo que sugiere una población de riesgo. La matriz de correlación confirmó las asociaciones esperadas: la edad presentó la correlación positiva más fuerte con la enfermedad cardíaca (r = 0,24), seguida por el IMC (r = 0,19) y el peso (r = 0,17). La presión sistólica y diastólica mostraron una fuerte correlación entre sí (r = 0,73). La presión sistólica tuvo la mayor correlación con la variable objetivo (r = 0,43), seguida por la diastólica (r = 0,34), lo que indica que los niveles de presión elevados son fuertes predictores.
Los gráficos de caja de las presiones sistólica y diastólica mostraron una clara separación entre los grupos con y sin cardiopatía, con individuos diagnosticados presentando valores medianos y distribuciones más elevadas. El análisis de variables categóricas, mediante la prueba de chi-cuadrado, indicó asociaciones estadísticamente significativas (p < 0,05) entre la enfermedad y los niveles de presión arterial, colesterol, glucosa, tabaquismo, alcohol y actividad física. Los individuos con hipertensión nivel 2 presentaron una prevalencia de cardiopatía del 80,1%, y aquellos con colesterol muy por encima de lo normal, del 76,1%. La inactividad física también se asoció con un mayor porcentaje de enfermedad (53,3%) en comparación con los activos (48,6%).
La evaluación comparativa de los seis algoritmos mostró que, en el conjunto de entrenamiento, Random Forest alcanzó la mayor AUC-ROC (0,817) y precisión (0,744). Sin embargo, en el conjunto de prueba, el modelo XGBoost destacó con la mayor AUC-ROC (0,7996), seguido por LightGBM (0,7990) y Random Forest (0,7989). La consistencia entre los resultados de entrenamiento y prueba sugiere que se evitó el sobreajuste. Basado en estos resultados, XGBoost fue seleccionado como el modelo final, ofreciendo el mejor equilibrio entre capacidad de discriminación (AUC-ROC) y sensibilidad (Recall de 0,6882).
En diagnóstico médico, el Recall es crucial para minimizar falsos negativos. El análisis del gráfico de densidad de las probabilidades predichas por XGBoost reveló una superposición considerable entre las distribuciones de los grupos, explicando la dificultad en separarlos perfectamente y justificando la búsqueda de optimización del umbral de clasificación.
Para optimizar el modelo para el escenario clínico, donde la detección de positivos es prioritaria, se realizó un análisis de la curva Precisión-Recall para ajustar el umbral de clasificación. El umbral estándar de 0,5 no era ideal. El análisis indicó que un umbral de 0,36 representaba un punto de equilibrio estratégico, haciendo el modelo más sensible. Este cambio aumentó el Recall a 0,80, significando que el modelo pasó a identificar el 80% de los pacientes con la enfermedad. Consecuentemente, la Precisión se redujo a 0,60, aumentando los falsos positivos. Este trade-off es clínicamente justificable, ya que es preferible investigar pacientes sanos adicionalmente a no diagnosticar un paciente enfermo.
La interpretabilidad del modelo XGBoost se investigó con el análisis SHAP, validando clínicamente los hallazgos. El gráfico de impacto medio de los valores SHAP confirmó la presión sistólica como la variable de mayor influencia, seguida por la edad y el estado del colesterol muy por encima de lo normal, alineándose con el conocimiento médico consolidado. El gráfico de dispersión SHAP detalló cómo los valores de cada característica impactan la predicción: valores elevados de presión sistólica y edad aumentan la probabilidad de enfermedad (valores SHAP positivos), mientras que la práctica de actividad física demostró un papel protector (valores SHAP negativos).
Esta capacidad de analizar la predicción a nivel individual transforma el modelo de una “caja negra” en una herramienta de apoyo a la decisión. Permite al profesional de la salud comprender qué factores específicos contribuyeron al riesgo calculado, facilitando la comunicación con el paciente y el desarrollo de planes de intervención personalizados, alineando el poder de la IA con el razonamiento clínico.
La comparación con otros estudios revela que técnicas como Perceptrón Multicapa (MLP) o combinaciones de ML con Deep Learning reportaron métricas superiores, con AUC-ROC de 0,95 y acuracias por encima del 94% (Bhatt et al., 2023; Bharti et al., 2021). Aunque estos estudios utilizaron variables similares, las diferencias en los conjuntos de datos, poblaciones y estrategias de ingeniería de atributos pueden explicar la disparidad. El rendimiento del modelo aquí desarrollado, aunque más bajo, es robusto y clínicamente relevante. El enfoque en variables de fácil obtención y alta interpretabilidad le confiere un valor práctico distinto, especialmente para el cribado primario.
En un escenario donde las enfermedades cardiovasculares sobrecargan los sistemas de salud, los modelos predictivos de aprendizaje automático son una estrategia prometedora. El resultado demostró la viabilidad de desarrollar un modelo XGBoost robusto e interpretable, utilizando variables de fácil obtención como edad, presión arterial e IMC.
La elección de estas variables aumenta el potencial de aplicación en contextos con recursos limitados, como la atención primaria. El análisis SHAP validó la lógica del modelo al destacar predictores clínicamente consagrados. La decisión estratégica de ajustar el umbral de clasificación a 0,36 elevó el Recall a 0,80, adaptando el modelo a las necesidades clínicas donde la sensibilidad es prioritaria, minimizando la posibilidad de que un paciente enfermo no sea identificado.
A pesar de limitaciones como el uso de una base de datos internacional y la ausencia de variables clínicas más detalladas, el estudio cumplió sus propósitos, demostró que es posible desarrollar y evaluar un modelo de aprendizaje automático explicable para la predicción de enfermedades cardíacas, que ofrece un equilibrio estratégico entre rendimiento y sensibilidad, con aplicabilidad directa en escenarios de triaje ambulatorial.
Referencias
Aljanabi, M.;Qutqut, M. H.;Hijjawi, M. 2018. Machine learning classification techniques for heart disease prediction: a review. International Journal of Engineering & Technology, 7(4): 5373–5379.
Anderson-Cook, C. M. 2005. Experimental and Quasi-Experimental Designs for Generalized Causal Inference. Journal of the American Statistical Association, 100(470): 708–708.
Babbie, E. R. 2020. The practice of social research. Cengage Au.
Bharti, R.;Khamparia, A.;Shabaz, M.;Dhiman, G.;Pande, S.;Singh, P. 2021. Prediction of Heart Disease Using a Combination of Machine Learning and Deep Learning. Computational Intelligence and Neuroscience, 2021(1): 8387680.
Bhatt, C. M.;Patel, P.;Ghetia, T.;Mazzeo, P. L. 2023. Effective Heart Disease Prediction Using Machine Learning Techniques. Algorithms, 16(2): 88.
Catania, C.;Guerra, J.;Romero, J. M.;Caffaratti, G.;Marchetta, M. 2022. Beyond Random Split for Assessing Statistical Model Performance.
Coffey, S.;Roberts-Thomson, R.;Brown, A.;Carapetis, J.;Chen, M.;Enriquez-Sarano, M.;Zühlke, L.;Prendergast, B. D. 2021. Global epidemiology of valvular heart disease. Nature Reviews Cardiology, 18(12): 853–864.
Dhurandhar, A.;Shanmugam, K.;Luss, R. 2019. Leveraging Simple Model Predictions for Enhancing its Performance. ArXiv.
Ding, N.;Sadeghi, P. 2019. A Submodularity-based Agglomerative Clustering Algorithm for the Privacy Funnel. ArXiv.
Dutta, A.;Batabyal, T.;Basu, M.;Acton, S. T. 2020. An efficient convolutional neural network for coronary heart disease prediction. Expert Systems with Applications, 159: 113408.
Gao, X.;Alam, S.;Shi, P.;Dexter, F.;Kong, N. 2023. Interpretable machine learning models for hospital readmission prediction: a two-step extracted regression tree approach. BMC Medical Informatics and Decision Making, 23(1): 104.
Imani, M.;Beikmohammadi, A.;Arabnia, H. R. 2025. Comprehensive Analysis of Random Forest and XGBoost Performance with SMOTE, ADASYN, and GNUS Under Varying Imbalance Levels. Technologies, 13(3): 88.
Islam, A. K. M. M.;Majumder, A. A. S. 2013. Coronary artery disease in Bangladesh: A review. Indian Heart Journal, 65(4): 424–435.
Lundberg, S. M.;Lee, S.-I. 2017. A Unified Approach to Interpreting Model Predictions. Em Advances in Neural Information Processing Systems. Curran Associates, Inc.
Lundberg, S. M.;Nair, B.;Vavilala, M. S.;Horibe, M.;Eisses, M. J.;Adams, T.;Liston, D. E.;Low, D. K.-W.;Newman, S.-F.;Kim, J.;Lee, S.-I. 2018. Explainable machine-learning predictions for the prevention of hypoxaemia during surgery. Nature Biomedical Engineering, 2(10): 749–760.
Mansur, A. de P.;Favarato, D. 2016. Tendências da Taxa de Mortalidade por Doenças Cardiovasculares no Brasil, 1980-2012. Arquivos Brasileiros de Cardiologia, 107: 20–25.
Nasarian, E.;Alizadehsani, R.;Acharya, U. R.;Tsui, K.-L. 2024. Designing interpretable ML system to enhance trust in healthcare: A systematic review to proposed responsible clinician-AI-collaboration framework. Information Fusion, 108: 102412.
Richardson, E.;Trevizani, R.;Greenbaum, J. A.;Carter, H.;Nielsen, M.;Peters, B. 2023. The ROC-AUC accurately assesses imbalanced datasets. Available at SSRN 4655233.
Sarker, M. 2024. Revolutionizing Healthcare: The Role of Machine Learning in the Health Sector. Journal of Artificial Intelligence General science (JAIGS) ISSN:3006-4023, 2(1): 36–61.
UCI Machine Learning Repository, U. M. L. R. 2007. Heart Disease.
Valente, F.;Henriques, J.;Paredes, S.;Rocha, T.;Carvalho, P. de;Morais, J. 2021. Improving the compromise between accuracy, interpretability and personalization of rule-based machine learning in medical problems.
Wang, T. 2018. Hybrid Decision Making: When Interpretable Models Collaborate With Black-Box Models. ArXiv.
World Health Organization, W. H. O. 2021. Cardiovascular diseases.
Yin, Y.;Bingi, Y. 2023. Using Machine Learning to Classify Human Fetal Health and Analyze Feature Importance. BioMedInformatics, 3(2): 280–298.
Resumen ejecutivo proveniente de Trabajo de Conclusión de Curso de Especialización en Data Science y Analytics del MBA USP/Esalq
Más información sobre el curso; haga clic aquí: