Abstract
La llegada de la Enfermedad del Coronavirus (COVID-19) a España provocó un gran impacto en el Sistema Nacional de Salud. El control de esta pandemia, que ha supuesto una crisis a nivel mundial, ha impulsado la búsqueda de nuevos mecanismos para caracterizar la evolución clínica de la enfermedad y amortiguar su impacto en la sociedad.
El objetivo de este proyecto es diseñar modelos predictivos dirigidos por datos con características previamente seleccionadas asociadas a pacientes ingresados por COVID-19. Para la realización de este proyecto se dispone de datos anonimizados, proporcionados por HM Hospitales, de pacientes COVID-19 ingresados durante la primera ola del virus. Se ha trabajado con los diagnósticos CIE-10 al ingreso hospitalario y con las pruebas de laboratorio realizadas durante el ingreso hospitalario. Los pacientes a caracterizar se han dividido en tres grupos en función de la evolución de su estado de salud y del evento a considerar, estos son: Favorable (pacientes que recibieron el alta domiciliaria sin haber ingresado en UCI), UCI (pacientes que ingresaron en UCI) y Exitus (pacientes que fallecieron sin haber ingresado en UCI).
Se ha comenzado realizando un análisis exploratorio de los datos y su posterior limpieza para adecuarlos a las técnicas a aplicar. En concreto, se ha utilizado remuestreo Bootstrap para llevar a cabo selección de características con un Test de Hipótesis no paramétrico de diferencia de mediana, a fin de conocer las analíticas estadísticamente más discriminativas entre estados de salud. Se han tenido en cuenta dos escenarios de trabajo: en el Escenario-1, se ha evaluado si se producen variaciones en los resultados del test al utilizar tamaño de remuestreo variable versus tamaño de remuestreo fijo; en el Escenario-2, se ha evaluado si influye en los resultados del test seleccionar un conjunto de pacientes fijo en cada grupo de estudio.
Finalmente, se han diseñado modelos de Aprendizaje Automático para predecir el estado de salud de pacientes ingresados por COVID-19. En concreto, se ha trabajado con árboles de clasificación por ser modelos sencillos de interpretar que representan esquemáticamente (en forma de árbol) una jerarquía de decisiones y resultados. Considerando como características de entra- da las pruebas de laboratorio, se han diseñado: (1) árboles multiclase (Favorable, UCI y Exitus), y (2) árboles binarios (Favorable y Desfavorable, esta última clase creada a partir de la unión de los grupos UCI y Exitus) con el fin de reducir el desbalanceo y comparar los resultados con los obtenidos en los árboles multiclase.
Tras la finalización de este proyecto, los resultados del Test de Hipótesis señalan que, aproximadamente, el 25% de las analíticas presentan potencia discriminativa para alguno de los grupos de estudio. Además, los árboles de clasificación han mostrado prestaciones razonables, con una tasa de acierto para cada grupo superior al 0.5 con árboles multiclase y por encima de 0.8 con árboles binarios, pudiendo ser empleados como sistema interpretable de ayuda a la decisión clínica.
Journal Title
Journal ISSN
Volume Title
Publisher
Universidad Rey Juan Carlos
URL external
External URL
DOI
Date
Description
Trabajo Fin de Grado leído en la Universidad Rey Juan Carlos en el curso académico 2022/2023. Directores/as: Inmaculada Mora Jiménez



