Defensa de tesis: 'Minería de contenido en línea para mejorar el perfil psicológico de individuos'

Esta tesis explora métodos computacionales para la detección temprana y el análisis de condiciones de salud mental a partir del texto en redes sociales, abordando los desafíos que distinguen este dominio de la clasificación de texto convencional. En salud mental, la predicción precisa por sí sola es insuficiente: los sistemas útiles también deben actuar temprano, antes de que las señales de angustia escalen a una crisis clínica, mientras se mantienen lo suficientemente interpretables para complementar el juicio clínico. Al mismo tiempo, las señales lingüísticas asociadas con las condiciones de salud mental son a menudo sutiles, ruidosas, altamente contextuales y profundamente dependientes de la forma en que el texto se representa computacionalmente. Para abordar estos desafíos, se aplican enfoques no supervisados y basados en representación como el clustering, el modelado de temas, la evaluación de la coherencia y las incrustaciones temporales de palabras a datos de Reddit sobre depresión, anorexia, autolesiones y juego patológico. Estos métodos extraen estructuras latentes directamente de los datos, revelando patrones temáticos y temporales recurrentes, y proporcionan perspectivas complementarias que las etiquetas predefinidas no están diseñadas para optimizar. Sin embargo, la evaluación no puede ser desglosada de la representación y la tarea. Las métricas de clustering dependen de la geometría del espacio de incrustación; las métricas de coherencia dependen del corpus de referencia; las señales temporales dependen del vocabulario y las propiedades contextuales de cada condición. Las métricas, en este sentido, no son instrumentos neutrales sino supuestos operativos sobre la naturaleza de la señal y la estructura que la captura. El progreso en este campo depende tanto de entender esos supuestos como de construir modelos más robustos. La reproducibilidad también es una propiedad estructural del proceso de investigación, no una conveniencia posterior. En complejas líneas de experimentación, cada conjunto de datos, modelo y resultado surge de una cadena de elecciones de configuración, incluidos pasos de preprocesamiento, hiperparámetros y datos de entrenamiento, y sin la preservación explícita de esta procedencia, los hallazgos no pueden compararse, auditarse o ampliarse de manera confiable. En general, el trabajo destaca cómo la representación, la evaluación y la reproducibilidad dan forma conjuntamente a lo que se puede extraer de los datos de redes sociales y cómo se puede interpretar, apoyando enfoques más robustos y metodológicamente fundamentados para la detección temprana de la salud mental.

Directores: David Losada y Javier Parpar López