Defensa da tese: 'Minaxe de contido en liña para mellorar o perfilado psicolóxico de individuos'

Esta tese explora métodos computacionais para a detección e análise temperás dos trastornos de saúde mental a partir do texto das redes sociais, abordando os desafíos que distinguen este dominio da clasificación convencional de textos. Na saúde mental, a predición precisa sozinha é insuficiente: os sistemas útiles deben tamén actuar de xeito temperá, antes de que os sinais de malestar escalem cara a unha crise clínica, ao mesmo tempo que remain interpretables suficiente para complementar o xuízo clínico. Ao mesmo tempo, os sinais lingüísticos asociados aos trastornos de saúde mental son a miúdo sutís, ruidosos, altamente contextuais e profundamente dependentes de como se representou o texto computacionalmente. Para abordar estes desafíos, aplícanse enfoques non supervisados e baseados na representación como o agrupamento, a modelización de temas, a avaliación da coherencia e as incrustacións de palabras temporais a datos de Reddit sobre depresión, anoréxia, autolesión e xogo patolóxico. Estes métodos extraen a estrutura latente directamente dos datos, revelando patróns temáticos e temporais recorrentes, e proporcionan información complementaria que as etiquetas predefinidas non están deseñadas para optimizar. A avaliación, con todo, non pode separarse da representación e a tarefa. As métricas de agrupamento dependen da xeometría do espazo de incrustación; as métricas de coherencia dependen do corpus de referencia; os sinais temporais dependen do vocabulario e das propiedades contextuais de cada condición. As métricas, neste sentido, non son instrumentos neutros senón suposicións operativas sobre a natureza do sinal e a estrutura que o captura. O progreso neste campo depende tanto de entender esas suposicións como de construir modelos máis sólidos. A reproducibilidade é tamén unha propiedade estrutural do proceso de investigación, non unha conveniencia após o feito. En complexas canles experimentais, cada conxunto de datos, modelo e resultado xorde dunha cadea de eleccións de configuración, incluíndo pasos de preprocesado, hiparparameters e datos de adestramento, e sen a preservación explícita desta procedencia, as conclusións non se poden comparar, auditar ou estender de xeito fiable. No conxunto, o traballo destaca como a representación, a avaliación e a reproducibilidade modelan conxuntamente o que se pode extraer dos datos das redes sociais e como se pode interpretar, apoiando enfoques máis robustos e metodoloxicamente fundamentados para a detección temperá de saúde mental.

Directores: David Losada e Javier Parpar López