
Investigador/a junior en Procesamiento del Lenguaje Natural: LLM y productos culturales en gallego
Buscamos una persona interesada en colaborar en el proyecto COMPEL, desarrollando recursos de PLN aplicados al análisis de producción cultural en gallego y su comparación con otras lenguas europeas.
Objetivo
Las tecnologías recientes de PLN como los grandes modelos de lenguaje (LLM) han supuesto grandes avances en la comprensión automática de textos. Sin embargo, algunos escenarios todavía presentan desafíos, como las variedades lingüísticas históricas. Algunas tareas aún son difíciles y menos estudiadas, como el análisis automático de textos literarios. El desafío es aún mayor en el caso de las lenguas para las que existen menos recursos digitales, como el gallego.
En este contexto, el proyecto COMPEL (https://compellit.github.io) está desarrollando recursos basados en PLN para el análisis de la literatura del siglo XIX en gallego y para su comparación con otras tradiciones europeas. El objetivo es facilitar un acceso inteligente al patrimonio cultural y a los productos culturales en gallego.
El puesto contribuirá a tareas del proyecto como las siguientes:
• Desarrollo de corpus y contribución al desarrollo de tareas de PLN relacionadas (p. ej. normalización texto histórico)
• Diseño y ejecución de experimentos: Entrenamiento de modelos de lenguaje monolingüe o multilingüe para diferentes tareas y comparación de modelos de diferentes paradigmas (aprendizaje por transferencia clásico basado en modelos de lenguaje pre-entrenados vs. LLMs)
• Participación en publicaciones basadas en la investigación
• Desarrollo de aplicaciones web (APIs, front-end) para acceso público a recursos de proyectos
Conocimiento y habilidades útiles para el puesto
• Grado en ingeniería informática o áreas afines, o un área relacionada con el Procesamiento del Lenguaje Natural (PLN) / Lingüística computacional
• Conocimiento de tareas de PLN relevantes para la investigación descrita más arriba
• Conocimiento de bibliotecas comunes en PLN (p. ej. Hugging Face transformers, torch)
• Conocimiento de Python con respecto a las tareas anteriores
Detalles del puesto
• Duración 1 año
• El trabajo puede efectuarse a tiempo completo o parcial, dependiendo de la situación de las personas interesadas (sería posible hacer este trabajo en paralelo a los estudios)
• La remuneración es conforme a la escala salarial de la USC (https://imaisd.usc.es/ferramentas/calculadora/calculadoracontratos.asp) y depende de la formación y del tiempo de trabajo
• Se dispone de una financiación para presentar en congresos la investigación desarrollada en el proyecto
• El proyecto se desarrolla en el CiTIUS, en la Universidad de Santiago de Compostela. Es un entorno dinámico y multidisciplinar en un centro de investigación reconocido en IA.
Solicitudes y contacto
En caso de interés, se ruega enviar un CV y una breve carta de motivación a:
Para dudas o consultas adicionales, contactar con el investigador Pablo Ruiz Fabo en esta misma dirección de correo.
Objetivo
Las tecnologías recientes de PLN como los grandes modelos de lenguaje (LLM) han supuesto grandes avances en la comprensión automática de textos. Sin embargo, algunos escenarios todavía presentan desafíos, como las variedades lingüísticas históricas. Algunas tareas aún son difíciles y menos estudiadas, como el análisis automático de textos literarios. El desafío es aún mayor en el caso de las lenguas para las que existen menos recursos digitales, como el gallego.
En este contexto, el proyecto COMPEL (https://compellit.github.io) está desarrollando recursos basados en PLN para el análisis de la literatura del siglo XIX en gallego y para su comparación con otras tradiciones europeas. El objetivo es facilitar un acceso inteligente al patrimonio cultural y a los productos culturales en gallego.
El puesto contribuirá a tareas del proyecto como las siguientes:
• Desarrollo de corpus y contribución al desarrollo de tareas de PLN relacionadas (p. ej. normalización texto histórico)
• Diseño y ejecución de experimentos: Entrenamiento de modelos de lenguaje monolingüe o multilingüe para diferentes tareas y comparación de modelos de diferentes paradigmas (aprendizaje por transferencia clásico basado en modelos de lenguaje pre-entrenados vs. LLMs)
• Participación en publicaciones basadas en la investigación
• Desarrollo de aplicaciones web (APIs, front-end) para acceso público a recursos de proyectos
Conocimiento y habilidades útiles para el puesto
• Grado en ingeniería informática o áreas afines, o un área relacionada con el Procesamiento del Lenguaje Natural (PLN) / Lingüística computacional
• Conocimiento de tareas de PLN relevantes para la investigación descrita más arriba
• Conocimiento de bibliotecas comunes en PLN (p. ej. Hugging Face transformers, torch)
• Conocimiento de Python con respecto a las tareas anteriores
Detalles del puesto
• Duración 1 año
• El trabajo puede efectuarse a tiempo completo o parcial, dependiendo de la situación de las personas interesadas (sería posible hacer este trabajo en paralelo a los estudios)
• La remuneración es conforme a la escala salarial de la USC (https://imaisd.usc.es/ferramentas/calculadora/calculadoracontratos.asp) y depende de la formación y del tiempo de trabajo
• Se dispone de una financiación para presentar en congresos la investigación desarrollada en el proyecto
• El proyecto se desarrolla en el CiTIUS, en la Universidad de Santiago de Compostela. Es un entorno dinámico y multidisciplinar en un centro de investigación reconocido en IA.
Solicitudes y contacto
En caso de interés, se ruega enviar un CV y una breve carta de motivación a:
Para dudas o consultas adicionales, contactar con el investigador Pablo Ruiz Fabo en esta misma dirección de correo.