LingUMT: Estrategias lingüísticamente motivadas para la traducción automática no supervisada
La traducción automática no supervisada (UMT) es un paradigma reciente de la traducción automática (MT) que se basa solo en datos monolingües. Esto contrasta con los planteamientos más populares en MT, que necesitan datos paralelos para entrenar los modelos de manera eficaz. Aunque es posible encontrar un gran número de corpus paralelos en algunos pares de lenguas, estos recursos son escasos para muchos idiomas y dominios. Además, los datos monolingües son predominantes, se encuentran en un mayor número de dominios y géneros, y están en constante crecimiento, también en lenguas con menos recursos lingüísticos. La exploración del uso de corpus monolingües para la traducción automática también puede ser beneficiosa por otras dos razones: primero, los corpus monolingües reducen los calcos de las traducciones literales y, por otro lado, su uso como fuente de traducción permite simular la conocida como competencia de traducción en individuos bilingües de manera más adecuada.
Objetivos
Este proyecto se centra en la exploración, definición e implementación de estrategias de traducción automática no supervisada y motivadas lingüísticamente, que aproximan la traducción automática del proceso de paráfrasis en un contexto bilingüe. La traducción es concebida y proyectada como el proceso semántico de generación de paráfrasis entre dos códigos lingüísticos. El proyecto trabajará con conceptos como la sintaxis de dependencias, el significado contextualizado, la similitud distribucional, y las construcciones sintáctico-semánticas. De manera especial analizaremos el impacto de la (no-)composicionalidad semántica en la representación computacional del significado, tanto en contextos monolingües como de traducción entre dos variedades lingüísticas.
Proyecto
/research/projects/estratexias-linguisticamente-motivadas-para-a-traducion-automatica-non-supervisionada
<p>La traducción automática no supervisada (UMT) es un paradigma reciente de la traducción automática (MT) que se basa solo en datos monolingües. Esto contrasta con los planteamientos más populares en MT, que necesitan datos paralelos para entrenar los modelos de manera eficaz. Aunque es posible encontrar un gran número de corpus paralelos en algunos pares de lenguas, estos recursos son escasos para muchos idiomas y dominios. Además, los datos monolingües son predominantes, se encuentran en un mayor número de dominios y géneros, y están en constante crecimiento, también en lenguas con menos recursos lingüísticos. La exploración del uso de corpus monolingües para la traducción automática también puede ser beneficiosa por otras dos razones: primero, los corpus monolingües reducen los calcos de las traducciones literales y, por otro lado, su uso como fuente de traducción permite simular la conocida como competencia de traducción en individuos bilingües de manera más adecuada.</p><p>Este proyecto se centra en la exploración, definición e implementación de estrategias de traducción automática no supervisada y motivadas lingüísticamente, que aproximan la traducción automática del proceso de paráfrasis en un contexto bilingüe. La traducción es concebida y proyectada como el proceso semántico de generación de paráfrasis entre dos códigos lingüísticos. El proyecto trabajará con conceptos como la sintaxis de dependencias, el significado contextualizado, la similitud distribucional, y las construcciones sintáctico-semánticas. De manera especial analizaremos el impacto de la (no-)composicionalidad semántica en la representación computacional del significado, tanto en contextos monolingües como de traducción entre dos variedades lingüísticas.</p> - PID2021-128811OA-I00 - Marcos Garcia González - Pablo Gamallo Otero, Iria De Dios Flores, Anna Temerko, José Ramón Pichel Campos
projects_es