LingUMT: Estratexias lingüisticamente motivadas para a tradución automática non supervisionada
A tradución automática non supervisionada (UMT) é un paradigma recente da tradución automática (MT) que se basea só en datos monolingües. Isto contrasta coas abordaxes máis populares en MT, que necesitan de datos paralelos para treinar os modelos de maneira eficaz. Aínda que é posíbel encontrar un grande número de corpus paralelos nalgúns pares de linguas, estes recursos son escasos para moitos idiomas e dominios. Ademais, os datos monolingües son predominantes, encóntranse nun maior número de dominios e xéneros, e están en constante crecemento, tamén en linguas con menos recursos lingüísticos. A exploración do uso de corpus monolingües para a tradución automática tamén pode ser beneficiosa por outras dúas razóns: primeiro, os corpus monolingües reducen os decalques das traducións literais e, por outro lado, o seu uso como fonte de tradución permite simular a coñecida como competencia de tradución en individuos bilingües de maneira máis adecuada.
Obxectivos
Este proxecto céntrase na exploración, definición e implementación de estratexias de tradución automática non supervisionada e motivadas lingüisticamente, que aproximan a tradución automática do proceso de paráfrase nun contexto bilingüe. A tradución é concebida e proxectada como o proceso semántico de parafraseamento entre dous códigos lingüísticos. O proxecto lidará con conceitos como a sintaxe de dependencias, o significado contextualizado, a similaridade distribucional, e as construcións sintáctico-semánticas. De maneira especial analizaremos o impacto da (non-)composicionalidade semántica na representación computacional do significado, tanto en contextos monolingües como de tradución entre dúas variedades lingüísticas.
Proxecto
/research/projects/estratexias-linguisticamente-motivadas-para-a-traducion-automatica-non-supervisionada
<p>A tradución automática non supervisionada (UMT) é un paradigma recente da tradución automática (MT) que se basea só en datos monolingües. Isto contrasta coas abordaxes máis populares en MT, que necesitan de datos paralelos para treinar os modelos de maneira eficaz. Aínda que é posíbel encontrar un grande número de corpus paralelos nalgúns pares de linguas, estes recursos son escasos para moitos idiomas e dominios. Ademais, os datos monolingües son predominantes, encóntranse nun maior número de dominios e xéneros, e están en constante crecemento, tamén en linguas con menos recursos lingüísticos. A exploración do uso de corpus monolingües para a tradución automática tamén pode ser beneficiosa por outras dúas razóns: primeiro, os corpus monolingües reducen os decalques das traducións literais e, por outro lado, o seu uso como fonte de tradución permite simular a coñecida como competencia de tradución en individuos bilingües de maneira máis adecuada.</p><p>Este proxecto céntrase na exploración, definición e implementación de estratexias de tradución automática non supervisionada e motivadas lingüisticamente, que aproximan a tradución automática do proceso de paráfrase nun contexto bilingüe. A tradución é concebida e proxectada como o proceso semántico de parafraseamento entre dous códigos lingüísticos. O proxecto lidará con conceitos como a sintaxe de dependencias, o significado contextualizado, a similaridade distribucional, e as construcións sintáctico-semánticas. De maneira especial analizaremos o impacto da (non-)composicionalidade semántica na representación computacional do significado, tanto en contextos monolingües como de tradución entre dúas variedades lingüísticas.</p> - PID2021-128811OA-I00 - Marcos Garcia González - Pablo Gamallo Otero, Iria De Dios Flores, Anna Temerko, José Ramón Pichel Campos
projects_gl