Un método lingüístico-estadístico para la traducción automática basado en corpus no-paralelos y semántica composicional

El objetivo central del presente proyecto es el diseño y desarrollo de una nueva estrategia lingüístico-estadística para la traducción automática. El paradigma actual en traducción automática estadística (SMT) se basa en el uso de corpus bilingües paralelos (y alineados) y en la segmentación no-composicional. En contraposición, la propuesta del presente proyecto se fundamenta en la explotación de corpus bilingües no-paralelos con segmentación composicional basada en la semántica distribucional.
La principal contribución del proyecto es precisamente la aplicación de la composicionalidad distribucional a espacios vectoriales bilingües mediante el uso y explotación de corpus bilingües no-paralelos (que no tienen por qué ser comparables). Se trata, por lo tanto, de un enfoque novedoso para la investigación en traducción automática. El modelo propuesto de traducción es de naturaleza híbrida lingüístico-estadística. Necesita, por un lado, reglas sintácticas de transferencia y, por otro, de espacios vectoriales construidos automáticamente a partir de los corpus no-paralelos, vectores que representan la distribución (o significado contextual) de las expresiones lingüísticas.

Objetivos

  • Diseño y desarrollo de una nueva estrategia lingüístico-estadística para la traducción automática basada en la explotación de corpus bilingües no-paralelos y en la semántica composicional.
  • Implementación de un sistema de traducción inglés-español (en-es), limitado a secuencias clausales cuyos predicados contengan las locuciones verbales inglesas conocidas como phrasal verbs, que son predicados que tienden a tener una gran ambigüedad léxica.