DOMINO: Traducción Automática Neuronal, en DOMInio, NO supervisada

La traducción máquina (MT) ha sido una de las aplicaciones más destacadas de la inteligencia artificial desde el comienzo del campo. A mayores del interés intrínseco dada la dificultad y completitud del problema, la traducción máquina presenta un gran interés en un mundo cada vez más globalizado, por su capacidad para romper la barrera del lenguaje, a la vez que constituye una salvaguarda para la herencia cultural y la diversidad de las lenguas habladas del mundo.

Aunque en 2018 la traducción automática (TA) de calidad seguía siendo un reto para la mayoría de pares de idiomas, el desarrollo de este campo en los últimos años hace que este cerca de ser una realidad. La conjunción dentro de NMT (Traducción automática neuronal) del aprendizaje profundo (Deep Learning), con la clara aportación de los embeddings, y de las técnicas neuronales ha conseguido unos resultados que parecían impensables hace tres años.

Por otro lado las empresas usuarias y los usuarios particulares se han familiarizado con las ventajas y limitaciones del uso de esta tecnología. Mientras las primeras se focalizan en aumentar la productividad, combinando las memorias de traducción, las herramientas de TA y los entornos de postedición; los segundos la usan intensivamente a pesar de que en muchos casos, sobre todo para idiomas con recursos limitados, la calidad que ofrecen no es comparable a la traducción profesional. Esto hace que la demanda, tanto profesional como social (agenda digital), vaya en aumento.

Este proyecto, coordinado por el grupo IXA da UPV/ EHU, propone investigar en técnicas para mejorar el estado del arte de los sistemas de TA de aprendizaje profundo y neuronales. Cuenta con la colaboración de la Fundación Elhuyar, y el CiTIUS.

Objetivos

De forma más específica, los objetivos del proyecto son los siguientes:

  • Mejora de la calidad de la traducción NMT y obtención de evaluaciones fiables. Hay diversas carencias, sobre todo de cara a la fidelidad del texto generado, que deben ser estudiadas y solucionadas: segmentos sin traducir, problemas con terminología, entidades nombradas, cantidades y adjetivos. También es importante mejorar los tiempos de aprendizaje y ejecución de estos sistemas.
  • Nuevas aportaciones para traducción automática para idiomas con pocos recursos. Dentro de los resultados del proyecto TADEEP es de resaltar el alto impacto que ha obtenido esta línea de investigación, con publicaciones en los foros más importantes del área (ACL, EMNLP, AAAI, ICLR). Profundizar en esta línea es una de las claves de este proyecto para conseguir publicaciones de impacto.
  • MT adaptado a dominios específicos y transferencia al entorno empresarial, además de la aplicación del paradigma NMT a otros problemas seq2seq (corrección gramatical, por ejemplo). Es la parte más aplicada del proyecto que se presenta pero que intenta resolver necesidades reales del entorno empresarial y social cercano.