EXTRA-LEX: Extracción automática de léxicos bilingües galego-español y la actualización de los recursos lexicográficos de motores de traducción automática

Este proyecto quiere elaborar un extractor automático de léxicos bilingües para el par de lenguas gallego y español, y usar los léxicos extraídos en la mejora y actualización de los diccionarios computacionales explotados por sistemas de traducción automática. El método de extracción estará basado en técnicas de explotación de corpus no-paralelos de temática comparable.

Se prestará especial atención al aprendizaje automático de equivalentes de traducción de expresiones multipalabra, poco presentes en recursos lingüísticos construidos manualmente y fundamentales para mejorar la calidad de los motores de traducción. En concreto, se trabaja en la mejora y actualización de los recursos lexicográficos del motor de traducción de código abierto Open Trad.

Objetivos

  • Elaboración de un corpus mediante técnicas de crawling en la web.
  • Identificador de lengua.
  • Identificador y extractor de términos multipalabra.
  • Extracción automática de léxicos bilingües a partir de corpus no-paralelos.
  • Uso de estos léxicos en el mantenimiento, mejora y constante actualización de los diccionarios del sistema de traducción automática bidireccional Open Trad.
Enlace a la página web del proyecto