EXTRA-LEX: Extracción automática de léxicos bilingües galego-español y la actualización de los recursos lexicográficos de motores de traducción automática
Este proyecto quiere elaborar un extractor automático de léxicos bilingües para el par de lenguas gallego y español, y usar los léxicos extraídos en la mejora y actualización de los diccionarios computacionales explotados por sistemas de traducción automática. El método de extracción estará basado en técnicas de explotación de corpus no-paralelos de temática comparable.
Se prestará especial atención al aprendizaje automático de equivalentes de traducción de expresiones multipalabra, poco presentes en recursos lingüísticos construidos manualmente y fundamentales para mejorar la calidad de los motores de traducción. En concreto, se trabaja en la mejora y actualización de los recursos lexicográficos del motor de traducción de código abierto Open Trad.
Objetivos
- Elaboración de un corpus mediante técnicas de crawling en la web.
- Identificador de lengua.
- Identificador y extractor de términos multipalabra.
- Extracción automática de léxicos bilingües a partir de corpus no-paralelos.
- Uso de estos léxicos en el mantenimiento, mejora y constante actualización de los diccionarios del sistema de traducción automática bidireccional Open Trad.
Proyecto
/research/projects/extraccion-automatica-de-lexicos-bilingues-galego-espanol-e-a-actualizacion-dos-recursos-lexicograficos-de-motores-de-traducion-automatica
<p>Este proyecto quiere elaborar un extractor automático de léxicos bilingües para el par de lenguas gallego y español, y usar los léxicos extraídos en la mejora y actualización de los diccionarios computacionales explotados por sistemas de traducción automática. El método de extracción estará basado en técnicas de explotación de corpus no-paralelos de temática comparable.</p> <p>Se prestará especial atención al aprendizaje automático de equivalentes de traducción de expresiones multipalabra, poco presentes en recursos lingüísticos construidos manualmente y fundamentales para mejorar la calidad de los motores de traducción. En concreto, se trabaja en la mejora y actualización de los recursos lexicográficos del motor de traducción de código abierto Open Trad.</p><ul> <li>Elaboración de un corpus mediante técnicas de crawling en la web.</li> <li>Identificador de lengua.</li> <li>Identificador y extractor de términos multipalabra.</li> <li>Extracción automática de léxicos bilingües a partir de corpus no-paralelos.</li> <li>Uso de estos léxicos en el mantenimiento, mejora y constante actualización de los diccionarios del sistema de traducción automática bidireccional Open Trad.</li> </ul> - Pablo Gamallo Otero
projects_es