EXTRA-LEX: Extracción automática de léxicos bilingües galego-español e a actualización dos recursos lexicográficos de motores de tradución automática
Este proxecto quere elaborar un extractor automático de léxicos bilingües para o par de linguas galego e español, e usar os léxicos extraídos na mellora e actualización dos dicionarios computacionais explotados por sistemas de tradución automática. O método de extracción estará baseado en técnicas de explotación de corpus non-paralelos de temática comparable.
Prestarase especial atención á aprendizaxe automática de equivalentes de tradución de expresións multipalabra, pouco presentes en recursos lingüísticos construídos manualmente e fundamentais para mellorar a calidade dos motores de tradución. En concreto, trabállase na mellora e actualización dos recursos lexicográficos do motor de tradución de código aberto Open Trad.
Obxectivos
- Elaboración dun corpus mediante técnicas de crawling na web.
- Indetificador de lingua.
- Identificador e extractor de termos multipalabra.
- Extracción automática de léxicos bilingües a partir de corpus non-paralelos.
- Uso destes léxicos no mantemento, mellora e constante actualización dos dicionarios do sistema de tradución automática bidireccional Open Trad.
Proxecto
/research/projects/extraccion-automatica-de-lexicos-bilingues-galego-espanol-e-a-actualizacion-dos-recursos-lexicograficos-de-motores-de-traducion-automatica
<p>Este proxecto quere elaborar un extractor automático de léxicos bilingües para o par de linguas galego e español, e usar os léxicos extraídos na mellora e actualización dos dicionarios computacionais explotados por sistemas de tradución automática. O método de extracción estará baseado en técnicas de explotación de corpus non-paralelos de temática comparable.</p> <p>Prestarase especial atención á aprendizaxe automática de equivalentes de tradución de expresións multipalabra, pouco presentes en recursos lingüísticos construídos manualmente e fundamentais para mellorar a calidade dos motores de tradución. En concreto, trabállase na mellora e actualización dos recursos lexicográficos do motor de tradución de código aberto Open Trad.</p><ul> <li>Elaboración dun corpus mediante técnicas de crawling na web.</li> <li>Indetificador de lingua.</li> <li>Identificador e extractor de termos multipalabra.</li> <li>Extracción automática de léxicos bilingües a partir de corpus non-paralelos.</li> <li>Uso destes léxicos no mantemento, mellora e constante actualización dos dicionarios do sistema de tradución automática bidireccional Open Trad.</li> </ul> - Pablo Gamallo Otero
projects_gl