Minería web de textos en lenguas indígenas para desarrollar tecnologías de lenguaje. Caso de estudio: quechua sureño
Date
2022-11-09
Journal Title
Journal ISSN
Volume Title
Publisher
Pontificia Universidad Católica del Perú
Abstract
En la actualidad, para los más de 30 millones de peruanos, la información a la que accedemos
se encuentra mayormente en el idioma español. Sin embargo Perú es un país multilingüe,
posee una gran riqueza cultural y lingüística con alrededor de 47 lenguas originarias. Para
esta población encontrar textos, noticias y contenido en internet en su lengua nativa es una
tarea complicada. Existe un limitado acceso a información como lecturas, textos, noticias u
otros contenidos que en modalidad digital es muy escaso. Esto se debe a que los pocos
ciudadanos que se comunican en lenguas nativas son de manera oral y algunos hacen uso del
español sobre sus lenguas nativas.
De ese modo, existen investigaciones en el campo de la inteligencia artificial donde a partir
del poco material digital recolectado de lenguas nativas se construyeron corpus digitales para
tareas de traducción automática y detección del lenguaje. Sin embargo, aún son corpus
pequeños para elaborar traductores de calidad, presentan complicaciones en traducir textos
completos, y además díficil el aprendizaje con algoritmos complejos, como redes neuronales
profundas.
Por este motivo se propone realizar una minería web de textos en la lengua originaria
quechua sureño para incrementar la cantidad de oraciones y diversidad de dominios, evaluar
la calidad de los nuevos textos en un modelo de traducción automática de quechua a español,
y desarrollar una web de libre acceso de consulta al corpus creado.
Description
Keywords
Inteligencia artificial, Redes neuronales (Computación), Minería de datos, Quechua--Perú
Citation
Endorsement
Review
Supplemented By
Referenced By
Creative Commons license
Except where otherwised noted, this item's license is described as info:eu-repo/semantics/openAccess