Cargando…

Regionalized models for Spanish language variations based on Twitter

Spanish is one of the most spoken languages in the world. Its proliferation comes with variations in written and spoken communication among different regions. Understanding language variations can help improve model performances on regional tasks, such as those involving figurative language and loca...

Descripción completa

Detalles Bibliográficos
Autores principales:	Tellez, Eric S., Moctezuma, Daniela, Miranda, Sabino, Graff, Mario, Ruiz, Guillermo
Formato:	Online Artículo Texto
Lenguaje:	English
Publicado:	Springer Netherlands 2023
Materias:	Original Paper
Acceso en línea:	https://www.ncbi.nlm.nih.gov/pmc/articles/PMC9979884/ https://www.ncbi.nlm.nih.gov/pubmed/37360263 http://dx.doi.org/10.1007/s10579-023-09640-9

Descripción
Sumario:	Spanish is one of the most spoken languages in the world. Its proliferation comes with variations in written and spoken communication among different regions. Understanding language variations can help improve model performances on regional tasks, such as those involving figurative language and local context information. This manuscript presents and describes a set of regionalized resources for the Spanish language built on 4-year Twitter public messages geotagged in 26 Spanish-speaking countries. We introduce word embeddings based on FastText, language models based on BERT, and per-region sample corpora. We also provide a broad comparison among regions covering lexical and semantical similarities and examples of using regional resources on message classification tasks.

Regionalized models for Spanish language variations based on Twitter

Ejemplares similares