El "Old Spanish Textual Archive", diseño y desarrollo de un corpus de textos medievales: lematización y etiquetado gramatical


  • Francisco Gago Jover College of the Holy Cross (USA)
  • Francisco Javier Pueyo Mena College of the Holy Cross (USA)


Este trabajo expone los aspectos relacionados con el procesamiento de las formas, lemas, análisis gramatical y textos en el Old Spanish Textual Archive (OSTA), un corpus lingüístico de más de 32 millones de palabras, basado en las más de 400 transcripciones semi-paleográficas de textos medievales escritos en castellano, asturiano, leonés, navarro-aragonés y aragonés realizadas por los colaboradores del Hispanic Seminary of Medieval Studies (HSMS). Se describe además el proceso de etiquetado y lematización mediante el uso de Freeling, una herramienta de  Procesamiento del Lenguaje Natural, y de HSMS-app, una herramienta de análisis textual desarrollada para este proyecto.


diseño de corpus electrónicos, anotación de corpus, corpus digitalizado del castellano antiguo, español medieval


