Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento

Autores
Nusch, Carlos Javier; Bazzana Tanevitch, Luciana; Torres, Diego; Cagnina, Leticia Cecilia; Antonelli, Rubén Leandro; Errecalde, Marcelo Luis; cesgi
Año de publicación
2026
Idioma
español castellano
Tipo de recurso
documento de conferencia
Estado
versión publicada
Descripción
Este trabajo se inscribe en un proyecto más amplio orientado al estudio del discurso amoroso mediante herramientas computacionales. En esta oportunidad, nos concentramos en un corpus de poesía latina del período clásico, la obra de Cayo Valerio Catulo, cuya densidad semántica e histórica vuelve especialmente relevante la identificación y desambiguación de referencias a personas, lugares y grupos. Dada la naturaleza de los textos poéticos, estas entidades suelen aparecer en contextos altamente alusivos, con variación morfológica, ambigüedad semántica y recursos estilísticos como el hipérbaton, lo que dificulta su tratamiento automático. Para abordar este problema, evaluamos comparativamente dos enfoques de entity linking sobre Wikidata: un pipeline modular basado en reconocimiento de entidades, generación de candidatos y ranking semántico, y un enfoque generativo basado en GPT-4.1, utilizado tanto para la detección de menciones como para la selección final de entidades. La evaluación se apoya en un ground truth manual y distingue entre reconocimiento de entidades y enlazado semántico. Los resultados muestran comportamientos complementarios: el pipeline tradicional ofrece mayor trazabilidad y mejor cobertura del espacio de candidatos, mientras que el enfoque generativo alcanza mayor precisión en detección y mejor desempeño en la selección final de entidades, aunque con una estrategia más conservadora. En conjunto, el trabajo aporta una evaluación comparativa de métodos para poesía latina y sienta las bases para el enriquecimiento de una edición digital en XML-TEI con identificadores auditables y el diseño de un grafo de conocimiento literario.
This work forms part of a broader project aimed at studying love discourse through computational methods. In this paper, we focus on a corpus of Classical Latin poetry, namely the works of Gaius Valerius Catullus, whose semantic and historical density makes the identification and disambiguation of references to people, places, and groups especially relevant. Given the nature of poetic texts, such entities often appear in highly allusive contexts, with morphological variation, semantic ambiguity, and stylistic devices such as hyperbaton, which make their automatic processing particularly challenging. To address this problem, we comparatively evaluate two entity linking approaches over Wikidata: a modular pipeline based on named entity recognition, candidate generation, and semantic ranking, and a generative approach based on GPT-4.1, used both for mention detection and for final entity selection. The evaluation relies on a manually curated ground truth and distinguishes between named entity recognition and semantic linking. The results show complementary behaviors: the traditional pipeline offers greater traceability and broader candidate-space coverage, whereas the generative approach achieves higher precision in mention detection and better performance in final entity selection, albeit with a more conservative strategy. Overall, the paper provides a comparative evaluation of methods for Latin poetry and lays the groundwork for enriching an XML-TEI digital edition with auditable identifiers and for Tdesigning a literary knowledge graph.v
Materia
Ciencias de la Computación
Otras Humanidades
named entity recognition
entity linking
large language models
Latin poetry
Gaius Valerius Catullus
Wikidata
XML-TEI
knowledge graph
Nivel de accesibilidad
acceso abierto
Condiciones de uso
http://creativecommons.org/licenses/by-nc-sa/4.0/
Repositorio
CIC Digital (CICBA)
Institución
Comisión de Investigaciones Científicas de la Provincia de Buenos Aires
OAI Identificador
oai:digital.cic.gba.gob.ar:11746/12751

id CICBA_da2ec4045b585f1298bbba993037f4c7
oai_identifier_str oai:digital.cic.gba.gob.ar:11746/12751
network_acronym_str CICBA
repository_id_str 9441
network_name_str CIC Digital (CICBA)
spelling Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimientoNusch, Carlos JavierBazzana Tanevitch, LucianaTorres, DiegoCagnina, Leticia CeciliaAntonelli, Rubén LeandroErrecalde, Marcelo LuiscesgiCiencias de la ComputaciónOtras Humanidadesnamed entity recognitionentity linkinglarge language modelsLatin poetryGaius Valerius CatullusWikidataXML-TEIknowledge graphEste trabajo se inscribe en un proyecto más amplio orientado al estudio del discurso amoroso mediante herramientas computacionales. En esta oportunidad, nos concentramos en un corpus de poesía latina del período clásico, la obra de Cayo Valerio Catulo, cuya densidad semántica e histórica vuelve especialmente relevante la identificación y desambiguación de referencias a personas, lugares y grupos. Dada la naturaleza de los textos poéticos, estas entidades suelen aparecer en contextos altamente alusivos, con variación morfológica, ambigüedad semántica y recursos estilísticos como el hipérbaton, lo que dificulta su tratamiento automático. Para abordar este problema, evaluamos comparativamente dos enfoques de entity linking sobre Wikidata: un pipeline modular basado en reconocimiento de entidades, generación de candidatos y ranking semántico, y un enfoque generativo basado en GPT-4.1, utilizado tanto para la detección de menciones como para la selección final de entidades. La evaluación se apoya en un ground truth manual y distingue entre reconocimiento de entidades y enlazado semántico. Los resultados muestran comportamientos complementarios: el pipeline tradicional ofrece mayor trazabilidad y mejor cobertura del espacio de candidatos, mientras que el enfoque generativo alcanza mayor precisión en detección y mejor desempeño en la selección final de entidades, aunque con una estrategia más conservadora. En conjunto, el trabajo aporta una evaluación comparativa de métodos para poesía latina y sienta las bases para el enriquecimiento de una edición digital en XML-TEI con identificadores auditables y el diseño de un grafo de conocimiento literario.This work forms part of a broader project aimed at studying love discourse through computational methods. In this paper, we focus on a corpus of Classical Latin poetry, namely the works of Gaius Valerius Catullus, whose semantic and historical density makes the identification and disambiguation of references to people, places, and groups especially relevant. Given the nature of poetic texts, such entities often appear in highly allusive contexts, with morphological variation, semantic ambiguity, and stylistic devices such as hyperbaton, which make their automatic processing particularly challenging. To address this problem, we comparatively evaluate two entity linking approaches over Wikidata: a modular pipeline based on named entity recognition, candidate generation, and semantic ranking, and a generative approach based on GPT-4.1, used both for mention detection and for final entity selection. The evaluation relies on a manually curated ground truth and distinguishes between named entity recognition and semantic linking. The results show complementary behaviors: the traditional pipeline offers greater traceability and broader candidate-space coverage, whereas the generative approach achieves higher precision in mention detection and better performance in final entity selection, albeit with a more conservative strategy. Overall, the paper provides a comparative evaluation of methods for Latin poetry and lays the groundwork for enriching an XML-TEI digital edition with auditable identifiers and for Tdesigning a literary knowledge graph.v2026info:eu-repo/semantics/conferenceObjectinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_5794info:ar-repo/semantics/documentoDeConferenciaapplication/pdfapplication/pdfhttps://digital.cic.gba.gob.ar/handle/11746/12751spainfo:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-sa/4.0/reponame:CIC Digital (CICBA)instname:Comisión de Investigaciones Científicas de la Provincia de Buenos Airesinstacron:CICBA2026-09-24T11:31:51Zoai:digital.cic.gba.gob.ar:11746/12751Institucionalhttp://digital.cic.gba.gob.arOrganismo científico-tecnológicoNo correspondehttp://digital.cic.gba.gob.ar/oai/snrdmarisa.degiusti@sedici.unlp.edu.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:94412026-09-24 11:31:52.304CIC Digital (CICBA) - Comisión de Investigaciones Científicas de la Provincia de Buenos Airesfalse
dc.title.none.fl_str_mv Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento
title Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento
spellingShingle Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento
Nusch, Carlos Javier
Ciencias de la Computación
Otras Humanidades
named entity recognition
entity linking
large language models
Latin poetry
Gaius Valerius Catullus
Wikidata
XML-TEI
knowledge graph
title_short Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento
title_full Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento
title_fullStr Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento
title_full_unstemmed Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento
title_sort Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento
dc.creator.none.fl_str_mv Nusch, Carlos Javier
Bazzana Tanevitch, Luciana
Torres, Diego
Cagnina, Leticia Cecilia
Antonelli, Rubén Leandro
Errecalde, Marcelo Luis
cesgi
author Nusch, Carlos Javier
author_facet Nusch, Carlos Javier
Bazzana Tanevitch, Luciana
Torres, Diego
Cagnina, Leticia Cecilia
Antonelli, Rubén Leandro
Errecalde, Marcelo Luis
cesgi
author_role author
author2 Bazzana Tanevitch, Luciana
Torres, Diego
Cagnina, Leticia Cecilia
Antonelli, Rubén Leandro
Errecalde, Marcelo Luis
cesgi
author2_role author
author
author
author
author
author
dc.subject.none.fl_str_mv Ciencias de la Computación
Otras Humanidades
named entity recognition
entity linking
large language models
Latin poetry
Gaius Valerius Catullus
Wikidata
XML-TEI
knowledge graph
topic Ciencias de la Computación
Otras Humanidades
named entity recognition
entity linking
large language models
Latin poetry
Gaius Valerius Catullus
Wikidata
XML-TEI
knowledge graph
dc.description.none.fl_txt_mv Este trabajo se inscribe en un proyecto más amplio orientado al estudio del discurso amoroso mediante herramientas computacionales. En esta oportunidad, nos concentramos en un corpus de poesía latina del período clásico, la obra de Cayo Valerio Catulo, cuya densidad semántica e histórica vuelve especialmente relevante la identificación y desambiguación de referencias a personas, lugares y grupos. Dada la naturaleza de los textos poéticos, estas entidades suelen aparecer en contextos altamente alusivos, con variación morfológica, ambigüedad semántica y recursos estilísticos como el hipérbaton, lo que dificulta su tratamiento automático. Para abordar este problema, evaluamos comparativamente dos enfoques de entity linking sobre Wikidata: un pipeline modular basado en reconocimiento de entidades, generación de candidatos y ranking semántico, y un enfoque generativo basado en GPT-4.1, utilizado tanto para la detección de menciones como para la selección final de entidades. La evaluación se apoya en un ground truth manual y distingue entre reconocimiento de entidades y enlazado semántico. Los resultados muestran comportamientos complementarios: el pipeline tradicional ofrece mayor trazabilidad y mejor cobertura del espacio de candidatos, mientras que el enfoque generativo alcanza mayor precisión en detección y mejor desempeño en la selección final de entidades, aunque con una estrategia más conservadora. En conjunto, el trabajo aporta una evaluación comparativa de métodos para poesía latina y sienta las bases para el enriquecimiento de una edición digital en XML-TEI con identificadores auditables y el diseño de un grafo de conocimiento literario.
This work forms part of a broader project aimed at studying love discourse through computational methods. In this paper, we focus on a corpus of Classical Latin poetry, namely the works of Gaius Valerius Catullus, whose semantic and historical density makes the identification and disambiguation of references to people, places, and groups especially relevant. Given the nature of poetic texts, such entities often appear in highly allusive contexts, with morphological variation, semantic ambiguity, and stylistic devices such as hyperbaton, which make their automatic processing particularly challenging. To address this problem, we comparatively evaluate two entity linking approaches over Wikidata: a modular pipeline based on named entity recognition, candidate generation, and semantic ranking, and a generative approach based on GPT-4.1, used both for mention detection and for final entity selection. The evaluation relies on a manually curated ground truth and distinguishes between named entity recognition and semantic linking. The results show complementary behaviors: the traditional pipeline offers greater traceability and broader candidate-space coverage, whereas the generative approach achieves higher precision in mention detection and better performance in final entity selection, albeit with a more conservative strategy. Overall, the paper provides a comparative evaluation of methods for Latin poetry and lays the groundwork for enriching an XML-TEI digital edition with auditable identifiers and for Tdesigning a literary knowledge graph.v
description Este trabajo se inscribe en un proyecto más amplio orientado al estudio del discurso amoroso mediante herramientas computacionales. En esta oportunidad, nos concentramos en un corpus de poesía latina del período clásico, la obra de Cayo Valerio Catulo, cuya densidad semántica e histórica vuelve especialmente relevante la identificación y desambiguación de referencias a personas, lugares y grupos. Dada la naturaleza de los textos poéticos, estas entidades suelen aparecer en contextos altamente alusivos, con variación morfológica, ambigüedad semántica y recursos estilísticos como el hipérbaton, lo que dificulta su tratamiento automático. Para abordar este problema, evaluamos comparativamente dos enfoques de entity linking sobre Wikidata: un pipeline modular basado en reconocimiento de entidades, generación de candidatos y ranking semántico, y un enfoque generativo basado en GPT-4.1, utilizado tanto para la detección de menciones como para la selección final de entidades. La evaluación se apoya en un ground truth manual y distingue entre reconocimiento de entidades y enlazado semántico. Los resultados muestran comportamientos complementarios: el pipeline tradicional ofrece mayor trazabilidad y mejor cobertura del espacio de candidatos, mientras que el enfoque generativo alcanza mayor precisión en detección y mejor desempeño en la selección final de entidades, aunque con una estrategia más conservadora. En conjunto, el trabajo aporta una evaluación comparativa de métodos para poesía latina y sienta las bases para el enriquecimiento de una edición digital en XML-TEI con identificadores auditables y el diseño de un grafo de conocimiento literario.
publishDate 2026
dc.date.none.fl_str_mv 2026
dc.type.none.fl_str_mv info:eu-repo/semantics/conferenceObject
info:eu-repo/semantics/publishedVersion
http://purl.org/coar/resource_type/c_5794
info:ar-repo/semantics/documentoDeConferencia
format conferenceObject
status_str publishedVersion
dc.identifier.none.fl_str_mv https://digital.cic.gba.gob.ar/handle/11746/12751
url https://digital.cic.gba.gob.ar/handle/11746/12751
dc.language.none.fl_str_mv spa
language spa
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
http://creativecommons.org/licenses/by-nc-sa/4.0/
eu_rights_str_mv openAccess
rights_invalid_str_mv http://creativecommons.org/licenses/by-nc-sa/4.0/
dc.format.none.fl_str_mv application/pdf
application/pdf
dc.source.none.fl_str_mv reponame:CIC Digital (CICBA)
instname:Comisión de Investigaciones Científicas de la Provincia de Buenos Aires
instacron:CICBA
reponame_str CIC Digital (CICBA)
collection CIC Digital (CICBA)
instname_str Comisión de Investigaciones Científicas de la Provincia de Buenos Aires
instacron_str CICBA
institution CICBA
repository.name.fl_str_mv CIC Digital (CICBA) - Comisión de Investigaciones Científicas de la Provincia de Buenos Aires
repository.mail.fl_str_mv marisa.degiusti@sedici.unlp.edu.ar
_version_ 1877226499814195200
score 12.754232