Integrando contenido estructurado en el procesamiento de lenguaje visual

Autores
Eisenschlos, Julián Martín
Año de publicación
2026
Idioma
español castellano
Tipo de recurso
tesis doctoral
Estado
versión publicada
Colaborador/a o director/a de tesis
Benotti, Luciana
Descripción
Tesis (Doctor en Ciencias de la Computación)--Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación, 2026.
Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.
Si bien hoy en día se dispone de grandes cantidades de información digital, gran parte de ella sigue siendo inaccesible debido a formatos incompatibles y presentaciones complejas e inconsistentes, particularmente en forma de "lenguaje visual" como tablas, gráficos y diagramas. A pesar de los avances significativos en procesamiento de lenguaje natural y visión por computadora impulsados por el deep learning, la intersección de estos campos para interpretar la disposición estructural bidimensional de texto e imágenes sigue siendo poco explorada. Esta tesis tiene como objetivo mejorar la capacidad de los modelos de inteligencia artificial para interpretar, integrar y generar lenguaje visual con el fin de democratizar el acceso a los datos y mejorar la toma de decisiones en la sociedad. Al vincular el procesamiento de texto, el procesamiento de imágenes y las metodologías de bases de datos, esta investigación explora técnicas de modelado novedosas para la disposición jerárquica de documentos y métodos auto-supervisados que aprovechan datos web a gran escala sin etiquetar. Específicamente, el trabajo establece benchmarks y herramientas de código abierto para la lectura de tablas e interpretación de gráficos, utilizando transfer learning generativo para mejorar tareas discriminativas como visual question answering. Además, la tesis aborda la confiabilidad y adaptabilidad de estos modelos multimodales cuantificando la incertidumbre para tecnologías asistivas más seguras, y desarrollando técnicas para integrar vocabulario novedoso de manera fluida y actualizar conocimiento con marcas temporales
While vast amounts of digital information are available today, much of it remains inaccessible due to incompatible formats and complex, inconsistent presentations, particularly in the form of "visual language" such as tables, charts, and diagrams. Despite significant advancements in natural language processing and computer vision driven by deep learning, the intersection of these fields to interpret the two-dimensional structural arrangement of text and images remains under-explored. This thesis aims to enhance artificial intelligence models' ability to interpret, integrate, and generate visual language to democratize data access and improve societal decision-making. By bridging text processing, image processing, and database methodologies, this research investigates novel modeling techniques for hierarchical document arrangements and self-supervised methods that leverage large-scale, unlabeled web data. Specifically, the work establishes benchmarks and open-source tools for reading tables and interpreting charts, utilizing generative transfer learning to improve discriminative tasks like visual question answering. Furthermore, the thesis addresses the reliability and adaptability of these multi-modal models by quantifying uncertainty for safer assistive technologies, and by developing techniques to seamlessly integrate novel vocabulary and update time-stamped knowledge.
Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.
Materia
Artificial intelligence
Machine learning
Inteligencia artificial
Aprendizaje automático
Procesamiento de lenguaje natural
Visión por computadora
Lenguaje visual
Incertidumbre multimodal
Nivel de accesibilidad
acceso abierto
Condiciones de uso
Repositorio
Repositorio Digital Universitario (UNC)
Institución
Universidad Nacional de Córdoba
OAI Identificador
oai:rdu.unc.edu.ar:11086/562635

id RDUUNC_b4accdea2397cfe6eddb60a10388bfad
oai_identifier_str oai:rdu.unc.edu.ar:11086/562635
network_acronym_str RDUUNC
repository_id_str 2572
network_name_str Repositorio Digital Universitario (UNC)
spelling Integrando contenido estructurado en el procesamiento de lenguaje visualEisenschlos, Julián MartínArtificial intelligenceMachine learningInteligencia artificialAprendizaje automáticoProcesamiento de lenguaje naturalVisión por computadoraLenguaje visualIncertidumbre multimodalTesis (Doctor en Ciencias de la Computación)--Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación, 2026.Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.Si bien hoy en día se dispone de grandes cantidades de información digital, gran parte de ella sigue siendo inaccesible debido a formatos incompatibles y presentaciones complejas e inconsistentes, particularmente en forma de "lenguaje visual" como tablas, gráficos y diagramas. A pesar de los avances significativos en procesamiento de lenguaje natural y visión por computadora impulsados por el deep learning, la intersección de estos campos para interpretar la disposición estructural bidimensional de texto e imágenes sigue siendo poco explorada. Esta tesis tiene como objetivo mejorar la capacidad de los modelos de inteligencia artificial para interpretar, integrar y generar lenguaje visual con el fin de democratizar el acceso a los datos y mejorar la toma de decisiones en la sociedad. Al vincular el procesamiento de texto, el procesamiento de imágenes y las metodologías de bases de datos, esta investigación explora técnicas de modelado novedosas para la disposición jerárquica de documentos y métodos auto-supervisados que aprovechan datos web a gran escala sin etiquetar. Específicamente, el trabajo establece benchmarks y herramientas de código abierto para la lectura de tablas e interpretación de gráficos, utilizando transfer learning generativo para mejorar tareas discriminativas como visual question answering. Además, la tesis aborda la confiabilidad y adaptabilidad de estos modelos multimodales cuantificando la incertidumbre para tecnologías asistivas más seguras, y desarrollando técnicas para integrar vocabulario novedoso de manera fluida y actualizar conocimiento con marcas temporalesWhile vast amounts of digital information are available today, much of it remains inaccessible due to incompatible formats and complex, inconsistent presentations, particularly in the form of "visual language" such as tables, charts, and diagrams. Despite significant advancements in natural language processing and computer vision driven by deep learning, the intersection of these fields to interpret the two-dimensional structural arrangement of text and images remains under-explored. This thesis aims to enhance artificial intelligence models' ability to interpret, integrate, and generate visual language to democratize data access and improve societal decision-making. By bridging text processing, image processing, and database methodologies, this research investigates novel modeling techniques for hierarchical document arrangements and self-supervised methods that leverage large-scale, unlabeled web data. Specifically, the work establishes benchmarks and open-source tools for reading tables and interpreting charts, utilizing generative transfer learning to improve discriminative tasks like visual question answering. Furthermore, the thesis addresses the reliability and adaptability of these multi-modal models by quantifying uncertainty for safer assistive technologies, and by developing techniques to seamlessly integrate novel vocabulary and update time-stamped knowledge.Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.Benotti, Luciana2026-05info:eu-repo/semantics/doctoralThesisinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_db06info:ar-repo/semantics/tesisDoctoralapplication/pdfhttp://hdl.handle.net/11086/562635spainfo:eu-repo/semantics/openAccessreponame:Repositorio Digital Universitario (UNC)instname:Universidad Nacional de Córdobainstacron:UNC2026-10-01T10:22:26Zoai:rdu.unc.edu.ar:11086/562635Institucionalhttps://rdu.unc.edu.ar/Universidad públicaNo correspondehttp://rdu.unc.edu.ar/oai/snrdoca.unc@gmail.comArgentinaNo correspondeNo correspondeNo correspondeopendoar:25722026-10-01 10:22:28.406Repositorio Digital Universitario (UNC) - Universidad Nacional de Córdobafalse
dc.title.none.fl_str_mv Integrando contenido estructurado en el procesamiento de lenguaje visual
title Integrando contenido estructurado en el procesamiento de lenguaje visual
spellingShingle Integrando contenido estructurado en el procesamiento de lenguaje visual
Eisenschlos, Julián Martín
Artificial intelligence
Machine learning
Inteligencia artificial
Aprendizaje automático
Procesamiento de lenguaje natural
Visión por computadora
Lenguaje visual
Incertidumbre multimodal
title_short Integrando contenido estructurado en el procesamiento de lenguaje visual
title_full Integrando contenido estructurado en el procesamiento de lenguaje visual
title_fullStr Integrando contenido estructurado en el procesamiento de lenguaje visual
title_full_unstemmed Integrando contenido estructurado en el procesamiento de lenguaje visual
title_sort Integrando contenido estructurado en el procesamiento de lenguaje visual
dc.creator.none.fl_str_mv Eisenschlos, Julián Martín
author Eisenschlos, Julián Martín
author_facet Eisenschlos, Julián Martín
author_role author
dc.contributor.none.fl_str_mv Benotti, Luciana
dc.subject.none.fl_str_mv Artificial intelligence
Machine learning
Inteligencia artificial
Aprendizaje automático
Procesamiento de lenguaje natural
Visión por computadora
Lenguaje visual
Incertidumbre multimodal
topic Artificial intelligence
Machine learning
Inteligencia artificial
Aprendizaje automático
Procesamiento de lenguaje natural
Visión por computadora
Lenguaje visual
Incertidumbre multimodal
dc.description.none.fl_txt_mv Tesis (Doctor en Ciencias de la Computación)--Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación, 2026.
Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.
Si bien hoy en día se dispone de grandes cantidades de información digital, gran parte de ella sigue siendo inaccesible debido a formatos incompatibles y presentaciones complejas e inconsistentes, particularmente en forma de "lenguaje visual" como tablas, gráficos y diagramas. A pesar de los avances significativos en procesamiento de lenguaje natural y visión por computadora impulsados por el deep learning, la intersección de estos campos para interpretar la disposición estructural bidimensional de texto e imágenes sigue siendo poco explorada. Esta tesis tiene como objetivo mejorar la capacidad de los modelos de inteligencia artificial para interpretar, integrar y generar lenguaje visual con el fin de democratizar el acceso a los datos y mejorar la toma de decisiones en la sociedad. Al vincular el procesamiento de texto, el procesamiento de imágenes y las metodologías de bases de datos, esta investigación explora técnicas de modelado novedosas para la disposición jerárquica de documentos y métodos auto-supervisados que aprovechan datos web a gran escala sin etiquetar. Específicamente, el trabajo establece benchmarks y herramientas de código abierto para la lectura de tablas e interpretación de gráficos, utilizando transfer learning generativo para mejorar tareas discriminativas como visual question answering. Además, la tesis aborda la confiabilidad y adaptabilidad de estos modelos multimodales cuantificando la incertidumbre para tecnologías asistivas más seguras, y desarrollando técnicas para integrar vocabulario novedoso de manera fluida y actualizar conocimiento con marcas temporales
While vast amounts of digital information are available today, much of it remains inaccessible due to incompatible formats and complex, inconsistent presentations, particularly in the form of "visual language" such as tables, charts, and diagrams. Despite significant advancements in natural language processing and computer vision driven by deep learning, the intersection of these fields to interpret the two-dimensional structural arrangement of text and images remains under-explored. This thesis aims to enhance artificial intelligence models' ability to interpret, integrate, and generate visual language to democratize data access and improve societal decision-making. By bridging text processing, image processing, and database methodologies, this research investigates novel modeling techniques for hierarchical document arrangements and self-supervised methods that leverage large-scale, unlabeled web data. Specifically, the work establishes benchmarks and open-source tools for reading tables and interpreting charts, utilizing generative transfer learning to improve discriminative tasks like visual question answering. Furthermore, the thesis addresses the reliability and adaptability of these multi-modal models by quantifying uncertainty for safer assistive technologies, and by developing techniques to seamlessly integrate novel vocabulary and update time-stamped knowledge.
Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.
description Tesis (Doctor en Ciencias de la Computación)--Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación, 2026.
publishDate 2026
dc.date.none.fl_str_mv 2026-05
dc.type.none.fl_str_mv info:eu-repo/semantics/doctoralThesis
info:eu-repo/semantics/publishedVersion
http://purl.org/coar/resource_type/c_db06
info:ar-repo/semantics/tesisDoctoral
format doctoralThesis
status_str publishedVersion
dc.identifier.none.fl_str_mv http://hdl.handle.net/11086/562635
url http://hdl.handle.net/11086/562635
dc.language.none.fl_str_mv spa
language spa
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.source.none.fl_str_mv reponame:Repositorio Digital Universitario (UNC)
instname:Universidad Nacional de Córdoba
instacron:UNC
reponame_str Repositorio Digital Universitario (UNC)
collection Repositorio Digital Universitario (UNC)
instname_str Universidad Nacional de Córdoba
instacron_str UNC
institution UNC
repository.name.fl_str_mv Repositorio Digital Universitario (UNC) - Universidad Nacional de Córdoba
repository.mail.fl_str_mv oca.unc@gmail.com
_version_ 1877859121744576512
score 12.854657