Integrando contenido estructurado en el procesamiento de lenguaje visual
- Autores
- Eisenschlos, Julián Martín
- Año de publicación
- 2026
- Idioma
- español castellano
- Tipo de recurso
- tesis doctoral
- Estado
- versión publicada
- Colaborador/a o director/a de tesis
- Benotti, Luciana
- Descripción
- Tesis (Doctor en Ciencias de la Computación)--Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación, 2026.
Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.
Si bien hoy en día se dispone de grandes cantidades de información digital, gran parte de ella sigue siendo inaccesible debido a formatos incompatibles y presentaciones complejas e inconsistentes, particularmente en forma de "lenguaje visual" como tablas, gráficos y diagramas. A pesar de los avances significativos en procesamiento de lenguaje natural y visión por computadora impulsados por el deep learning, la intersección de estos campos para interpretar la disposición estructural bidimensional de texto e imágenes sigue siendo poco explorada. Esta tesis tiene como objetivo mejorar la capacidad de los modelos de inteligencia artificial para interpretar, integrar y generar lenguaje visual con el fin de democratizar el acceso a los datos y mejorar la toma de decisiones en la sociedad. Al vincular el procesamiento de texto, el procesamiento de imágenes y las metodologías de bases de datos, esta investigación explora técnicas de modelado novedosas para la disposición jerárquica de documentos y métodos auto-supervisados que aprovechan datos web a gran escala sin etiquetar. Específicamente, el trabajo establece benchmarks y herramientas de código abierto para la lectura de tablas e interpretación de gráficos, utilizando transfer learning generativo para mejorar tareas discriminativas como visual question answering. Además, la tesis aborda la confiabilidad y adaptabilidad de estos modelos multimodales cuantificando la incertidumbre para tecnologías asistivas más seguras, y desarrollando técnicas para integrar vocabulario novedoso de manera fluida y actualizar conocimiento con marcas temporales
While vast amounts of digital information are available today, much of it remains inaccessible due to incompatible formats and complex, inconsistent presentations, particularly in the form of "visual language" such as tables, charts, and diagrams. Despite significant advancements in natural language processing and computer vision driven by deep learning, the intersection of these fields to interpret the two-dimensional structural arrangement of text and images remains under-explored. This thesis aims to enhance artificial intelligence models' ability to interpret, integrate, and generate visual language to democratize data access and improve societal decision-making. By bridging text processing, image processing, and database methodologies, this research investigates novel modeling techniques for hierarchical document arrangements and self-supervised methods that leverage large-scale, unlabeled web data. Specifically, the work establishes benchmarks and open-source tools for reading tables and interpreting charts, utilizing generative transfer learning to improve discriminative tasks like visual question answering. Furthermore, the thesis addresses the reliability and adaptability of these multi-modal models by quantifying uncertainty for safer assistive technologies, and by developing techniques to seamlessly integrate novel vocabulary and update time-stamped knowledge.
Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina. - Materia
-
Artificial intelligence
Machine learning
Inteligencia artificial
Aprendizaje automático
Procesamiento de lenguaje natural
Visión por computadora
Lenguaje visual
Incertidumbre multimodal - Nivel de accesibilidad
- acceso abierto
- Condiciones de uso
- Repositorio
.jpg)
- Institución
- Universidad Nacional de Córdoba
- OAI Identificador
- oai:rdu.unc.edu.ar:11086/562635
Ver los metadatos del registro completo
| id |
RDUUNC_b4accdea2397cfe6eddb60a10388bfad |
|---|---|
| oai_identifier_str |
oai:rdu.unc.edu.ar:11086/562635 |
| network_acronym_str |
RDUUNC |
| repository_id_str |
2572 |
| network_name_str |
Repositorio Digital Universitario (UNC) |
| spelling |
Integrando contenido estructurado en el procesamiento de lenguaje visualEisenschlos, Julián MartínArtificial intelligenceMachine learningInteligencia artificialAprendizaje automáticoProcesamiento de lenguaje naturalVisión por computadoraLenguaje visualIncertidumbre multimodalTesis (Doctor en Ciencias de la Computación)--Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación, 2026.Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.Si bien hoy en día se dispone de grandes cantidades de información digital, gran parte de ella sigue siendo inaccesible debido a formatos incompatibles y presentaciones complejas e inconsistentes, particularmente en forma de "lenguaje visual" como tablas, gráficos y diagramas. A pesar de los avances significativos en procesamiento de lenguaje natural y visión por computadora impulsados por el deep learning, la intersección de estos campos para interpretar la disposición estructural bidimensional de texto e imágenes sigue siendo poco explorada. Esta tesis tiene como objetivo mejorar la capacidad de los modelos de inteligencia artificial para interpretar, integrar y generar lenguaje visual con el fin de democratizar el acceso a los datos y mejorar la toma de decisiones en la sociedad. Al vincular el procesamiento de texto, el procesamiento de imágenes y las metodologías de bases de datos, esta investigación explora técnicas de modelado novedosas para la disposición jerárquica de documentos y métodos auto-supervisados que aprovechan datos web a gran escala sin etiquetar. Específicamente, el trabajo establece benchmarks y herramientas de código abierto para la lectura de tablas e interpretación de gráficos, utilizando transfer learning generativo para mejorar tareas discriminativas como visual question answering. Además, la tesis aborda la confiabilidad y adaptabilidad de estos modelos multimodales cuantificando la incertidumbre para tecnologías asistivas más seguras, y desarrollando técnicas para integrar vocabulario novedoso de manera fluida y actualizar conocimiento con marcas temporalesWhile vast amounts of digital information are available today, much of it remains inaccessible due to incompatible formats and complex, inconsistent presentations, particularly in the form of "visual language" such as tables, charts, and diagrams. Despite significant advancements in natural language processing and computer vision driven by deep learning, the intersection of these fields to interpret the two-dimensional structural arrangement of text and images remains under-explored. This thesis aims to enhance artificial intelligence models' ability to interpret, integrate, and generate visual language to democratize data access and improve societal decision-making. By bridging text processing, image processing, and database methodologies, this research investigates novel modeling techniques for hierarchical document arrangements and self-supervised methods that leverage large-scale, unlabeled web data. Specifically, the work establishes benchmarks and open-source tools for reading tables and interpreting charts, utilizing generative transfer learning to improve discriminative tasks like visual question answering. Furthermore, the thesis addresses the reliability and adaptability of these multi-modal models by quantifying uncertainty for safer assistive technologies, and by developing techniques to seamlessly integrate novel vocabulary and update time-stamped knowledge.Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina.Benotti, Luciana2026-05info:eu-repo/semantics/doctoralThesisinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_db06info:ar-repo/semantics/tesisDoctoralapplication/pdfhttp://hdl.handle.net/11086/562635spainfo:eu-repo/semantics/openAccessreponame:Repositorio Digital Universitario (UNC)instname:Universidad Nacional de Córdobainstacron:UNC2026-10-01T10:22:26Zoai:rdu.unc.edu.ar:11086/562635Institucionalhttps://rdu.unc.edu.ar/Universidad públicaNo correspondehttp://rdu.unc.edu.ar/oai/snrdoca.unc@gmail.comArgentinaNo correspondeNo correspondeNo correspondeopendoar:25722026-10-01 10:22:28.406Repositorio Digital Universitario (UNC) - Universidad Nacional de Córdobafalse |
| dc.title.none.fl_str_mv |
Integrando contenido estructurado en el procesamiento de lenguaje visual |
| title |
Integrando contenido estructurado en el procesamiento de lenguaje visual |
| spellingShingle |
Integrando contenido estructurado en el procesamiento de lenguaje visual Eisenschlos, Julián Martín Artificial intelligence Machine learning Inteligencia artificial Aprendizaje automático Procesamiento de lenguaje natural Visión por computadora Lenguaje visual Incertidumbre multimodal |
| title_short |
Integrando contenido estructurado en el procesamiento de lenguaje visual |
| title_full |
Integrando contenido estructurado en el procesamiento de lenguaje visual |
| title_fullStr |
Integrando contenido estructurado en el procesamiento de lenguaje visual |
| title_full_unstemmed |
Integrando contenido estructurado en el procesamiento de lenguaje visual |
| title_sort |
Integrando contenido estructurado en el procesamiento de lenguaje visual |
| dc.creator.none.fl_str_mv |
Eisenschlos, Julián Martín |
| author |
Eisenschlos, Julián Martín |
| author_facet |
Eisenschlos, Julián Martín |
| author_role |
author |
| dc.contributor.none.fl_str_mv |
Benotti, Luciana |
| dc.subject.none.fl_str_mv |
Artificial intelligence Machine learning Inteligencia artificial Aprendizaje automático Procesamiento de lenguaje natural Visión por computadora Lenguaje visual Incertidumbre multimodal |
| topic |
Artificial intelligence Machine learning Inteligencia artificial Aprendizaje automático Procesamiento de lenguaje natural Visión por computadora Lenguaje visual Incertidumbre multimodal |
| dc.description.none.fl_txt_mv |
Tesis (Doctor en Ciencias de la Computación)--Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación, 2026. Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina. Si bien hoy en día se dispone de grandes cantidades de información digital, gran parte de ella sigue siendo inaccesible debido a formatos incompatibles y presentaciones complejas e inconsistentes, particularmente en forma de "lenguaje visual" como tablas, gráficos y diagramas. A pesar de los avances significativos en procesamiento de lenguaje natural y visión por computadora impulsados por el deep learning, la intersección de estos campos para interpretar la disposición estructural bidimensional de texto e imágenes sigue siendo poco explorada. Esta tesis tiene como objetivo mejorar la capacidad de los modelos de inteligencia artificial para interpretar, integrar y generar lenguaje visual con el fin de democratizar el acceso a los datos y mejorar la toma de decisiones en la sociedad. Al vincular el procesamiento de texto, el procesamiento de imágenes y las metodologías de bases de datos, esta investigación explora técnicas de modelado novedosas para la disposición jerárquica de documentos y métodos auto-supervisados que aprovechan datos web a gran escala sin etiquetar. Específicamente, el trabajo establece benchmarks y herramientas de código abierto para la lectura de tablas e interpretación de gráficos, utilizando transfer learning generativo para mejorar tareas discriminativas como visual question answering. Además, la tesis aborda la confiabilidad y adaptabilidad de estos modelos multimodales cuantificando la incertidumbre para tecnologías asistivas más seguras, y desarrollando técnicas para integrar vocabulario novedoso de manera fluida y actualizar conocimiento con marcas temporales While vast amounts of digital information are available today, much of it remains inaccessible due to incompatible formats and complex, inconsistent presentations, particularly in the form of "visual language" such as tables, charts, and diagrams. Despite significant advancements in natural language processing and computer vision driven by deep learning, the intersection of these fields to interpret the two-dimensional structural arrangement of text and images remains under-explored. This thesis aims to enhance artificial intelligence models' ability to interpret, integrate, and generate visual language to democratize data access and improve societal decision-making. By bridging text processing, image processing, and database methodologies, this research investigates novel modeling techniques for hierarchical document arrangements and self-supervised methods that leverage large-scale, unlabeled web data. Specifically, the work establishes benchmarks and open-source tools for reading tables and interpreting charts, utilizing generative transfer learning to improve discriminative tasks like visual question answering. Furthermore, the thesis addresses the reliability and adaptability of these multi-modal models by quantifying uncertainty for safer assistive technologies, and by developing techniques to seamlessly integrate novel vocabulary and update time-stamped knowledge. Fil: Eisenschlos, Julián Martín. Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación; Argentina. |
| description |
Tesis (Doctor en Ciencias de la Computación)--Universidad Nacional de Córdoba. Facultad de Matemática, Astronomía, Física y Computación, 2026. |
| publishDate |
2026 |
| dc.date.none.fl_str_mv |
2026-05 |
| dc.type.none.fl_str_mv |
info:eu-repo/semantics/doctoralThesis info:eu-repo/semantics/publishedVersion http://purl.org/coar/resource_type/c_db06 info:ar-repo/semantics/tesisDoctoral |
| format |
doctoralThesis |
| status_str |
publishedVersion |
| dc.identifier.none.fl_str_mv |
http://hdl.handle.net/11086/562635 |
| url |
http://hdl.handle.net/11086/562635 |
| dc.language.none.fl_str_mv |
spa |
| language |
spa |
| dc.rights.none.fl_str_mv |
info:eu-repo/semantics/openAccess |
| eu_rights_str_mv |
openAccess |
| dc.format.none.fl_str_mv |
application/pdf |
| dc.source.none.fl_str_mv |
reponame:Repositorio Digital Universitario (UNC) instname:Universidad Nacional de Córdoba instacron:UNC |
| reponame_str |
Repositorio Digital Universitario (UNC) |
| collection |
Repositorio Digital Universitario (UNC) |
| instname_str |
Universidad Nacional de Córdoba |
| instacron_str |
UNC |
| institution |
UNC |
| repository.name.fl_str_mv |
Repositorio Digital Universitario (UNC) - Universidad Nacional de Córdoba |
| repository.mail.fl_str_mv |
oca.unc@gmail.com |
| _version_ |
1877859121744576512 |
| score |
12.854657 |