Análisis y desarrollo de representaciones generales de audio

Autores
Pepino, Leonardo Daniel
Año de publicación
2025
Idioma
español castellano
Tipo de recurso
tesis doctoral
Estado
versión publicada
Colaborador/a o director/a de tesis
Ferrer, Luciana
Riera, Pablo Ernesto
Descripción
El aprendizaje de representaciones ha sido un pilar fundamental en el avance del aprendizaje profundo, al permitir la reutilización de modelos para resolver tareas diversas de manera eficiente en términos de cómputo y datos. En particular, el aprendizaje no supervisado ha permitido aprovechar la abundancia de datos sin etiquetar para aprender representaciones ricas y útiles en escenarios con escasez de datos anotados, simplificando el desarrollo de modelos y favoreciendo la democratización de la inteligencia artificial. Este trabajo doctoral se desarrolló entre los años 2020 y 2025, en un período marcado por el auge del aprendizaje auto-supervisado de representaciones de habla y, hacia el final, por la extensión de los modelos de lenguaje a otras modalidades distintas al texto, como el audio e imágenes. En ese contexto de éxito de los modelos de representaciones de habla, y la tendencia a crear sistemas cada vez más generalistas, este trabajo consistió en el desarrollo de un modelo de representaciones de audio que fuera útil para múltiples tareas del dominio del habla, y de otros dominios como la música y los sonidos ambientales. Este desarrollo culminó con EnCodecMAE, un modelo basado en masked autoencoders y pre-entrenado con señales de audio diversas provenientes de Audioset, LibriLight y Free Music Archive. Este modelo tiene la particularidad de utilizar EnCodec, un codec de audio neuronal, como señal objetivo. EnCodecMAE alcanzó resultados comparables o superiores al estado del arte en varias tareas de habla, música y audio general. Además de presentar EnCodecMAE y mostrar los resultados de su evaluación, realizamos un estudio de ablación, explorando el efecto que tienen distintos aspectos de su diseño, como parámetros de enmascarado, representaciones de entrada, conjuntos de preentrenamiento, etc. Por último, realizamos un análisis del alineamiento entre distintas representaciones de audio, incluyendo EnCodecMAE, y representaciones cerebrales obtenidas a partir de resonancias magnéticas funcionales de la corteza auditiva. Mostramos que estos modelos, a pesar de no ser entrenados explícitamente para aproximar la actividad cerebral, exhiben un alineamiento creciente con la misma durante el preentrenamiento, y que el desempeño de las representaciones en distintas tareas se correlaciona con la similaridad con las representaciones cerebrales. Una implicancia práctica de este hallazgo es la posibilidad de utilizar medidas de alineamiento con la corteza auditiva como un indicador del desempeño general del modelo, con un costo computacional inferior al de benchmarks exhaustivos como HEAREval.
Representation learning has been fundamental for the advancement of deep learning, enabling the reuse of models to e!ciently solve diverse tasks in terms of computation and data. In particular, unsupervised learning has made it possible to leverage the abundance of unlabeled data to learn rich and useful representations in scenarios where annotated data is scarce, simplifying model development and promoting the democratization of artificial intelligence. This doctoral work was carried out between 2020 and 2025, a period marked by the rise of self-supervised learning of speech representations and, towards the end, by the extension of language models to other modalities beyond text, such as audio and images. Given the success of speech representation models and the trend towards general-purpose models, this work focused on developing an audio representation model that would be useful for multiple tasks in the speech domain, as well as in other domains such as music and environmental sounds. This e"ort culminated in EnCodecMAE, a model based on masked autoencoders and pre-trained with diverse audio signals from Audioset, LibriLight, and Free Music Archive. A distinctive feature of this model is the use of EnCodec, a neural audio codec, as the target signal. EnCodecMAE achieved results comparable to or surpassing the state of the art in various speech, music, and general audio tasks. In addition to presenting EnCodecMAE and showcasing its evaluation results, we conducted an ablation study, exploring the e"ects of various design choices, such as masking parameters, input representations, and pretraining datasets. Finally, we analyzed the alignment between di"erent audio representations—including EnCodecMAE—and brain representations obtained from functional magnetic resonance imaging (fMRI) of the auditory cortex. We show that these models, despite not being explicitly trained to approximate brain activity, exhibit increasing alignment with it during pretraining, and that the performance of the representations across tasks correlates with their similarity to brain representations. A practical implication of this finding is the possibility of using the alignment with the auditory cortex as a proxy of a model’s general performance, at a lower computational cost than exhaustive benchmarks such as HEAREval.
Fil: Pepino, Leonardo Daniel. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina.
Materia
APRENDIZAJE DE REPRESENTACIONES
AUTO-SUPERVISION
PROCESAMIENTO DE AUDIO
NEUROCONEXIONISMO
TRANSFERENCIA DE APRENDIZAJE
REPRESENTATION LEARNING
SELF-SUPERVISION
AUDIO PROCESSING
NEUROCONNECTIONISM
TRANSFER LEARNING
Nivel de accesibilidad
acceso abierto
Condiciones de uso
https://creativecommons.org/licenses/by-nc-sa/2.5/ar
Repositorio
Biblioteca Digital (UBA-FCEN)
Institución
Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
OAI Identificador
tesis:tesis_n7882_Pepino

id BDUBAFCEN_25ae1ee459d021efebf2e90833882a08
oai_identifier_str tesis:tesis_n7882_Pepino
network_acronym_str BDUBAFCEN
repository_id_str 1896
network_name_str Biblioteca Digital (UBA-FCEN)
spelling Análisis y desarrollo de representaciones generales de audioAnalysis and design of general audio representationsPepino, Leonardo DanielAPRENDIZAJE DE REPRESENTACIONESAUTO-SUPERVISIONPROCESAMIENTO DE AUDIONEUROCONEXIONISMOTRANSFERENCIA DE APRENDIZAJEREPRESENTATION LEARNINGSELF-SUPERVISIONAUDIO PROCESSINGNEUROCONNECTIONISMTRANSFER LEARNINGEl aprendizaje de representaciones ha sido un pilar fundamental en el avance del aprendizaje profundo, al permitir la reutilización de modelos para resolver tareas diversas de manera eficiente en términos de cómputo y datos. En particular, el aprendizaje no supervisado ha permitido aprovechar la abundancia de datos sin etiquetar para aprender representaciones ricas y útiles en escenarios con escasez de datos anotados, simplificando el desarrollo de modelos y favoreciendo la democratización de la inteligencia artificial. Este trabajo doctoral se desarrolló entre los años 2020 y 2025, en un período marcado por el auge del aprendizaje auto-supervisado de representaciones de habla y, hacia el final, por la extensión de los modelos de lenguaje a otras modalidades distintas al texto, como el audio e imágenes. En ese contexto de éxito de los modelos de representaciones de habla, y la tendencia a crear sistemas cada vez más generalistas, este trabajo consistió en el desarrollo de un modelo de representaciones de audio que fuera útil para múltiples tareas del dominio del habla, y de otros dominios como la música y los sonidos ambientales. Este desarrollo culminó con EnCodecMAE, un modelo basado en masked autoencoders y pre-entrenado con señales de audio diversas provenientes de Audioset, LibriLight y Free Music Archive. Este modelo tiene la particularidad de utilizar EnCodec, un codec de audio neuronal, como señal objetivo. EnCodecMAE alcanzó resultados comparables o superiores al estado del arte en varias tareas de habla, música y audio general. Además de presentar EnCodecMAE y mostrar los resultados de su evaluación, realizamos un estudio de ablación, explorando el efecto que tienen distintos aspectos de su diseño, como parámetros de enmascarado, representaciones de entrada, conjuntos de preentrenamiento, etc. Por último, realizamos un análisis del alineamiento entre distintas representaciones de audio, incluyendo EnCodecMAE, y representaciones cerebrales obtenidas a partir de resonancias magnéticas funcionales de la corteza auditiva. Mostramos que estos modelos, a pesar de no ser entrenados explícitamente para aproximar la actividad cerebral, exhiben un alineamiento creciente con la misma durante el preentrenamiento, y que el desempeño de las representaciones en distintas tareas se correlaciona con la similaridad con las representaciones cerebrales. Una implicancia práctica de este hallazgo es la posibilidad de utilizar medidas de alineamiento con la corteza auditiva como un indicador del desempeño general del modelo, con un costo computacional inferior al de benchmarks exhaustivos como HEAREval.Representation learning has been fundamental for the advancement of deep learning, enabling the reuse of models to e!ciently solve diverse tasks in terms of computation and data. In particular, unsupervised learning has made it possible to leverage the abundance of unlabeled data to learn rich and useful representations in scenarios where annotated data is scarce, simplifying model development and promoting the democratization of artificial intelligence. This doctoral work was carried out between 2020 and 2025, a period marked by the rise of self-supervised learning of speech representations and, towards the end, by the extension of language models to other modalities beyond text, such as audio and images. Given the success of speech representation models and the trend towards general-purpose models, this work focused on developing an audio representation model that would be useful for multiple tasks in the speech domain, as well as in other domains such as music and environmental sounds. This e"ort culminated in EnCodecMAE, a model based on masked autoencoders and pre-trained with diverse audio signals from Audioset, LibriLight, and Free Music Archive. A distinctive feature of this model is the use of EnCodec, a neural audio codec, as the target signal. EnCodecMAE achieved results comparable to or surpassing the state of the art in various speech, music, and general audio tasks. In addition to presenting EnCodecMAE and showcasing its evaluation results, we conducted an ablation study, exploring the e"ects of various design choices, such as masking parameters, input representations, and pretraining datasets. Finally, we analyzed the alignment between di"erent audio representations—including EnCodecMAE—and brain representations obtained from functional magnetic resonance imaging (fMRI) of the auditory cortex. We show that these models, despite not being explicitly trained to approximate brain activity, exhibit increasing alignment with it during pretraining, and that the performance of the representations across tasks correlates with their similarity to brain representations. A practical implication of this finding is the possibility of using the alignment with the auditory cortex as a proxy of a model’s general performance, at a lower computational cost than exhaustive benchmarks such as HEAREval.Fil: Pepino, Leonardo Daniel. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina.Universidad de Buenos Aires. Facultad de Ciencias Exactas y NaturalesFerrer, LucianaRiera, Pablo Ernesto2025-12-16info:eu-repo/semantics/doctoralThesisinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_db06info:ar-repo/semantics/tesisDoctoralapplication/pdfhttps://hdl.handle.net/20.500.12110/tesis_n7882_Pepinospainfo:eu-repo/semantics/openAccesshttps://creativecommons.org/licenses/by-nc-sa/2.5/arreponame:Biblioteca Digital (UBA-FCEN)instname:Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturalesinstacron:UBA-FCEN2026-09-24T11:37:06Ztesis:tesis_n7882_PepinoInstitucionalhttps://digital.bl.fcen.uba.ar/Universidad públicaNo correspondehttps://digital.bl.fcen.uba.ar/cgi-bin/oaiserver.cgiana@bl.fcen.uba.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:18962026-09-24 11:37:11.047Biblioteca Digital (UBA-FCEN) - Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturalesfalse
dc.title.none.fl_str_mv Análisis y desarrollo de representaciones generales de audio
Analysis and design of general audio representations
title Análisis y desarrollo de representaciones generales de audio
spellingShingle Análisis y desarrollo de representaciones generales de audio
Pepino, Leonardo Daniel
APRENDIZAJE DE REPRESENTACIONES
AUTO-SUPERVISION
PROCESAMIENTO DE AUDIO
NEUROCONEXIONISMO
TRANSFERENCIA DE APRENDIZAJE
REPRESENTATION LEARNING
SELF-SUPERVISION
AUDIO PROCESSING
NEUROCONNECTIONISM
TRANSFER LEARNING
title_short Análisis y desarrollo de representaciones generales de audio
title_full Análisis y desarrollo de representaciones generales de audio
title_fullStr Análisis y desarrollo de representaciones generales de audio
title_full_unstemmed Análisis y desarrollo de representaciones generales de audio
title_sort Análisis y desarrollo de representaciones generales de audio
dc.creator.none.fl_str_mv Pepino, Leonardo Daniel
author Pepino, Leonardo Daniel
author_facet Pepino, Leonardo Daniel
author_role author
dc.contributor.none.fl_str_mv Ferrer, Luciana
Riera, Pablo Ernesto
dc.subject.none.fl_str_mv APRENDIZAJE DE REPRESENTACIONES
AUTO-SUPERVISION
PROCESAMIENTO DE AUDIO
NEUROCONEXIONISMO
TRANSFERENCIA DE APRENDIZAJE
REPRESENTATION LEARNING
SELF-SUPERVISION
AUDIO PROCESSING
NEUROCONNECTIONISM
TRANSFER LEARNING
topic APRENDIZAJE DE REPRESENTACIONES
AUTO-SUPERVISION
PROCESAMIENTO DE AUDIO
NEUROCONEXIONISMO
TRANSFERENCIA DE APRENDIZAJE
REPRESENTATION LEARNING
SELF-SUPERVISION
AUDIO PROCESSING
NEUROCONNECTIONISM
TRANSFER LEARNING
dc.description.none.fl_txt_mv El aprendizaje de representaciones ha sido un pilar fundamental en el avance del aprendizaje profundo, al permitir la reutilización de modelos para resolver tareas diversas de manera eficiente en términos de cómputo y datos. En particular, el aprendizaje no supervisado ha permitido aprovechar la abundancia de datos sin etiquetar para aprender representaciones ricas y útiles en escenarios con escasez de datos anotados, simplificando el desarrollo de modelos y favoreciendo la democratización de la inteligencia artificial. Este trabajo doctoral se desarrolló entre los años 2020 y 2025, en un período marcado por el auge del aprendizaje auto-supervisado de representaciones de habla y, hacia el final, por la extensión de los modelos de lenguaje a otras modalidades distintas al texto, como el audio e imágenes. En ese contexto de éxito de los modelos de representaciones de habla, y la tendencia a crear sistemas cada vez más generalistas, este trabajo consistió en el desarrollo de un modelo de representaciones de audio que fuera útil para múltiples tareas del dominio del habla, y de otros dominios como la música y los sonidos ambientales. Este desarrollo culminó con EnCodecMAE, un modelo basado en masked autoencoders y pre-entrenado con señales de audio diversas provenientes de Audioset, LibriLight y Free Music Archive. Este modelo tiene la particularidad de utilizar EnCodec, un codec de audio neuronal, como señal objetivo. EnCodecMAE alcanzó resultados comparables o superiores al estado del arte en varias tareas de habla, música y audio general. Además de presentar EnCodecMAE y mostrar los resultados de su evaluación, realizamos un estudio de ablación, explorando el efecto que tienen distintos aspectos de su diseño, como parámetros de enmascarado, representaciones de entrada, conjuntos de preentrenamiento, etc. Por último, realizamos un análisis del alineamiento entre distintas representaciones de audio, incluyendo EnCodecMAE, y representaciones cerebrales obtenidas a partir de resonancias magnéticas funcionales de la corteza auditiva. Mostramos que estos modelos, a pesar de no ser entrenados explícitamente para aproximar la actividad cerebral, exhiben un alineamiento creciente con la misma durante el preentrenamiento, y que el desempeño de las representaciones en distintas tareas se correlaciona con la similaridad con las representaciones cerebrales. Una implicancia práctica de este hallazgo es la posibilidad de utilizar medidas de alineamiento con la corteza auditiva como un indicador del desempeño general del modelo, con un costo computacional inferior al de benchmarks exhaustivos como HEAREval.
Representation learning has been fundamental for the advancement of deep learning, enabling the reuse of models to e!ciently solve diverse tasks in terms of computation and data. In particular, unsupervised learning has made it possible to leverage the abundance of unlabeled data to learn rich and useful representations in scenarios where annotated data is scarce, simplifying model development and promoting the democratization of artificial intelligence. This doctoral work was carried out between 2020 and 2025, a period marked by the rise of self-supervised learning of speech representations and, towards the end, by the extension of language models to other modalities beyond text, such as audio and images. Given the success of speech representation models and the trend towards general-purpose models, this work focused on developing an audio representation model that would be useful for multiple tasks in the speech domain, as well as in other domains such as music and environmental sounds. This e"ort culminated in EnCodecMAE, a model based on masked autoencoders and pre-trained with diverse audio signals from Audioset, LibriLight, and Free Music Archive. A distinctive feature of this model is the use of EnCodec, a neural audio codec, as the target signal. EnCodecMAE achieved results comparable to or surpassing the state of the art in various speech, music, and general audio tasks. In addition to presenting EnCodecMAE and showcasing its evaluation results, we conducted an ablation study, exploring the e"ects of various design choices, such as masking parameters, input representations, and pretraining datasets. Finally, we analyzed the alignment between di"erent audio representations—including EnCodecMAE—and brain representations obtained from functional magnetic resonance imaging (fMRI) of the auditory cortex. We show that these models, despite not being explicitly trained to approximate brain activity, exhibit increasing alignment with it during pretraining, and that the performance of the representations across tasks correlates with their similarity to brain representations. A practical implication of this finding is the possibility of using the alignment with the auditory cortex as a proxy of a model’s general performance, at a lower computational cost than exhaustive benchmarks such as HEAREval.
Fil: Pepino, Leonardo Daniel. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina.
description El aprendizaje de representaciones ha sido un pilar fundamental en el avance del aprendizaje profundo, al permitir la reutilización de modelos para resolver tareas diversas de manera eficiente en términos de cómputo y datos. En particular, el aprendizaje no supervisado ha permitido aprovechar la abundancia de datos sin etiquetar para aprender representaciones ricas y útiles en escenarios con escasez de datos anotados, simplificando el desarrollo de modelos y favoreciendo la democratización de la inteligencia artificial. Este trabajo doctoral se desarrolló entre los años 2020 y 2025, en un período marcado por el auge del aprendizaje auto-supervisado de representaciones de habla y, hacia el final, por la extensión de los modelos de lenguaje a otras modalidades distintas al texto, como el audio e imágenes. En ese contexto de éxito de los modelos de representaciones de habla, y la tendencia a crear sistemas cada vez más generalistas, este trabajo consistió en el desarrollo de un modelo de representaciones de audio que fuera útil para múltiples tareas del dominio del habla, y de otros dominios como la música y los sonidos ambientales. Este desarrollo culminó con EnCodecMAE, un modelo basado en masked autoencoders y pre-entrenado con señales de audio diversas provenientes de Audioset, LibriLight y Free Music Archive. Este modelo tiene la particularidad de utilizar EnCodec, un codec de audio neuronal, como señal objetivo. EnCodecMAE alcanzó resultados comparables o superiores al estado del arte en varias tareas de habla, música y audio general. Además de presentar EnCodecMAE y mostrar los resultados de su evaluación, realizamos un estudio de ablación, explorando el efecto que tienen distintos aspectos de su diseño, como parámetros de enmascarado, representaciones de entrada, conjuntos de preentrenamiento, etc. Por último, realizamos un análisis del alineamiento entre distintas representaciones de audio, incluyendo EnCodecMAE, y representaciones cerebrales obtenidas a partir de resonancias magnéticas funcionales de la corteza auditiva. Mostramos que estos modelos, a pesar de no ser entrenados explícitamente para aproximar la actividad cerebral, exhiben un alineamiento creciente con la misma durante el preentrenamiento, y que el desempeño de las representaciones en distintas tareas se correlaciona con la similaridad con las representaciones cerebrales. Una implicancia práctica de este hallazgo es la posibilidad de utilizar medidas de alineamiento con la corteza auditiva como un indicador del desempeño general del modelo, con un costo computacional inferior al de benchmarks exhaustivos como HEAREval.
publishDate 2025
dc.date.none.fl_str_mv 2025-12-16
dc.type.none.fl_str_mv info:eu-repo/semantics/doctoralThesis
info:eu-repo/semantics/publishedVersion
http://purl.org/coar/resource_type/c_db06
info:ar-repo/semantics/tesisDoctoral
format doctoralThesis
status_str publishedVersion
dc.identifier.none.fl_str_mv https://hdl.handle.net/20.500.12110/tesis_n7882_Pepino
url https://hdl.handle.net/20.500.12110/tesis_n7882_Pepino
dc.language.none.fl_str_mv spa
language spa
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
https://creativecommons.org/licenses/by-nc-sa/2.5/ar
eu_rights_str_mv openAccess
rights_invalid_str_mv https://creativecommons.org/licenses/by-nc-sa/2.5/ar
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales
publisher.none.fl_str_mv Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales
dc.source.none.fl_str_mv reponame:Biblioteca Digital (UBA-FCEN)
instname:Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
instacron:UBA-FCEN
reponame_str Biblioteca Digital (UBA-FCEN)
collection Biblioteca Digital (UBA-FCEN)
instname_str Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
instacron_str UBA-FCEN
institution UBA-FCEN
repository.name.fl_str_mv Biblioteca Digital (UBA-FCEN) - Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
repository.mail.fl_str_mv ana@bl.fcen.uba.ar
_version_ 1877226375227637760
score 12.733355