Análisis y desarrollo de representaciones generales de audio
- Autores
- Pepino, Leonardo Daniel
- Año de publicación
- 2025
- Idioma
- español castellano
- Tipo de recurso
- tesis doctoral
- Estado
- versión publicada
- Colaborador/a o director/a de tesis
- Ferrer, Luciana
Riera, Pablo Ernesto - Descripción
- El aprendizaje de representaciones ha sido un pilar fundamental en el avance del aprendizaje profundo, al permitir la reutilización de modelos para resolver tareas diversas de manera eficiente en términos de cómputo y datos. En particular, el aprendizaje no supervisado ha permitido aprovechar la abundancia de datos sin etiquetar para aprender representaciones ricas y útiles en escenarios con escasez de datos anotados, simplificando el desarrollo de modelos y favoreciendo la democratización de la inteligencia artificial. Este trabajo doctoral se desarrolló entre los años 2020 y 2025, en un período marcado por el auge del aprendizaje auto-supervisado de representaciones de habla y, hacia el final, por la extensión de los modelos de lenguaje a otras modalidades distintas al texto, como el audio e imágenes. En ese contexto de éxito de los modelos de representaciones de habla, y la tendencia a crear sistemas cada vez más generalistas, este trabajo consistió en el desarrollo de un modelo de representaciones de audio que fuera útil para múltiples tareas del dominio del habla, y de otros dominios como la música y los sonidos ambientales. Este desarrollo culminó con EnCodecMAE, un modelo basado en masked autoencoders y pre-entrenado con señales de audio diversas provenientes de Audioset, LibriLight y Free Music Archive. Este modelo tiene la particularidad de utilizar EnCodec, un codec de audio neuronal, como señal objetivo. EnCodecMAE alcanzó resultados comparables o superiores al estado del arte en varias tareas de habla, música y audio general. Además de presentar EnCodecMAE y mostrar los resultados de su evaluación, realizamos un estudio de ablación, explorando el efecto que tienen distintos aspectos de su diseño, como parámetros de enmascarado, representaciones de entrada, conjuntos de preentrenamiento, etc. Por último, realizamos un análisis del alineamiento entre distintas representaciones de audio, incluyendo EnCodecMAE, y representaciones cerebrales obtenidas a partir de resonancias magnéticas funcionales de la corteza auditiva. Mostramos que estos modelos, a pesar de no ser entrenados explícitamente para aproximar la actividad cerebral, exhiben un alineamiento creciente con la misma durante el preentrenamiento, y que el desempeño de las representaciones en distintas tareas se correlaciona con la similaridad con las representaciones cerebrales. Una implicancia práctica de este hallazgo es la posibilidad de utilizar medidas de alineamiento con la corteza auditiva como un indicador del desempeño general del modelo, con un costo computacional inferior al de benchmarks exhaustivos como HEAREval.
Representation learning has been fundamental for the advancement of deep learning, enabling the reuse of models to e!ciently solve diverse tasks in terms of computation and data. In particular, unsupervised learning has made it possible to leverage the abundance of unlabeled data to learn rich and useful representations in scenarios where annotated data is scarce, simplifying model development and promoting the democratization of artificial intelligence. This doctoral work was carried out between 2020 and 2025, a period marked by the rise of self-supervised learning of speech representations and, towards the end, by the extension of language models to other modalities beyond text, such as audio and images. Given the success of speech representation models and the trend towards general-purpose models, this work focused on developing an audio representation model that would be useful for multiple tasks in the speech domain, as well as in other domains such as music and environmental sounds. This e"ort culminated in EnCodecMAE, a model based on masked autoencoders and pre-trained with diverse audio signals from Audioset, LibriLight, and Free Music Archive. A distinctive feature of this model is the use of EnCodec, a neural audio codec, as the target signal. EnCodecMAE achieved results comparable to or surpassing the state of the art in various speech, music, and general audio tasks. In addition to presenting EnCodecMAE and showcasing its evaluation results, we conducted an ablation study, exploring the e"ects of various design choices, such as masking parameters, input representations, and pretraining datasets. Finally, we analyzed the alignment between di"erent audio representations—including EnCodecMAE—and brain representations obtained from functional magnetic resonance imaging (fMRI) of the auditory cortex. We show that these models, despite not being explicitly trained to approximate brain activity, exhibit increasing alignment with it during pretraining, and that the performance of the representations across tasks correlates with their similarity to brain representations. A practical implication of this finding is the possibility of using the alignment with the auditory cortex as a proxy of a model’s general performance, at a lower computational cost than exhaustive benchmarks such as HEAREval.
Fil: Pepino, Leonardo Daniel. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina. - Materia
-
APRENDIZAJE DE REPRESENTACIONES
AUTO-SUPERVISION
PROCESAMIENTO DE AUDIO
NEUROCONEXIONISMO
TRANSFERENCIA DE APRENDIZAJE
REPRESENTATION LEARNING
SELF-SUPERVISION
AUDIO PROCESSING
NEUROCONNECTIONISM
TRANSFER LEARNING - Nivel de accesibilidad
- acceso abierto
- Condiciones de uso
- https://creativecommons.org/licenses/by-nc-sa/2.5/ar
- Repositorio
.jpg)
- Institución
- Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
- OAI Identificador
- tesis:tesis_n7882_Pepino
Ver los metadatos del registro completo
| id |
BDUBAFCEN_25ae1ee459d021efebf2e90833882a08 |
|---|---|
| oai_identifier_str |
tesis:tesis_n7882_Pepino |
| network_acronym_str |
BDUBAFCEN |
| repository_id_str |
1896 |
| network_name_str |
Biblioteca Digital (UBA-FCEN) |
| spelling |
Análisis y desarrollo de representaciones generales de audioAnalysis and design of general audio representationsPepino, Leonardo DanielAPRENDIZAJE DE REPRESENTACIONESAUTO-SUPERVISIONPROCESAMIENTO DE AUDIONEUROCONEXIONISMOTRANSFERENCIA DE APRENDIZAJEREPRESENTATION LEARNINGSELF-SUPERVISIONAUDIO PROCESSINGNEUROCONNECTIONISMTRANSFER LEARNINGEl aprendizaje de representaciones ha sido un pilar fundamental en el avance del aprendizaje profundo, al permitir la reutilización de modelos para resolver tareas diversas de manera eficiente en términos de cómputo y datos. En particular, el aprendizaje no supervisado ha permitido aprovechar la abundancia de datos sin etiquetar para aprender representaciones ricas y útiles en escenarios con escasez de datos anotados, simplificando el desarrollo de modelos y favoreciendo la democratización de la inteligencia artificial. Este trabajo doctoral se desarrolló entre los años 2020 y 2025, en un período marcado por el auge del aprendizaje auto-supervisado de representaciones de habla y, hacia el final, por la extensión de los modelos de lenguaje a otras modalidades distintas al texto, como el audio e imágenes. En ese contexto de éxito de los modelos de representaciones de habla, y la tendencia a crear sistemas cada vez más generalistas, este trabajo consistió en el desarrollo de un modelo de representaciones de audio que fuera útil para múltiples tareas del dominio del habla, y de otros dominios como la música y los sonidos ambientales. Este desarrollo culminó con EnCodecMAE, un modelo basado en masked autoencoders y pre-entrenado con señales de audio diversas provenientes de Audioset, LibriLight y Free Music Archive. Este modelo tiene la particularidad de utilizar EnCodec, un codec de audio neuronal, como señal objetivo. EnCodecMAE alcanzó resultados comparables o superiores al estado del arte en varias tareas de habla, música y audio general. Además de presentar EnCodecMAE y mostrar los resultados de su evaluación, realizamos un estudio de ablación, explorando el efecto que tienen distintos aspectos de su diseño, como parámetros de enmascarado, representaciones de entrada, conjuntos de preentrenamiento, etc. Por último, realizamos un análisis del alineamiento entre distintas representaciones de audio, incluyendo EnCodecMAE, y representaciones cerebrales obtenidas a partir de resonancias magnéticas funcionales de la corteza auditiva. Mostramos que estos modelos, a pesar de no ser entrenados explícitamente para aproximar la actividad cerebral, exhiben un alineamiento creciente con la misma durante el preentrenamiento, y que el desempeño de las representaciones en distintas tareas se correlaciona con la similaridad con las representaciones cerebrales. Una implicancia práctica de este hallazgo es la posibilidad de utilizar medidas de alineamiento con la corteza auditiva como un indicador del desempeño general del modelo, con un costo computacional inferior al de benchmarks exhaustivos como HEAREval.Representation learning has been fundamental for the advancement of deep learning, enabling the reuse of models to e!ciently solve diverse tasks in terms of computation and data. In particular, unsupervised learning has made it possible to leverage the abundance of unlabeled data to learn rich and useful representations in scenarios where annotated data is scarce, simplifying model development and promoting the democratization of artificial intelligence. This doctoral work was carried out between 2020 and 2025, a period marked by the rise of self-supervised learning of speech representations and, towards the end, by the extension of language models to other modalities beyond text, such as audio and images. Given the success of speech representation models and the trend towards general-purpose models, this work focused on developing an audio representation model that would be useful for multiple tasks in the speech domain, as well as in other domains such as music and environmental sounds. This e"ort culminated in EnCodecMAE, a model based on masked autoencoders and pre-trained with diverse audio signals from Audioset, LibriLight, and Free Music Archive. A distinctive feature of this model is the use of EnCodec, a neural audio codec, as the target signal. EnCodecMAE achieved results comparable to or surpassing the state of the art in various speech, music, and general audio tasks. In addition to presenting EnCodecMAE and showcasing its evaluation results, we conducted an ablation study, exploring the e"ects of various design choices, such as masking parameters, input representations, and pretraining datasets. Finally, we analyzed the alignment between di"erent audio representations—including EnCodecMAE—and brain representations obtained from functional magnetic resonance imaging (fMRI) of the auditory cortex. We show that these models, despite not being explicitly trained to approximate brain activity, exhibit increasing alignment with it during pretraining, and that the performance of the representations across tasks correlates with their similarity to brain representations. A practical implication of this finding is the possibility of using the alignment with the auditory cortex as a proxy of a model’s general performance, at a lower computational cost than exhaustive benchmarks such as HEAREval.Fil: Pepino, Leonardo Daniel. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina.Universidad de Buenos Aires. Facultad de Ciencias Exactas y NaturalesFerrer, LucianaRiera, Pablo Ernesto2025-12-16info:eu-repo/semantics/doctoralThesisinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_db06info:ar-repo/semantics/tesisDoctoralapplication/pdfhttps://hdl.handle.net/20.500.12110/tesis_n7882_Pepinospainfo:eu-repo/semantics/openAccesshttps://creativecommons.org/licenses/by-nc-sa/2.5/arreponame:Biblioteca Digital (UBA-FCEN)instname:Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturalesinstacron:UBA-FCEN2026-09-24T11:37:06Ztesis:tesis_n7882_PepinoInstitucionalhttps://digital.bl.fcen.uba.ar/Universidad públicaNo correspondehttps://digital.bl.fcen.uba.ar/cgi-bin/oaiserver.cgiana@bl.fcen.uba.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:18962026-09-24 11:37:11.047Biblioteca Digital (UBA-FCEN) - Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturalesfalse |
| dc.title.none.fl_str_mv |
Análisis y desarrollo de representaciones generales de audio Analysis and design of general audio representations |
| title |
Análisis y desarrollo de representaciones generales de audio |
| spellingShingle |
Análisis y desarrollo de representaciones generales de audio Pepino, Leonardo Daniel APRENDIZAJE DE REPRESENTACIONES AUTO-SUPERVISION PROCESAMIENTO DE AUDIO NEUROCONEXIONISMO TRANSFERENCIA DE APRENDIZAJE REPRESENTATION LEARNING SELF-SUPERVISION AUDIO PROCESSING NEUROCONNECTIONISM TRANSFER LEARNING |
| title_short |
Análisis y desarrollo de representaciones generales de audio |
| title_full |
Análisis y desarrollo de representaciones generales de audio |
| title_fullStr |
Análisis y desarrollo de representaciones generales de audio |
| title_full_unstemmed |
Análisis y desarrollo de representaciones generales de audio |
| title_sort |
Análisis y desarrollo de representaciones generales de audio |
| dc.creator.none.fl_str_mv |
Pepino, Leonardo Daniel |
| author |
Pepino, Leonardo Daniel |
| author_facet |
Pepino, Leonardo Daniel |
| author_role |
author |
| dc.contributor.none.fl_str_mv |
Ferrer, Luciana Riera, Pablo Ernesto |
| dc.subject.none.fl_str_mv |
APRENDIZAJE DE REPRESENTACIONES AUTO-SUPERVISION PROCESAMIENTO DE AUDIO NEUROCONEXIONISMO TRANSFERENCIA DE APRENDIZAJE REPRESENTATION LEARNING SELF-SUPERVISION AUDIO PROCESSING NEUROCONNECTIONISM TRANSFER LEARNING |
| topic |
APRENDIZAJE DE REPRESENTACIONES AUTO-SUPERVISION PROCESAMIENTO DE AUDIO NEUROCONEXIONISMO TRANSFERENCIA DE APRENDIZAJE REPRESENTATION LEARNING SELF-SUPERVISION AUDIO PROCESSING NEUROCONNECTIONISM TRANSFER LEARNING |
| dc.description.none.fl_txt_mv |
El aprendizaje de representaciones ha sido un pilar fundamental en el avance del aprendizaje profundo, al permitir la reutilización de modelos para resolver tareas diversas de manera eficiente en términos de cómputo y datos. En particular, el aprendizaje no supervisado ha permitido aprovechar la abundancia de datos sin etiquetar para aprender representaciones ricas y útiles en escenarios con escasez de datos anotados, simplificando el desarrollo de modelos y favoreciendo la democratización de la inteligencia artificial. Este trabajo doctoral se desarrolló entre los años 2020 y 2025, en un período marcado por el auge del aprendizaje auto-supervisado de representaciones de habla y, hacia el final, por la extensión de los modelos de lenguaje a otras modalidades distintas al texto, como el audio e imágenes. En ese contexto de éxito de los modelos de representaciones de habla, y la tendencia a crear sistemas cada vez más generalistas, este trabajo consistió en el desarrollo de un modelo de representaciones de audio que fuera útil para múltiples tareas del dominio del habla, y de otros dominios como la música y los sonidos ambientales. Este desarrollo culminó con EnCodecMAE, un modelo basado en masked autoencoders y pre-entrenado con señales de audio diversas provenientes de Audioset, LibriLight y Free Music Archive. Este modelo tiene la particularidad de utilizar EnCodec, un codec de audio neuronal, como señal objetivo. EnCodecMAE alcanzó resultados comparables o superiores al estado del arte en varias tareas de habla, música y audio general. Además de presentar EnCodecMAE y mostrar los resultados de su evaluación, realizamos un estudio de ablación, explorando el efecto que tienen distintos aspectos de su diseño, como parámetros de enmascarado, representaciones de entrada, conjuntos de preentrenamiento, etc. Por último, realizamos un análisis del alineamiento entre distintas representaciones de audio, incluyendo EnCodecMAE, y representaciones cerebrales obtenidas a partir de resonancias magnéticas funcionales de la corteza auditiva. Mostramos que estos modelos, a pesar de no ser entrenados explícitamente para aproximar la actividad cerebral, exhiben un alineamiento creciente con la misma durante el preentrenamiento, y que el desempeño de las representaciones en distintas tareas se correlaciona con la similaridad con las representaciones cerebrales. Una implicancia práctica de este hallazgo es la posibilidad de utilizar medidas de alineamiento con la corteza auditiva como un indicador del desempeño general del modelo, con un costo computacional inferior al de benchmarks exhaustivos como HEAREval. Representation learning has been fundamental for the advancement of deep learning, enabling the reuse of models to e!ciently solve diverse tasks in terms of computation and data. In particular, unsupervised learning has made it possible to leverage the abundance of unlabeled data to learn rich and useful representations in scenarios where annotated data is scarce, simplifying model development and promoting the democratization of artificial intelligence. This doctoral work was carried out between 2020 and 2025, a period marked by the rise of self-supervised learning of speech representations and, towards the end, by the extension of language models to other modalities beyond text, such as audio and images. Given the success of speech representation models and the trend towards general-purpose models, this work focused on developing an audio representation model that would be useful for multiple tasks in the speech domain, as well as in other domains such as music and environmental sounds. This e"ort culminated in EnCodecMAE, a model based on masked autoencoders and pre-trained with diverse audio signals from Audioset, LibriLight, and Free Music Archive. A distinctive feature of this model is the use of EnCodec, a neural audio codec, as the target signal. EnCodecMAE achieved results comparable to or surpassing the state of the art in various speech, music, and general audio tasks. In addition to presenting EnCodecMAE and showcasing its evaluation results, we conducted an ablation study, exploring the e"ects of various design choices, such as masking parameters, input representations, and pretraining datasets. Finally, we analyzed the alignment between di"erent audio representations—including EnCodecMAE—and brain representations obtained from functional magnetic resonance imaging (fMRI) of the auditory cortex. We show that these models, despite not being explicitly trained to approximate brain activity, exhibit increasing alignment with it during pretraining, and that the performance of the representations across tasks correlates with their similarity to brain representations. A practical implication of this finding is the possibility of using the alignment with the auditory cortex as a proxy of a model’s general performance, at a lower computational cost than exhaustive benchmarks such as HEAREval. Fil: Pepino, Leonardo Daniel. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina. |
| description |
El aprendizaje de representaciones ha sido un pilar fundamental en el avance del aprendizaje profundo, al permitir la reutilización de modelos para resolver tareas diversas de manera eficiente en términos de cómputo y datos. En particular, el aprendizaje no supervisado ha permitido aprovechar la abundancia de datos sin etiquetar para aprender representaciones ricas y útiles en escenarios con escasez de datos anotados, simplificando el desarrollo de modelos y favoreciendo la democratización de la inteligencia artificial. Este trabajo doctoral se desarrolló entre los años 2020 y 2025, en un período marcado por el auge del aprendizaje auto-supervisado de representaciones de habla y, hacia el final, por la extensión de los modelos de lenguaje a otras modalidades distintas al texto, como el audio e imágenes. En ese contexto de éxito de los modelos de representaciones de habla, y la tendencia a crear sistemas cada vez más generalistas, este trabajo consistió en el desarrollo de un modelo de representaciones de audio que fuera útil para múltiples tareas del dominio del habla, y de otros dominios como la música y los sonidos ambientales. Este desarrollo culminó con EnCodecMAE, un modelo basado en masked autoencoders y pre-entrenado con señales de audio diversas provenientes de Audioset, LibriLight y Free Music Archive. Este modelo tiene la particularidad de utilizar EnCodec, un codec de audio neuronal, como señal objetivo. EnCodecMAE alcanzó resultados comparables o superiores al estado del arte en varias tareas de habla, música y audio general. Además de presentar EnCodecMAE y mostrar los resultados de su evaluación, realizamos un estudio de ablación, explorando el efecto que tienen distintos aspectos de su diseño, como parámetros de enmascarado, representaciones de entrada, conjuntos de preentrenamiento, etc. Por último, realizamos un análisis del alineamiento entre distintas representaciones de audio, incluyendo EnCodecMAE, y representaciones cerebrales obtenidas a partir de resonancias magnéticas funcionales de la corteza auditiva. Mostramos que estos modelos, a pesar de no ser entrenados explícitamente para aproximar la actividad cerebral, exhiben un alineamiento creciente con la misma durante el preentrenamiento, y que el desempeño de las representaciones en distintas tareas se correlaciona con la similaridad con las representaciones cerebrales. Una implicancia práctica de este hallazgo es la posibilidad de utilizar medidas de alineamiento con la corteza auditiva como un indicador del desempeño general del modelo, con un costo computacional inferior al de benchmarks exhaustivos como HEAREval. |
| publishDate |
2025 |
| dc.date.none.fl_str_mv |
2025-12-16 |
| dc.type.none.fl_str_mv |
info:eu-repo/semantics/doctoralThesis info:eu-repo/semantics/publishedVersion http://purl.org/coar/resource_type/c_db06 info:ar-repo/semantics/tesisDoctoral |
| format |
doctoralThesis |
| status_str |
publishedVersion |
| dc.identifier.none.fl_str_mv |
https://hdl.handle.net/20.500.12110/tesis_n7882_Pepino |
| url |
https://hdl.handle.net/20.500.12110/tesis_n7882_Pepino |
| dc.language.none.fl_str_mv |
spa |
| language |
spa |
| dc.rights.none.fl_str_mv |
info:eu-repo/semantics/openAccess https://creativecommons.org/licenses/by-nc-sa/2.5/ar |
| eu_rights_str_mv |
openAccess |
| rights_invalid_str_mv |
https://creativecommons.org/licenses/by-nc-sa/2.5/ar |
| dc.format.none.fl_str_mv |
application/pdf |
| dc.publisher.none.fl_str_mv |
Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales |
| publisher.none.fl_str_mv |
Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales |
| dc.source.none.fl_str_mv |
reponame:Biblioteca Digital (UBA-FCEN) instname:Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales instacron:UBA-FCEN |
| reponame_str |
Biblioteca Digital (UBA-FCEN) |
| collection |
Biblioteca Digital (UBA-FCEN) |
| instname_str |
Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales |
| instacron_str |
UBA-FCEN |
| institution |
UBA-FCEN |
| repository.name.fl_str_mv |
Biblioteca Digital (UBA-FCEN) - Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales |
| repository.mail.fl_str_mv |
ana@bl.fcen.uba.ar |
| _version_ |
1877226375227637760 |
| score |
12.733355 |