Clasificación automática del grado general de disfonía
- Autores
- García, Mario Alejandro
- Año de publicación
- 2021
- Idioma
- español castellano
- Tipo de recurso
- tesis doctoral
- Estado
- versión aceptada
- Colaborador/a o director/a de tesis
- Destéfanis, Eduardo
- Descripción
- El análisis audioperceptivo es una parte principal de la rutina de evaluación clínica de pacientes con trastornos de la voz para medir y registrar la calidad vocal. Esta valoración repercute en la detección y tratamiento de enfermedades vocales. GRBAS es una escala de valoración de cinco dimensiones usualmente utilizada en este proceso, donde la dimensión “G” representa el grado general de disfonía. En este trabajo se desarrolla un modelo de aprendizaje profundo para calcular el grado general de disfonía en escala GRBAS con el propósito de contribuir a la comprensión y mejora de este tipo de modelos en el ámbito de la calidad vocal. La arquitectura de la red neuronal se definió a partir de dos versiones de un modelo llamado modelo inicial, creado en base a modelos más pequeños. Estos modelos neuronales pequeños, diseñados a partir del conocimiento del dominio del problema, se enfocan en resolver la representación frecuencial del audio, la extracción de características y la clasificación. Una de las versiones recibe el audio sin procesar como entrada y la otra recibe el cepstrograma. Los modelos fueron entrenados y evaluados con los datos de una base de datos pública que contiene audios y valoraciones en escala GRBAS, a los que se añadieron valoraciones de calidad vocal realizadas por un evaluador local. Las métricas utilizadas para evaluar los modelos de clasificación son la exactitud y el error absoluto medio. Debido a que las valoraciones audioperceptivas tienen un alto grado de variación entre distintos evaluadores médicos y también entre distintas valoraciones del mismo evaluador médico, se plantea que el rendimiento de los modelos automáticos se debe evaluar en relación al índice de concordancia medio interevaluador e intraevaluador de la base de datos. En base a los resultados obtenidos, por un lado se concluye que la versión del modelo que recibe el cepstrograma como entrada es capaz de predecir el grado general de disfonía, para los datos utilizados, con una exactitud cercana a la de un evaluador humano. Por otro lado, se concluye que una red neuronal profunda diseñada para reconocer patrones de perturbación de amplitud, perturbación de frecuencia y ruido, obtiene información útil para la predicción del grado general de disfonía, que para el diseño utilizado (donde la extracción de características está basada en el cepstrum) no es posible utilizar el audio sin procesar como entrada y que el modelo presentado es un buen punto de partida para futuros desarrollos de clasificadores de la calidad vocal aplicables en la práctica clínica.
Fil: García, Mario Alejandro. Universidad Tecnológica Nacional. Facultad Regional Córdoba, Departamento de Ingeniería en Sistemas de Información; Argentina. - Materia
-
Inteligencia artificial
Aprendizaje automático
Aprendizaje profundo
Redes neuronales
Calidad vocal
Disfonía - Nivel de accesibilidad
- acceso abierto
- Condiciones de uso
- 2022-02-15T14:03:06Z
- Repositorio
.jpg)
- Institución
- Universidad Tecnológica Nacional
- OAI Identificador
- oai:ria.utn.edu.ar:20.500.12272/5956
Ver los metadatos del registro completo
| id |
RIAUTN_ca7192a3084c201d4d725d452eb5ff69 |
|---|---|
| oai_identifier_str |
oai:ria.utn.edu.ar:20.500.12272/5956 |
| network_acronym_str |
RIAUTN |
| repository_id_str |
a |
| network_name_str |
Repositorio Institucional Abierto (UTN) |
| spelling |
Clasificación automática del grado general de disfoníaGarcía, Mario AlejandroInteligencia artificialAprendizaje automáticoAprendizaje profundoRedes neuronalesCalidad vocalDisfoníaEl análisis audioperceptivo es una parte principal de la rutina de evaluación clínica de pacientes con trastornos de la voz para medir y registrar la calidad vocal. Esta valoración repercute en la detección y tratamiento de enfermedades vocales. GRBAS es una escala de valoración de cinco dimensiones usualmente utilizada en este proceso, donde la dimensión “G” representa el grado general de disfonía. En este trabajo se desarrolla un modelo de aprendizaje profundo para calcular el grado general de disfonía en escala GRBAS con el propósito de contribuir a la comprensión y mejora de este tipo de modelos en el ámbito de la calidad vocal. La arquitectura de la red neuronal se definió a partir de dos versiones de un modelo llamado modelo inicial, creado en base a modelos más pequeños. Estos modelos neuronales pequeños, diseñados a partir del conocimiento del dominio del problema, se enfocan en resolver la representación frecuencial del audio, la extracción de características y la clasificación. Una de las versiones recibe el audio sin procesar como entrada y la otra recibe el cepstrograma. Los modelos fueron entrenados y evaluados con los datos de una base de datos pública que contiene audios y valoraciones en escala GRBAS, a los que se añadieron valoraciones de calidad vocal realizadas por un evaluador local. Las métricas utilizadas para evaluar los modelos de clasificación son la exactitud y el error absoluto medio. Debido a que las valoraciones audioperceptivas tienen un alto grado de variación entre distintos evaluadores médicos y también entre distintas valoraciones del mismo evaluador médico, se plantea que el rendimiento de los modelos automáticos se debe evaluar en relación al índice de concordancia medio interevaluador e intraevaluador de la base de datos. En base a los resultados obtenidos, por un lado se concluye que la versión del modelo que recibe el cepstrograma como entrada es capaz de predecir el grado general de disfonía, para los datos utilizados, con una exactitud cercana a la de un evaluador humano. Por otro lado, se concluye que una red neuronal profunda diseñada para reconocer patrones de perturbación de amplitud, perturbación de frecuencia y ruido, obtiene información útil para la predicción del grado general de disfonía, que para el diseño utilizado (donde la extracción de características está basada en el cepstrum) no es posible utilizar el audio sin procesar como entrada y que el modelo presentado es un buen punto de partida para futuros desarrollos de clasificadores de la calidad vocal aplicables en la práctica clínica.Fil: García, Mario Alejandro. Universidad Tecnológica Nacional. Facultad Regional Córdoba, Departamento de Ingeniería en Sistemas de Información; Argentina.Universidad Tecnológica nacional. Facultad Regional CórdobaDestéfanis, Eduardo2022-02-15T14:03:06Z2022-02-15T14:03:06Z2021-12-03info:eu-repo/semantics/doctoralThesisinfo:eu-repo/semantics/acceptedVersionhttp://purl.org/coar/resource_type/c_db06info:ar-repo/semantics/tesisDoctoralpdfapplication/pdfhttp://hdl.handle.net/20.500.12272/5956spainfo:eu-repo/semantics/openAccess2022-02-15T14:03:06Zhttp://creativecommons.org/licenses/by-nc-nd/4.0/Attribution-NonCommercial-NoDerivatives 4.0 InternacionalGarcía, Mario AlejandroNo Comercial. Sólo de Uso Académico.reponame:Repositorio Institucional Abierto (UTN)instname:Universidad Tecnológica Nacional2026-09-24T12:48:17Zoai:ria.utn.edu.ar:20.500.12272/5956instacron:UTNInstitucionalhttp://ria.utn.edu.ar/Universidad públicaNo correspondehttp://ria.utn.edu.ar/oaigestionria@rec.utn.edu.ar; fsuarez@rec.utn.edu.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:a2026-09-24 12:48:18.652Repositorio Institucional Abierto (UTN) - Universidad Tecnológica Nacionalfalse |
| dc.title.none.fl_str_mv |
Clasificación automática del grado general de disfonía |
| title |
Clasificación automática del grado general de disfonía |
| spellingShingle |
Clasificación automática del grado general de disfonía García, Mario Alejandro Inteligencia artificial Aprendizaje automático Aprendizaje profundo Redes neuronales Calidad vocal Disfonía |
| title_short |
Clasificación automática del grado general de disfonía |
| title_full |
Clasificación automática del grado general de disfonía |
| title_fullStr |
Clasificación automática del grado general de disfonía |
| title_full_unstemmed |
Clasificación automática del grado general de disfonía |
| title_sort |
Clasificación automática del grado general de disfonía |
| dc.creator.none.fl_str_mv |
García, Mario Alejandro |
| author |
García, Mario Alejandro |
| author_facet |
García, Mario Alejandro |
| author_role |
author |
| dc.contributor.none.fl_str_mv |
Destéfanis, Eduardo |
| dc.subject.none.fl_str_mv |
Inteligencia artificial Aprendizaje automático Aprendizaje profundo Redes neuronales Calidad vocal Disfonía |
| topic |
Inteligencia artificial Aprendizaje automático Aprendizaje profundo Redes neuronales Calidad vocal Disfonía |
| dc.description.none.fl_txt_mv |
El análisis audioperceptivo es una parte principal de la rutina de evaluación clínica de pacientes con trastornos de la voz para medir y registrar la calidad vocal. Esta valoración repercute en la detección y tratamiento de enfermedades vocales. GRBAS es una escala de valoración de cinco dimensiones usualmente utilizada en este proceso, donde la dimensión “G” representa el grado general de disfonía. En este trabajo se desarrolla un modelo de aprendizaje profundo para calcular el grado general de disfonía en escala GRBAS con el propósito de contribuir a la comprensión y mejora de este tipo de modelos en el ámbito de la calidad vocal. La arquitectura de la red neuronal se definió a partir de dos versiones de un modelo llamado modelo inicial, creado en base a modelos más pequeños. Estos modelos neuronales pequeños, diseñados a partir del conocimiento del dominio del problema, se enfocan en resolver la representación frecuencial del audio, la extracción de características y la clasificación. Una de las versiones recibe el audio sin procesar como entrada y la otra recibe el cepstrograma. Los modelos fueron entrenados y evaluados con los datos de una base de datos pública que contiene audios y valoraciones en escala GRBAS, a los que se añadieron valoraciones de calidad vocal realizadas por un evaluador local. Las métricas utilizadas para evaluar los modelos de clasificación son la exactitud y el error absoluto medio. Debido a que las valoraciones audioperceptivas tienen un alto grado de variación entre distintos evaluadores médicos y también entre distintas valoraciones del mismo evaluador médico, se plantea que el rendimiento de los modelos automáticos se debe evaluar en relación al índice de concordancia medio interevaluador e intraevaluador de la base de datos. En base a los resultados obtenidos, por un lado se concluye que la versión del modelo que recibe el cepstrograma como entrada es capaz de predecir el grado general de disfonía, para los datos utilizados, con una exactitud cercana a la de un evaluador humano. Por otro lado, se concluye que una red neuronal profunda diseñada para reconocer patrones de perturbación de amplitud, perturbación de frecuencia y ruido, obtiene información útil para la predicción del grado general de disfonía, que para el diseño utilizado (donde la extracción de características está basada en el cepstrum) no es posible utilizar el audio sin procesar como entrada y que el modelo presentado es un buen punto de partida para futuros desarrollos de clasificadores de la calidad vocal aplicables en la práctica clínica. Fil: García, Mario Alejandro. Universidad Tecnológica Nacional. Facultad Regional Córdoba, Departamento de Ingeniería en Sistemas de Información; Argentina. |
| description |
El análisis audioperceptivo es una parte principal de la rutina de evaluación clínica de pacientes con trastornos de la voz para medir y registrar la calidad vocal. Esta valoración repercute en la detección y tratamiento de enfermedades vocales. GRBAS es una escala de valoración de cinco dimensiones usualmente utilizada en este proceso, donde la dimensión “G” representa el grado general de disfonía. En este trabajo se desarrolla un modelo de aprendizaje profundo para calcular el grado general de disfonía en escala GRBAS con el propósito de contribuir a la comprensión y mejora de este tipo de modelos en el ámbito de la calidad vocal. La arquitectura de la red neuronal se definió a partir de dos versiones de un modelo llamado modelo inicial, creado en base a modelos más pequeños. Estos modelos neuronales pequeños, diseñados a partir del conocimiento del dominio del problema, se enfocan en resolver la representación frecuencial del audio, la extracción de características y la clasificación. Una de las versiones recibe el audio sin procesar como entrada y la otra recibe el cepstrograma. Los modelos fueron entrenados y evaluados con los datos de una base de datos pública que contiene audios y valoraciones en escala GRBAS, a los que se añadieron valoraciones de calidad vocal realizadas por un evaluador local. Las métricas utilizadas para evaluar los modelos de clasificación son la exactitud y el error absoluto medio. Debido a que las valoraciones audioperceptivas tienen un alto grado de variación entre distintos evaluadores médicos y también entre distintas valoraciones del mismo evaluador médico, se plantea que el rendimiento de los modelos automáticos se debe evaluar en relación al índice de concordancia medio interevaluador e intraevaluador de la base de datos. En base a los resultados obtenidos, por un lado se concluye que la versión del modelo que recibe el cepstrograma como entrada es capaz de predecir el grado general de disfonía, para los datos utilizados, con una exactitud cercana a la de un evaluador humano. Por otro lado, se concluye que una red neuronal profunda diseñada para reconocer patrones de perturbación de amplitud, perturbación de frecuencia y ruido, obtiene información útil para la predicción del grado general de disfonía, que para el diseño utilizado (donde la extracción de características está basada en el cepstrum) no es posible utilizar el audio sin procesar como entrada y que el modelo presentado es un buen punto de partida para futuros desarrollos de clasificadores de la calidad vocal aplicables en la práctica clínica. |
| publishDate |
2021 |
| dc.date.none.fl_str_mv |
2021-12-03 2022-02-15T14:03:06Z 2022-02-15T14:03:06Z |
| dc.type.none.fl_str_mv |
info:eu-repo/semantics/doctoralThesis info:eu-repo/semantics/acceptedVersion http://purl.org/coar/resource_type/c_db06 info:ar-repo/semantics/tesisDoctoral |
| format |
doctoralThesis |
| status_str |
acceptedVersion |
| dc.identifier.none.fl_str_mv |
http://hdl.handle.net/20.500.12272/5956 |
| url |
http://hdl.handle.net/20.500.12272/5956 |
| dc.language.none.fl_str_mv |
spa |
| language |
spa |
| dc.rights.none.fl_str_mv |
info:eu-repo/semantics/openAccess 2022-02-15T14:03:06Z http://creativecommons.org/licenses/by-nc-nd/4.0/ Attribution-NonCommercial-NoDerivatives 4.0 Internacional García, Mario Alejandro No Comercial. Sólo de Uso Académico. |
| eu_rights_str_mv |
openAccess |
| rights_invalid_str_mv |
2022-02-15T14:03:06Z http://creativecommons.org/licenses/by-nc-nd/4.0/ Attribution-NonCommercial-NoDerivatives 4.0 Internacional García, Mario Alejandro No Comercial. Sólo de Uso Académico. |
| dc.format.none.fl_str_mv |
pdf application/pdf |
| dc.publisher.none.fl_str_mv |
Universidad Tecnológica nacional. Facultad Regional Córdoba |
| publisher.none.fl_str_mv |
Universidad Tecnológica nacional. Facultad Regional Córdoba |
| dc.source.none.fl_str_mv |
reponame:Repositorio Institucional Abierto (UTN) instname:Universidad Tecnológica Nacional |
| reponame_str |
Repositorio Institucional Abierto (UTN) |
| collection |
Repositorio Institucional Abierto (UTN) |
| instname_str |
Universidad Tecnológica Nacional |
| repository.name.fl_str_mv |
Repositorio Institucional Abierto (UTN) - Universidad Tecnológica Nacional |
| repository.mail.fl_str_mv |
gestionria@rec.utn.edu.ar; fsuarez@rec.utn.edu.ar |
| _version_ |
1877230957913702400 |
| score |
13.265058 |