Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases
- Autores
- Cafferata, Gianmarco; Beiró, Mariano G.
- Año de publicación
- 2026
- Idioma
- inglés
- Tipo de recurso
- artículo
- Estado
- versión publicada
- Descripción
- Las representaciones vectoriales de palabras representaron el punto de inflexión técnico que dio inicio a los métodos actuales del estado del arte para diversas tareas de Procesamiento del Lenguaje Natural (PLN). Las métricas de sesgo y los métodos de mitigación para embeddings estáticos han sido objeto de estudio con un éxito moderado, logrando reducciones de sesgo para grupos y métricas específicos. No obstante, estos métodos frecuentemente no logran optimizar múltiples métricas de manera simultánea ni impactar significativamente en tareas extrínsecas. La investigación reciente en mitigación se ha reorientado principalmente hacia las representaciones contextuales y los grandes modelos de lenguaje (LLMs). En este trabajo se sostiene que las representaciones estáticas proporcionan un entorno experimental más simple y controlado para la validación de hipótesis y técnicas, las cuales pueden ser posteriormente extrapoladas a modelos de mayor complejidad. Se presenta un método que captura múltiples dimensiones demográficas (género, raza, edad, etc.) en representaciones estáticas simultáneamente, eliminando la dependencia de tareas especializadas o de vocabulario demográfico específico.
Word vector representations were the initial building block that started the current state-of-the-art methods for several NLP tasks. Bias metrics and debiasing methods for static embeddings have been studied with moderate success, achieving some bias reductions for specific groups and metrics. However, these methods often fail to improve multiple metrics simultaneously or to meaningfully impact extrinsic tasks. Recent research in debiasing has mainly shifted its focus towards contextual embeddings and large language models (LLMs). Here we argue that static embeddings provide a simpler and more controlled setting for testing hypotheses and techniques, which can then be extended to more complex models. We introduce a method that captures multiple demographic dimensions (gender, race, age, etc.) in static embeddings simultaneously, eliminating the need for specialized tasks or demographic-specific vocabulary.
Sociedad Argentina de Informática e Investigación Operativa - Materia
-
Ciencias Informáticas
word embeddings
embedding debiasing
language models
fairness
embeddings de palabra
mitigación de sesgos en embedding
modelos de lenguaje
equidad - Nivel de accesibilidad
- acceso abierto
- Condiciones de uso
- http://creativecommons.org/licenses/by-nc-sa/4.0/
- Repositorio
.jpg)
- Institución
- Universidad Nacional de La Plata
- OAI Identificador
- oai:sedici.unlp.edu.ar:10915/195051
Ver los metadatos del registro completo
| id |
SEDICI_16d4e1dbfa795dd2999c9606bb303da1 |
|---|---|
| oai_identifier_str |
oai:sedici.unlp.edu.ar:10915/195051 |
| network_acronym_str |
SEDICI |
| repository_id_str |
1329 |
| network_name_str |
SEDICI (UNLP) |
| spelling |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic BiasesMitigación de sesgos en embeddings basada en nombres: análisis de su impacto en sesgos de género, religiosos y étnicosCafferata, GianmarcoBeiró, Mariano G.Ciencias Informáticasword embeddingsembedding debiasinglanguage modelsfairnessembeddings de palabramitigación de sesgos en embeddingmodelos de lenguajeequidadLas representaciones vectoriales de palabras representaron el punto de inflexión técnico que dio inicio a los métodos actuales del estado del arte para diversas tareas de Procesamiento del Lenguaje Natural (PLN). Las métricas de sesgo y los métodos de mitigación para embeddings estáticos han sido objeto de estudio con un éxito moderado, logrando reducciones de sesgo para grupos y métricas específicos. No obstante, estos métodos frecuentemente no logran optimizar múltiples métricas de manera simultánea ni impactar significativamente en tareas extrínsecas. La investigación reciente en mitigación se ha reorientado principalmente hacia las representaciones contextuales y los grandes modelos de lenguaje (LLMs). En este trabajo se sostiene que las representaciones estáticas proporcionan un entorno experimental más simple y controlado para la validación de hipótesis y técnicas, las cuales pueden ser posteriormente extrapoladas a modelos de mayor complejidad. Se presenta un método que captura múltiples dimensiones demográficas (género, raza, edad, etc.) en representaciones estáticas simultáneamente, eliminando la dependencia de tareas especializadas o de vocabulario demográfico específico.Word vector representations were the initial building block that started the current state-of-the-art methods for several NLP tasks. Bias metrics and debiasing methods for static embeddings have been studied with moderate success, achieving some bias reductions for specific groups and metrics. However, these methods often fail to improve multiple metrics simultaneously or to meaningfully impact extrinsic tasks. Recent research in debiasing has mainly shifted its focus towards contextual embeddings and large language models (LLMs). Here we argue that static embeddings provide a simpler and more controlled setting for testing hypotheses and techniques, which can then be extended to more complex models. We introduce a method that captures multiple demographic dimensions (gender, race, age, etc.) in static embeddings simultaneously, eliminating the need for specialized tasks or demographic-specific vocabulary.Sociedad Argentina de Informática e Investigación Operativa2026-05-27info:eu-repo/semantics/articleinfo:eu-repo/semantics/publishedVersionArticulohttp://purl.org/coar/resource_type/c_6501info:ar-repo/semantics/articuloapplication/pdfhttp://sedici.unlp.edu.ar/handle/10915/195051enginfo:eu-repo/semantics/altIdentifier/url/https://revistas.unlp.edu.ar/ejs/article/view/20903info:eu-repo/semantics/altIdentifier/issn/1514-6774info:eu-repo/semantics/altIdentifier/doi/10.24215/15146774e102info:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-sa/4.0/Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)reponame:SEDICI (UNLP)instname:Universidad Nacional de La Platainstacron:UNLP2026-06-23T11:16:56Zoai:sedici.unlp.edu.ar:10915/195051Institucionalhttp://sedici.unlp.edu.ar/Universidad públicaNo correspondehttp://sedici.unlp.edu.ar/oai/snrdalira@sedici.unlp.edu.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:13292026-06-23 11:16:56.339SEDICI (UNLP) - Universidad Nacional de La Platafalse |
| dc.title.none.fl_str_mv |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases Mitigación de sesgos en embeddings basada en nombres: análisis de su impacto en sesgos de género, religiosos y étnicos |
| title |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases |
| spellingShingle |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases Cafferata, Gianmarco Ciencias Informáticas word embeddings embedding debiasing language models fairness embeddings de palabra mitigación de sesgos en embedding modelos de lenguaje equidad |
| title_short |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases |
| title_full |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases |
| title_fullStr |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases |
| title_full_unstemmed |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases |
| title_sort |
Name-Based Embedding Debiasing: Analyzing Its Impact on Gender, Religious, and Ethnic Biases |
| dc.creator.none.fl_str_mv |
Cafferata, Gianmarco Beiró, Mariano G. |
| author |
Cafferata, Gianmarco |
| author_facet |
Cafferata, Gianmarco Beiró, Mariano G. |
| author_role |
author |
| author2 |
Beiró, Mariano G. |
| author2_role |
author |
| dc.subject.none.fl_str_mv |
Ciencias Informáticas word embeddings embedding debiasing language models fairness embeddings de palabra mitigación de sesgos en embedding modelos de lenguaje equidad |
| topic |
Ciencias Informáticas word embeddings embedding debiasing language models fairness embeddings de palabra mitigación de sesgos en embedding modelos de lenguaje equidad |
| dc.description.none.fl_txt_mv |
Las representaciones vectoriales de palabras representaron el punto de inflexión técnico que dio inicio a los métodos actuales del estado del arte para diversas tareas de Procesamiento del Lenguaje Natural (PLN). Las métricas de sesgo y los métodos de mitigación para embeddings estáticos han sido objeto de estudio con un éxito moderado, logrando reducciones de sesgo para grupos y métricas específicos. No obstante, estos métodos frecuentemente no logran optimizar múltiples métricas de manera simultánea ni impactar significativamente en tareas extrínsecas. La investigación reciente en mitigación se ha reorientado principalmente hacia las representaciones contextuales y los grandes modelos de lenguaje (LLMs). En este trabajo se sostiene que las representaciones estáticas proporcionan un entorno experimental más simple y controlado para la validación de hipótesis y técnicas, las cuales pueden ser posteriormente extrapoladas a modelos de mayor complejidad. Se presenta un método que captura múltiples dimensiones demográficas (género, raza, edad, etc.) en representaciones estáticas simultáneamente, eliminando la dependencia de tareas especializadas o de vocabulario demográfico específico. Word vector representations were the initial building block that started the current state-of-the-art methods for several NLP tasks. Bias metrics and debiasing methods for static embeddings have been studied with moderate success, achieving some bias reductions for specific groups and metrics. However, these methods often fail to improve multiple metrics simultaneously or to meaningfully impact extrinsic tasks. Recent research in debiasing has mainly shifted its focus towards contextual embeddings and large language models (LLMs). Here we argue that static embeddings provide a simpler and more controlled setting for testing hypotheses and techniques, which can then be extended to more complex models. We introduce a method that captures multiple demographic dimensions (gender, race, age, etc.) in static embeddings simultaneously, eliminating the need for specialized tasks or demographic-specific vocabulary. Sociedad Argentina de Informática e Investigación Operativa |
| description |
Las representaciones vectoriales de palabras representaron el punto de inflexión técnico que dio inicio a los métodos actuales del estado del arte para diversas tareas de Procesamiento del Lenguaje Natural (PLN). Las métricas de sesgo y los métodos de mitigación para embeddings estáticos han sido objeto de estudio con un éxito moderado, logrando reducciones de sesgo para grupos y métricas específicos. No obstante, estos métodos frecuentemente no logran optimizar múltiples métricas de manera simultánea ni impactar significativamente en tareas extrínsecas. La investigación reciente en mitigación se ha reorientado principalmente hacia las representaciones contextuales y los grandes modelos de lenguaje (LLMs). En este trabajo se sostiene que las representaciones estáticas proporcionan un entorno experimental más simple y controlado para la validación de hipótesis y técnicas, las cuales pueden ser posteriormente extrapoladas a modelos de mayor complejidad. Se presenta un método que captura múltiples dimensiones demográficas (género, raza, edad, etc.) en representaciones estáticas simultáneamente, eliminando la dependencia de tareas especializadas o de vocabulario demográfico específico. |
| publishDate |
2026 |
| dc.date.none.fl_str_mv |
2026-05-27 |
| dc.type.none.fl_str_mv |
info:eu-repo/semantics/article info:eu-repo/semantics/publishedVersion Articulo http://purl.org/coar/resource_type/c_6501 info:ar-repo/semantics/articulo |
| format |
article |
| status_str |
publishedVersion |
| dc.identifier.none.fl_str_mv |
http://sedici.unlp.edu.ar/handle/10915/195051 |
| url |
http://sedici.unlp.edu.ar/handle/10915/195051 |
| dc.language.none.fl_str_mv |
eng |
| language |
eng |
| dc.relation.none.fl_str_mv |
info:eu-repo/semantics/altIdentifier/url/https://revistas.unlp.edu.ar/ejs/article/view/20903 info:eu-repo/semantics/altIdentifier/issn/1514-6774 info:eu-repo/semantics/altIdentifier/doi/10.24215/15146774e102 |
| dc.rights.none.fl_str_mv |
info:eu-repo/semantics/openAccess http://creativecommons.org/licenses/by-nc-sa/4.0/ Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0) |
| eu_rights_str_mv |
openAccess |
| rights_invalid_str_mv |
http://creativecommons.org/licenses/by-nc-sa/4.0/ Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0) |
| dc.format.none.fl_str_mv |
application/pdf |
| dc.source.none.fl_str_mv |
reponame:SEDICI (UNLP) instname:Universidad Nacional de La Plata instacron:UNLP |
| reponame_str |
SEDICI (UNLP) |
| collection |
SEDICI (UNLP) |
| instname_str |
Universidad Nacional de La Plata |
| instacron_str |
UNLP |
| institution |
UNLP |
| repository.name.fl_str_mv |
SEDICI (UNLP) - Universidad Nacional de La Plata |
| repository.mail.fl_str_mv |
alira@sedici.unlp.edu.ar |
| _version_ |
1868982608803659776 |
| score |
13.24418 |