Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos

Autores
Parras, Elías Franco
Año de publicación
2026
Idioma
español castellano
Tipo de recurso
tesis de grado
Estado
versión publicada
Colaborador/a o director/a de tesis
Comay, Nicolás
Descripción
Práctica Supervisada en Investigación (Licenciatura en Psicología) -- Universidad Nacional de Córdoba. Facultad de Psicología, 2026.
Fil: Parras, Elías Franco. Universidad Nacional de Córdoba. Facultad de Psicología; Argentina.
La confianza en la toma de decisiones constituye uno de los procesos metacognitivos más estudiados en psicología cognitiva contemporánea. Lejos de ser un epifenómeno subjetivo, cumple una función reguladora central: orienta el balance entre explorar nuevas opciones y explotar las conocidas, y opera como estimador interno de la probabilidad de haber elegido correctamente. Desde una perspectiva normativa, la Hipótesis Bayesiana de la Confianza postula que los juicios de confianza reflejan el cómputo confianza = p(decisión correcta | evidencia). Sanders et al. (2016) pusieron a prueba esta hipótesis identificando tres marcas estadísticas: (1) calibración entre certeza subjetiva y exactitud objetiva, (2) modulación diferencial según la discriminabilidad entre opciones —mayor confianza en aciertos y menor en errores a medida que las opciones se diferencian más— y (3) niveles intermedios ante evidencia neutra. Sin embargo, casi toda la evidencia disponible proviene de dominios perceptuales. El aprendizaje por refuerzos, donde la incertidumbre emerge de distribuciones de recompensa estocásticas y se reduce con la experiencia, ha sido mucho menos explorado desde este marco. El objetivo del presente trabajo fue evaluar si estas tres marcas se replican en una tarea de bandido de dos brazos. Treinta participantes universitarios (18–40 años) completaron 20 bloques de 30 ensayos cada uno (600 decisiones totales). En cada ensayo eligieron entre dos opciones con distribuciones Beta de parámetros variables, reportaron su confianza en escala 1–4 antes del feedback, y recibieron una recompensa entre 0 y 100 puntos. El estudio fue pre-registrado en OSF. Para la Marca 1 se utilizó una regresión logística mixta con pendientes aleatorias por sujeto. Los resultados confirmaron una asociación robusta: t(29) = 9.98, p < .001, Odds Ratio promedio individual = 3.87. Por cada unidad de aumento en la confianza estandarizada, las probabilidades de acertar se multiplican casi por cuatro. La primera hipótesis se confirmó. Para la Marca 2 se dividieron los bloques en cinco partes y se condujeron dos ANOVA de medidas repetidas separados por exactitud. En aciertos la confianza aumentó drásticamente: F(4,116) = 44.41, p < .001, η²G = 0.311 (efecto grande). En errores el efecto fue significativo pero de magnitud menor: F(4,116) = 7.37, p < .001, η²G = 0.034. Crucialmente, la confianza en errores no disminuyó como predice el modelo normativo, sino que se mantuvo baja con leve tendencia al alza. Este desvío es coherente con el sesgo de sobreconfianza (Baranski & Petrusic, 1994) y el sesgo de valencia (Lebreton et al., 2018). La segunda hipótesis se confirmó parcialmente. Para la Marca 3 se analizó la confianza reescalada a 0–1 durante los primeros ensayos de cada bloque. Un t-test contra el punto de neutralidad teórica (0.5) reveló sub-confianza significativa: M = 0.39, t(29) = -2.09, p = .045, d = 0.38. Esta cautela inicial es funcionalmente interpretable como un mecanismo adaptativo que promueve la exploración temprana, evitando el compromiso prematuro sin información suficiente. La tercera hipótesis no se confirmó en la dirección esperada, aunque el desvío es teóricamente coherente. Un análisis complementario mediante GLMM binomial mostró que la interacción entre nivel de confianza y progresión temporal predijo el acierto significativamente (beta = 0.32, z = 4.29, p < .001): la brecha de rendimiento entre alta y baja confianza se amplifica con el aprendizaje. El análisis de pendientes aleatorias reveló además variabilidad individual marcada, en línea con los fenotipos de confianza descritos por Navajas et al. (2017) y Comay et al. (2026).
Fil: Parras, Elías Franco. Universidad Nacional de Córdoba. Facultad de Psicología; Argentina.
Materia
Confianza
Toma de decisiones
Aprendizaje por refuerzo
Nivel de accesibilidad
acceso abierto
Condiciones de uso
Repositorio
Repositorio Digital Universitario (UNC)
Institución
Universidad Nacional de Córdoba
OAI Identificador
oai:rdu.unc.edu.ar:11086/561642

id RDUUNC_b54f5fab6c59fed0708ab592b9b5c00b
oai_identifier_str oai:rdu.unc.edu.ar:11086/561642
network_acronym_str RDUUNC
repository_id_str 2572
network_name_str Repositorio Digital Universitario (UNC)
spelling Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzosParras, Elías FrancoConfianzaToma de decisionesAprendizaje por refuerzoPráctica Supervisada en Investigación (Licenciatura en Psicología) -- Universidad Nacional de Córdoba. Facultad de Psicología, 2026.Fil: Parras, Elías Franco. Universidad Nacional de Córdoba. Facultad de Psicología; Argentina.La confianza en la toma de decisiones constituye uno de los procesos metacognitivos más estudiados en psicología cognitiva contemporánea. Lejos de ser un epifenómeno subjetivo, cumple una función reguladora central: orienta el balance entre explorar nuevas opciones y explotar las conocidas, y opera como estimador interno de la probabilidad de haber elegido correctamente. Desde una perspectiva normativa, la Hipótesis Bayesiana de la Confianza postula que los juicios de confianza reflejan el cómputo confianza = p(decisión correcta | evidencia). Sanders et al. (2016) pusieron a prueba esta hipótesis identificando tres marcas estadísticas: (1) calibración entre certeza subjetiva y exactitud objetiva, (2) modulación diferencial según la discriminabilidad entre opciones —mayor confianza en aciertos y menor en errores a medida que las opciones se diferencian más— y (3) niveles intermedios ante evidencia neutra. Sin embargo, casi toda la evidencia disponible proviene de dominios perceptuales. El aprendizaje por refuerzos, donde la incertidumbre emerge de distribuciones de recompensa estocásticas y se reduce con la experiencia, ha sido mucho menos explorado desde este marco. El objetivo del presente trabajo fue evaluar si estas tres marcas se replican en una tarea de bandido de dos brazos. Treinta participantes universitarios (18–40 años) completaron 20 bloques de 30 ensayos cada uno (600 decisiones totales). En cada ensayo eligieron entre dos opciones con distribuciones Beta de parámetros variables, reportaron su confianza en escala 1–4 antes del feedback, y recibieron una recompensa entre 0 y 100 puntos. El estudio fue pre-registrado en OSF. Para la Marca 1 se utilizó una regresión logística mixta con pendientes aleatorias por sujeto. Los resultados confirmaron una asociación robusta: t(29) = 9.98, p < .001, Odds Ratio promedio individual = 3.87. Por cada unidad de aumento en la confianza estandarizada, las probabilidades de acertar se multiplican casi por cuatro. La primera hipótesis se confirmó. Para la Marca 2 se dividieron los bloques en cinco partes y se condujeron dos ANOVA de medidas repetidas separados por exactitud. En aciertos la confianza aumentó drásticamente: F(4,116) = 44.41, p < .001, η²G = 0.311 (efecto grande). En errores el efecto fue significativo pero de magnitud menor: F(4,116) = 7.37, p < .001, η²G = 0.034. Crucialmente, la confianza en errores no disminuyó como predice el modelo normativo, sino que se mantuvo baja con leve tendencia al alza. Este desvío es coherente con el sesgo de sobreconfianza (Baranski & Petrusic, 1994) y el sesgo de valencia (Lebreton et al., 2018). La segunda hipótesis se confirmó parcialmente. Para la Marca 3 se analizó la confianza reescalada a 0–1 durante los primeros ensayos de cada bloque. Un t-test contra el punto de neutralidad teórica (0.5) reveló sub-confianza significativa: M = 0.39, t(29) = -2.09, p = .045, d = 0.38. Esta cautela inicial es funcionalmente interpretable como un mecanismo adaptativo que promueve la exploración temprana, evitando el compromiso prematuro sin información suficiente. La tercera hipótesis no se confirmó en la dirección esperada, aunque el desvío es teóricamente coherente. Un análisis complementario mediante GLMM binomial mostró que la interacción entre nivel de confianza y progresión temporal predijo el acierto significativamente (beta = 0.32, z = 4.29, p < .001): la brecha de rendimiento entre alta y baja confianza se amplifica con el aprendizaje. El análisis de pendientes aleatorias reveló además variabilidad individual marcada, en línea con los fenotipos de confianza descritos por Navajas et al. (2017) y Comay et al. (2026).Fil: Parras, Elías Franco. Universidad Nacional de Córdoba. Facultad de Psicología; Argentina.Comay, Nicolás2026-06-04info:eu-repo/semantics/bachelorThesisinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_7a1finfo:ar-repo/semantics/tesisDeGradoapplication/pdfhttp://hdl.handle.net/11086/561642spainfo:eu-repo/semantics/openAccessreponame:Repositorio Digital Universitario (UNC)instname:Universidad Nacional de Córdobainstacron:UNC2026-09-24T11:36:07Zoai:rdu.unc.edu.ar:11086/561642Institucionalhttps://rdu.unc.edu.ar/Universidad públicaNo correspondehttp://rdu.unc.edu.ar/oai/snrdoca.unc@gmail.comArgentinaNo correspondeNo correspondeNo correspondeopendoar:25722026-09-24 11:36:09.243Repositorio Digital Universitario (UNC) - Universidad Nacional de Córdobafalse
dc.title.none.fl_str_mv Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos
title Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos
spellingShingle Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos
Parras, Elías Franco
Confianza
Toma de decisiones
Aprendizaje por refuerzo
title_short Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos
title_full Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos
title_fullStr Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos
title_full_unstemmed Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos
title_sort Evaluación de las marcas bayesianas de la confianza en aprendizaje por refuerzos
dc.creator.none.fl_str_mv Parras, Elías Franco
author Parras, Elías Franco
author_facet Parras, Elías Franco
author_role author
dc.contributor.none.fl_str_mv Comay, Nicolás
dc.subject.none.fl_str_mv Confianza
Toma de decisiones
Aprendizaje por refuerzo
topic Confianza
Toma de decisiones
Aprendizaje por refuerzo
dc.description.none.fl_txt_mv Práctica Supervisada en Investigación (Licenciatura en Psicología) -- Universidad Nacional de Córdoba. Facultad de Psicología, 2026.
Fil: Parras, Elías Franco. Universidad Nacional de Córdoba. Facultad de Psicología; Argentina.
La confianza en la toma de decisiones constituye uno de los procesos metacognitivos más estudiados en psicología cognitiva contemporánea. Lejos de ser un epifenómeno subjetivo, cumple una función reguladora central: orienta el balance entre explorar nuevas opciones y explotar las conocidas, y opera como estimador interno de la probabilidad de haber elegido correctamente. Desde una perspectiva normativa, la Hipótesis Bayesiana de la Confianza postula que los juicios de confianza reflejan el cómputo confianza = p(decisión correcta | evidencia). Sanders et al. (2016) pusieron a prueba esta hipótesis identificando tres marcas estadísticas: (1) calibración entre certeza subjetiva y exactitud objetiva, (2) modulación diferencial según la discriminabilidad entre opciones —mayor confianza en aciertos y menor en errores a medida que las opciones se diferencian más— y (3) niveles intermedios ante evidencia neutra. Sin embargo, casi toda la evidencia disponible proviene de dominios perceptuales. El aprendizaje por refuerzos, donde la incertidumbre emerge de distribuciones de recompensa estocásticas y se reduce con la experiencia, ha sido mucho menos explorado desde este marco. El objetivo del presente trabajo fue evaluar si estas tres marcas se replican en una tarea de bandido de dos brazos. Treinta participantes universitarios (18–40 años) completaron 20 bloques de 30 ensayos cada uno (600 decisiones totales). En cada ensayo eligieron entre dos opciones con distribuciones Beta de parámetros variables, reportaron su confianza en escala 1–4 antes del feedback, y recibieron una recompensa entre 0 y 100 puntos. El estudio fue pre-registrado en OSF. Para la Marca 1 se utilizó una regresión logística mixta con pendientes aleatorias por sujeto. Los resultados confirmaron una asociación robusta: t(29) = 9.98, p < .001, Odds Ratio promedio individual = 3.87. Por cada unidad de aumento en la confianza estandarizada, las probabilidades de acertar se multiplican casi por cuatro. La primera hipótesis se confirmó. Para la Marca 2 se dividieron los bloques en cinco partes y se condujeron dos ANOVA de medidas repetidas separados por exactitud. En aciertos la confianza aumentó drásticamente: F(4,116) = 44.41, p < .001, η²G = 0.311 (efecto grande). En errores el efecto fue significativo pero de magnitud menor: F(4,116) = 7.37, p < .001, η²G = 0.034. Crucialmente, la confianza en errores no disminuyó como predice el modelo normativo, sino que se mantuvo baja con leve tendencia al alza. Este desvío es coherente con el sesgo de sobreconfianza (Baranski & Petrusic, 1994) y el sesgo de valencia (Lebreton et al., 2018). La segunda hipótesis se confirmó parcialmente. Para la Marca 3 se analizó la confianza reescalada a 0–1 durante los primeros ensayos de cada bloque. Un t-test contra el punto de neutralidad teórica (0.5) reveló sub-confianza significativa: M = 0.39, t(29) = -2.09, p = .045, d = 0.38. Esta cautela inicial es funcionalmente interpretable como un mecanismo adaptativo que promueve la exploración temprana, evitando el compromiso prematuro sin información suficiente. La tercera hipótesis no se confirmó en la dirección esperada, aunque el desvío es teóricamente coherente. Un análisis complementario mediante GLMM binomial mostró que la interacción entre nivel de confianza y progresión temporal predijo el acierto significativamente (beta = 0.32, z = 4.29, p < .001): la brecha de rendimiento entre alta y baja confianza se amplifica con el aprendizaje. El análisis de pendientes aleatorias reveló además variabilidad individual marcada, en línea con los fenotipos de confianza descritos por Navajas et al. (2017) y Comay et al. (2026).
Fil: Parras, Elías Franco. Universidad Nacional de Córdoba. Facultad de Psicología; Argentina.
description Práctica Supervisada en Investigación (Licenciatura en Psicología) -- Universidad Nacional de Córdoba. Facultad de Psicología, 2026.
publishDate 2026
dc.date.none.fl_str_mv 2026-06-04
dc.type.none.fl_str_mv info:eu-repo/semantics/bachelorThesis
info:eu-repo/semantics/publishedVersion
http://purl.org/coar/resource_type/c_7a1f
info:ar-repo/semantics/tesisDeGrado
format bachelorThesis
status_str publishedVersion
dc.identifier.none.fl_str_mv http://hdl.handle.net/11086/561642
url http://hdl.handle.net/11086/561642
dc.language.none.fl_str_mv spa
language spa
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.source.none.fl_str_mv reponame:Repositorio Digital Universitario (UNC)
instname:Universidad Nacional de Córdoba
instacron:UNC
reponame_str Repositorio Digital Universitario (UNC)
collection Repositorio Digital Universitario (UNC)
instname_str Universidad Nacional de Córdoba
instacron_str UNC
institution UNC
repository.name.fl_str_mv Repositorio Digital Universitario (UNC) - Universidad Nacional de Córdoba
repository.mail.fl_str_mv oca.unc@gmail.com
_version_ 1877228026696040448
score 12.733355