Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos

Autores
Crespo, María Liz; Errecalde, Marcelo Luis; Montoya, Cecilia Inés
Año de publicación
1998
Idioma
español castellano
Tipo de recurso
documento de conferencia
Estado
versión publicada
Descripción
En los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área.
Sistemas Inteligentes - Sesión de pósters
Red de Universidades con Carreras en Informática (RedUNCI)
Materia
Ciencias Informáticas
Informática
inteligencia artifícial
Learning
reinforcement learning
Collaborative learning
machine learning
ARTIFICIAL INTELLIGENCE
programación dinámica asincrónica
métodos libres de modelo
arquitecturas para aprendizaje y planeamiento
Nivel de accesibilidad
acceso abierto
Condiciones de uso
http://creativecommons.org/licenses/by-nc-sa/2.5/ar/
Repositorio
SEDICI (UNLP)
Institución
Universidad Nacional de La Plata
OAI Identificador
oai:sedici.unlp.edu.ar:10915/24832

id SEDICI_6f835b98f3bb46a3fcffdb9613e6af66
oai_identifier_str oai:sedici.unlp.edu.ar:10915/24832
network_acronym_str SEDICI
repository_id_str 1329
network_name_str SEDICI (UNLP)
spelling Reinforcement learning: Un estudio comparativo de la performance de sus principales métodosCrespo, María LizErrecalde, Marcelo LuisMontoya, Cecilia InésCiencias InformáticasInformáticainteligencia artifícialLearningreinforcement learningCollaborative learningmachine learningARTIFICIAL INTELLIGENCEprogramación dinámica asincrónicamétodos libres de modeloarquitecturas para aprendizaje y planeamientoEn los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área.Sistemas Inteligentes - Sesión de póstersRed de Universidades con Carreras en Informática (RedUNCI)1998-10info:eu-repo/semantics/conferenceObjectinfo:eu-repo/semantics/publishedVersionObjeto de conferenciahttp://purl.org/coar/resource_type/c_5794info:ar-repo/semantics/documentoDeConferenciaapplication/pdfhttp://sedici.unlp.edu.ar/handle/10915/24832spainfo:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-sa/2.5/ar/Creative Commons Attribution-NonCommercial-ShareAlike 2.5 Argentina (CC BY-NC-SA 2.5)reponame:SEDICI (UNLP)instname:Universidad Nacional de La Platainstacron:UNLP2026-06-23T10:18:53Zoai:sedici.unlp.edu.ar:10915/24832Institucionalhttp://sedici.unlp.edu.ar/Universidad públicaNo correspondehttp://sedici.unlp.edu.ar/oai/snrdalira@sedici.unlp.edu.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:13292026-06-23 10:18:53.613SEDICI (UNLP) - Universidad Nacional de La Platafalse
dc.title.none.fl_str_mv Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
title Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
spellingShingle Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
Crespo, María Liz
Ciencias Informáticas
Informática
inteligencia artifícial
Learning
reinforcement learning
Collaborative learning
machine learning
ARTIFICIAL INTELLIGENCE
programación dinámica asincrónica
métodos libres de modelo
arquitecturas para aprendizaje y planeamiento
title_short Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
title_full Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
title_fullStr Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
title_full_unstemmed Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
title_sort Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
dc.creator.none.fl_str_mv Crespo, María Liz
Errecalde, Marcelo Luis
Montoya, Cecilia Inés
author Crespo, María Liz
author_facet Crespo, María Liz
Errecalde, Marcelo Luis
Montoya, Cecilia Inés
author_role author
author2 Errecalde, Marcelo Luis
Montoya, Cecilia Inés
author2_role author
author
dc.subject.none.fl_str_mv Ciencias Informáticas
Informática
inteligencia artifícial
Learning
reinforcement learning
Collaborative learning
machine learning
ARTIFICIAL INTELLIGENCE
programación dinámica asincrónica
métodos libres de modelo
arquitecturas para aprendizaje y planeamiento
topic Ciencias Informáticas
Informática
inteligencia artifícial
Learning
reinforcement learning
Collaborative learning
machine learning
ARTIFICIAL INTELLIGENCE
programación dinámica asincrónica
métodos libres de modelo
arquitecturas para aprendizaje y planeamiento
dc.description.none.fl_txt_mv En los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área.
Sistemas Inteligentes - Sesión de pósters
Red de Universidades con Carreras en Informática (RedUNCI)
description En los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área.
publishDate 1998
dc.date.none.fl_str_mv 1998-10
dc.type.none.fl_str_mv info:eu-repo/semantics/conferenceObject
info:eu-repo/semantics/publishedVersion
Objeto de conferencia
http://purl.org/coar/resource_type/c_5794
info:ar-repo/semantics/documentoDeConferencia
format conferenceObject
status_str publishedVersion
dc.identifier.none.fl_str_mv http://sedici.unlp.edu.ar/handle/10915/24832
url http://sedici.unlp.edu.ar/handle/10915/24832
dc.language.none.fl_str_mv spa
language spa
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
http://creativecommons.org/licenses/by-nc-sa/2.5/ar/
Creative Commons Attribution-NonCommercial-ShareAlike 2.5 Argentina (CC BY-NC-SA 2.5)
eu_rights_str_mv openAccess
rights_invalid_str_mv http://creativecommons.org/licenses/by-nc-sa/2.5/ar/
Creative Commons Attribution-NonCommercial-ShareAlike 2.5 Argentina (CC BY-NC-SA 2.5)
dc.format.none.fl_str_mv application/pdf
dc.source.none.fl_str_mv reponame:SEDICI (UNLP)
instname:Universidad Nacional de La Plata
instacron:UNLP
reponame_str SEDICI (UNLP)
collection SEDICI (UNLP)
instname_str Universidad Nacional de La Plata
instacron_str UNLP
institution UNLP
repository.name.fl_str_mv SEDICI (UNLP) - Universidad Nacional de La Plata
repository.mail.fl_str_mv alira@sedici.unlp.edu.ar
_version_ 1868981690020397056
score 13.364332