Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
- Autores
- Crespo, María Liz; Errecalde, Marcelo Luis; Montoya, Cecilia Inés
- Año de publicación
- 1998
- Idioma
- español castellano
- Tipo de recurso
- documento de conferencia
- Estado
- versión publicada
- Descripción
- En los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área.
Sistemas Inteligentes - Sesión de pósters
Red de Universidades con Carreras en Informática (RedUNCI) - Materia
-
Ciencias Informáticas
Informática
inteligencia artifícial
Learning
reinforcement learning
Collaborative learning
machine learning
ARTIFICIAL INTELLIGENCE
programación dinámica asincrónica
métodos libres de modelo
arquitecturas para aprendizaje y planeamiento - Nivel de accesibilidad
- acceso abierto
- Condiciones de uso
- http://creativecommons.org/licenses/by-nc-sa/2.5/ar/
- Repositorio
.jpg)
- Institución
- Universidad Nacional de La Plata
- OAI Identificador
- oai:sedici.unlp.edu.ar:10915/24832
Ver los metadatos del registro completo
| id |
SEDICI_6f835b98f3bb46a3fcffdb9613e6af66 |
|---|---|
| oai_identifier_str |
oai:sedici.unlp.edu.ar:10915/24832 |
| network_acronym_str |
SEDICI |
| repository_id_str |
1329 |
| network_name_str |
SEDICI (UNLP) |
| spelling |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodosCrespo, María LizErrecalde, Marcelo LuisMontoya, Cecilia InésCiencias InformáticasInformáticainteligencia artifícialLearningreinforcement learningCollaborative learningmachine learningARTIFICIAL INTELLIGENCEprogramación dinámica asincrónicamétodos libres de modeloarquitecturas para aprendizaje y planeamientoEn los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área.Sistemas Inteligentes - Sesión de póstersRed de Universidades con Carreras en Informática (RedUNCI)1998-10info:eu-repo/semantics/conferenceObjectinfo:eu-repo/semantics/publishedVersionObjeto de conferenciahttp://purl.org/coar/resource_type/c_5794info:ar-repo/semantics/documentoDeConferenciaapplication/pdfhttp://sedici.unlp.edu.ar/handle/10915/24832spainfo:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-sa/2.5/ar/Creative Commons Attribution-NonCommercial-ShareAlike 2.5 Argentina (CC BY-NC-SA 2.5)reponame:SEDICI (UNLP)instname:Universidad Nacional de La Platainstacron:UNLP2026-06-23T10:18:53Zoai:sedici.unlp.edu.ar:10915/24832Institucionalhttp://sedici.unlp.edu.ar/Universidad públicaNo correspondehttp://sedici.unlp.edu.ar/oai/snrdalira@sedici.unlp.edu.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:13292026-06-23 10:18:53.613SEDICI (UNLP) - Universidad Nacional de La Platafalse |
| dc.title.none.fl_str_mv |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos |
| title |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos |
| spellingShingle |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos Crespo, María Liz Ciencias Informáticas Informática inteligencia artifícial Learning reinforcement learning Collaborative learning machine learning ARTIFICIAL INTELLIGENCE programación dinámica asincrónica métodos libres de modelo arquitecturas para aprendizaje y planeamiento |
| title_short |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos |
| title_full |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos |
| title_fullStr |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos |
| title_full_unstemmed |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos |
| title_sort |
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos |
| dc.creator.none.fl_str_mv |
Crespo, María Liz Errecalde, Marcelo Luis Montoya, Cecilia Inés |
| author |
Crespo, María Liz |
| author_facet |
Crespo, María Liz Errecalde, Marcelo Luis Montoya, Cecilia Inés |
| author_role |
author |
| author2 |
Errecalde, Marcelo Luis Montoya, Cecilia Inés |
| author2_role |
author author |
| dc.subject.none.fl_str_mv |
Ciencias Informáticas Informática inteligencia artifícial Learning reinforcement learning Collaborative learning machine learning ARTIFICIAL INTELLIGENCE programación dinámica asincrónica métodos libres de modelo arquitecturas para aprendizaje y planeamiento |
| topic |
Ciencias Informáticas Informática inteligencia artifícial Learning reinforcement learning Collaborative learning machine learning ARTIFICIAL INTELLIGENCE programación dinámica asincrónica métodos libres de modelo arquitecturas para aprendizaje y planeamiento |
| dc.description.none.fl_txt_mv |
En los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área. Sistemas Inteligentes - Sesión de pósters Red de Universidades con Carreras en Informática (RedUNCI) |
| description |
En los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área. |
| publishDate |
1998 |
| dc.date.none.fl_str_mv |
1998-10 |
| dc.type.none.fl_str_mv |
info:eu-repo/semantics/conferenceObject info:eu-repo/semantics/publishedVersion Objeto de conferencia http://purl.org/coar/resource_type/c_5794 info:ar-repo/semantics/documentoDeConferencia |
| format |
conferenceObject |
| status_str |
publishedVersion |
| dc.identifier.none.fl_str_mv |
http://sedici.unlp.edu.ar/handle/10915/24832 |
| url |
http://sedici.unlp.edu.ar/handle/10915/24832 |
| dc.language.none.fl_str_mv |
spa |
| language |
spa |
| dc.rights.none.fl_str_mv |
info:eu-repo/semantics/openAccess http://creativecommons.org/licenses/by-nc-sa/2.5/ar/ Creative Commons Attribution-NonCommercial-ShareAlike 2.5 Argentina (CC BY-NC-SA 2.5) |
| eu_rights_str_mv |
openAccess |
| rights_invalid_str_mv |
http://creativecommons.org/licenses/by-nc-sa/2.5/ar/ Creative Commons Attribution-NonCommercial-ShareAlike 2.5 Argentina (CC BY-NC-SA 2.5) |
| dc.format.none.fl_str_mv |
application/pdf |
| dc.source.none.fl_str_mv |
reponame:SEDICI (UNLP) instname:Universidad Nacional de La Plata instacron:UNLP |
| reponame_str |
SEDICI (UNLP) |
| collection |
SEDICI (UNLP) |
| instname_str |
Universidad Nacional de La Plata |
| instacron_str |
UNLP |
| institution |
UNLP |
| repository.name.fl_str_mv |
SEDICI (UNLP) - Universidad Nacional de La Plata |
| repository.mail.fl_str_mv |
alira@sedici.unlp.edu.ar |
| _version_ |
1868981690020397056 |
| score |
13.364332 |