El problema
Mi Trabajo de Fin de Grado estudia cómo se comportan los agentes de aprendizaje por refuerzo cuando no pueden observar el estado completo y qué estrategias de entrenamiento recuperan mejor la información que falta. El trabajo amplía esa pregunta para medir los efectos de la memoria, la motivación intrínseca y el aprendizaje curricular.
Enfoque y decisiones
Un benchmark MiniGrid modular, reproducible y multisemilla compara cuatro algoritmos:
- PPO y A2C como baselines actor-critic on-policy.
- DQN como punto de comparación basado en valor.
- RecurrentPPO para probar memoria explícita bajo observabilidad parcial.
La evaluación varía la observabilidad y la estrategia de entrenamiento con ejecuciones guiadas por configuración y repetibles entre semillas. Así separa la elección del algoritmo de la aportación de la memoria recurrente, las señales de recompensa intrínseca y un currículo por etapas.
Resultados
Tasa de éxito en evaluación, media sobre semillas con intervalo de confianza del 95 % por bootstrap. El agente ve una ventana egocéntrica de 7×7 salvo que se indique lo contrario; 5 semillas por configuración.
| Pregunta | Configuración | Éxito | IC 95 % |
|---|---|---|---|
| Currículo | DoorKey-8x8, escalonado desde 5×5 | 0,948 | [0,90, 0,98] |
DoorKey-8x8, entrenado directamente | 0,372 | [0,00, 0,76] | |
| Exploración | MultiRoom-N6, bonus NovelD | 0,856 | [0,80, 0,92] |
MultiRoom-N6, bonus RND | 0,028 | [0,01, 0,04] | |
MultiRoom-N6, sin bonus, ICM o RIDE | 0,000 | [0,00, 0,00] | |
| Memoria | MemoryS13Random, PPO, un solo frame | 0,540 | [0,47, 0,61] |
MemoryS13Random, RecurrentPPO (LSTM) | 0,476 | [0,40, 0,55] | |
MemoryS13Random, PPO, pila de 4 frames | 0,440 | [0,38, 0,49] |
Qué dicen las cifras:
- El currículo fue la palanca más fiable. Escalonar DoorKey de 5×5 a 8×8 alcanzó un 0,948 de éxito; entrenar directamente en 8×8 se quedó en 0,372 de media, con un intervalo de 0,00 a 0,76: que aprenda o no depende de la semilla.
- Los bonus de exploración no son intercambiables. En MultiRoom-N6 solo NovelD despegó; RND, ICM y RIDE se quedaron en cero o casi, igual que PPO sin bonus. Un currículo por número de habitaciones llegó a 0,892 sin ningún bonus.
- La memoria explícita no compensó. Ni una LSTM ni apilar frames superaron a PPO con un solo frame en la tarea de memoria con este presupuesto de entrenamiento.
- Ver más cuadrícula no es tener más señal. Dar a PPO la cuadrícula completa alocéntrica en FourRooms hundió el éxito de 0,653 a 0,007 (3 semillas): pesó más la representación del estado que cuánto de él veía el agente.