Saltar al contenido
← Proyectos

2026 · Trabajo de Fin de Grado · Universidade de Vigo

Observabilidad parcial en RL profundo

Mi Trabajo de Fin de Grado: un benchmark reproducible y multisemilla en MiniGrid de PPO, A2C, DQN y RecurrentPPO bajo observabilidad parcial. El aprendizaje curricular fue la palanca más fiable; la memoria explícita no compensó.

DoorKey-8x8: directo → currículo
0,372 → 0,948
Semillas por configuración
3–5
  • Python
  • Gymnasium
  • Stable-Baselines3
  • PPO
  • A2C
  • DQN
  • RecurrentPPO
  • MiniGrid
minigrid · four_rooms · partial_obs

El problema

Mi Trabajo de Fin de Grado estudia cómo se comportan los agentes de aprendizaje por refuerzo cuando no pueden observar el estado completo y qué estrategias de entrenamiento recuperan mejor la información que falta. El trabajo amplía esa pregunta para medir los efectos de la memoria, la motivación intrínseca y el aprendizaje curricular.

Enfoque y decisiones

Un benchmark MiniGrid modular, reproducible y multisemilla compara cuatro algoritmos:

  • PPO y A2C como baselines actor-critic on-policy.
  • DQN como punto de comparación basado en valor.
  • RecurrentPPO para probar memoria explícita bajo observabilidad parcial.

La evaluación varía la observabilidad y la estrategia de entrenamiento con ejecuciones guiadas por configuración y repetibles entre semillas. Así separa la elección del algoritmo de la aportación de la memoria recurrente, las señales de recompensa intrínseca y un currículo por etapas.

Resultados

Tasa de éxito en evaluación, media sobre semillas con intervalo de confianza del 95 % por bootstrap. El agente ve una ventana egocéntrica de 7×7 salvo que se indique lo contrario; 5 semillas por configuración.

PreguntaConfiguraciónÉxitoIC 95 %
CurrículoDoorKey-8x8, escalonado desde 5×50,948[0,90, 0,98]
DoorKey-8x8, entrenado directamente0,372[0,00, 0,76]
ExploraciónMultiRoom-N6, bonus NovelD0,856[0,80, 0,92]
MultiRoom-N6, bonus RND0,028[0,01, 0,04]
MultiRoom-N6, sin bonus, ICM o RIDE0,000[0,00, 0,00]
MemoriaMemoryS13Random, PPO, un solo frame0,540[0,47, 0,61]
MemoryS13Random, RecurrentPPO (LSTM)0,476[0,40, 0,55]
MemoryS13Random, PPO, pila de 4 frames0,440[0,38, 0,49]

Qué dicen las cifras:

  • El currículo fue la palanca más fiable. Escalonar DoorKey de 5×5 a 8×8 alcanzó un 0,948 de éxito; entrenar directamente en 8×8 se quedó en 0,372 de media, con un intervalo de 0,00 a 0,76: que aprenda o no depende de la semilla.
  • Los bonus de exploración no son intercambiables. En MultiRoom-N6 solo NovelD despegó; RND, ICM y RIDE se quedaron en cero o casi, igual que PPO sin bonus. Un currículo por número de habitaciones llegó a 0,892 sin ningún bonus.
  • La memoria explícita no compensó. Ni una LSTM ni apilar frames superaron a PPO con un solo frame en la tarea de memoria con este presupuesto de entrenamiento.
  • Ver más cuadrícula no es tener más señal. Dar a PPO la cuadrícula completa alocéntrica en FourRooms hundió el éxito de 0,653 a 0,007 (3 semillas): pesó más la representación del estado que cuánto de él veía el agente.