¿Qué es?
Un agente aprende a actuar maximizando la recompensa descontada esperada. Los métodos de valor iteran el operador de Bellman (una contracción); los de gradiente de política hacen ascenso de gradiente sobre una esperanza. RLHF lo usa para ajustar modelos de lenguaje.
Fórmulas
- ecuación de optimalidad de Bellman
- teorema del gradiente de política
Las matemáticas que hay detrás
Descontar con convierte el retorno infinito en una serie convergente de tipo geométrico.
Los agentes maximizan el retorno descontado esperado; los gradientes de política derivan una esperanza.
La iteración de valores converge porque el operador de Bellman es una contracción de razón .
Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.