Aprendizaje por refuerzo

Nivel AvanzadoDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

Un agente aprende a actuar maximizando la recompensa descontada esperada. Los métodos de valor iteran el operador de Bellman (una contracción); los de gradiente de política hacen ascenso de gradiente sobre una esperanza. RLHF lo usa para ajustar modelos de lenguaje.

Fórmulas

V(s)=max⁡a(r(s,a)+γ∑s′P(s′∣s,a) V(s′))V(s) = \max_a\Big(r(s,a) + \gamma\sum_{s'}P(s'\mid s,a)\,V(s')\Big)
ecuación de optimalidad de Bellman
∇θJ=𝔼πθ[∇θlog⁡πθ(a∣s) Gt]\nabla_\theta J = \E_{\pi_\theta}\big[\nabla_\theta\log\pi_\theta(a\mid s)\,G_t\big]
teorema del gradiente de política

Las matemáticas que hay detrás

  • Serie geométrica★★★★★fundamental

    Descontar con γ<1\gamma < 1 convierte el retorno infinito en una serie convergente de tipo geométrico.

  • Esperanza★★★★★fundamental

    Los agentes maximizan el retorno descontado esperado; los gradientes de política derivan una esperanza.

  • Iteración de punto fijo★★★★★fundamental

    La iteración de valores converge porque el operador de Bellman es una contracción de razón γ\gamma.

Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.

↑ ↓ para navegar · ↵ · Esc