¿Qué es?
Entrenar redes muy profundas (CNN, transformers) con retropropagación y SGD adaptativo sobre conjuntos de datos enormes. El cálculo es el mismo que para una neurona; lo que cambió es la escala, la arquitectura (conexiones residuales, normalización, atención) y el hardware.
Fórmulas
- las conexiones residuales mantienen la cadena de jacobianas cerca de la identidad
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
Qué depende de él
Para seguir
Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.