Laboratorio

Laboratorio

Todas las visualizaciones interactivas en un sitio. Cada una vive también en la página de su concepto.

Derivada

FundamentalAbrir el concepto →

f′(a)f'(a) es la tasa de cambio instantánea de ff en aa: la pendiente de la recta tangente a la gráfica, definida como el límite de las pendientes de las rectas secantes.

f tangente, pendiente f′(a) secante por a y a + h— Arrastra el punto. Cuando h → 0 la secante se convierte en la tangente: ese límite es la derivada.

Sumas de Riemann

FundamentalAbrir el concepto →

Aproxima el área bajo una curva con nn rectángulos finos, ∑f(xi∗) Δx\sum f(x_i^\ast)\,\Delta x. Cuando n→∞n \to \infty la suma converge a la integral: despacio con la regla izquierda/derecha (O(1/n)O(1/n)), más deprisa con la del punto medio (O(1/n2)O(1/n^2)).

Aumenta n y mira cómo la suma converge al área. Las sumas por la izquierda y la derecha tienen error ∝ 1/n; punto medio y trapecio, ∝ 1/n².

Método de Newton

UniversitarioAbrir el concepto →

Para resolver f(x)=0f(x) = 0, sustituye ff por su recta tangente en la aproximación actual y salta a donde la tangente corta el cero: xk+1=xk−f(xk)/f′(xk)x_{k+1} = x_k - f(x_k)/f'(x_k). Cerca de una raíz simple el número de cifras correctas se duplica en cada paso.

kxkf(xk)|xk − x*|cifras
Pulsa sobre la figura para elegir x₀. Cerca de una raíz simple el número de cifras correctas aproximadamente se duplica en cada paso. Prueba x³ − 2x + 2 desde x₀ = 0 (un ciclo de periodo 2), ∛x (los iterados se duplican y huyen) o arctan x desde |x₀| > 1,4.

Polinomio de Taylor

UniversitarioAbrir el concepto →

El polinomio de grado nn que coincide con ff y sus nn primeras derivadas en un punto aa. Grado 1 es la recta tangente y grado 2 añade la curvatura; cuanto mayor el grado, más amplia la zona en que aproxima bien. En a=0a = 0 se llama polinomio de Maclaurin.

f Tn— La banda sombreada es |x − a| < R. Fuera de ella los polinomios acaban divergiendo por alto que sea el orden; en 1/(1 + x²), por los polos complejos en ±i, invisibles en la recta real.

Descenso de gradiente

UniversitarioAbrir el concepto →

Repetir θ←θ−η ∇L(θ)\theta \leftarrow \theta - \eta\,\nabla L(\theta): dar un paso pequeño en contra del gradiente. Cauchy lo propuso en 1847; hoy (con sus variantes estocásticas y adaptativas) entrena prácticamente todas las redes neuronales.

Pulsa en cualquier punto para soltar la bola ahí. El color es la altura (escala logarítmica) y las líneas son curvas de nivel; el gradiente es perpendicular a ellas. Prueba el valle estrecho con descenso de gradiente simple y después con momento.

Retropropagación (backpropagation)

AvanzadoAbrir el concepto →

El algoritmo que calcula ∂L/∂W\partial L/\partial W y ∂L/∂b\partial L/\partial b para cada capa de una red: una pasada hacia delante guardando los valores intermedios y otra hacia atrás aplicando la regla de la cadena desde la pérdida hasta las entradas. Coste: unas dos veces la pasada hacia delante, sea cual sea el número de parámetros.

x
w
b
→
z = wx + b
→
ŷ = f(z)
→
L = ½(ŷ − y)²∂L/∂L = 1

valor hacia delante ·gradiente ∂L/∂· que fluye hacia atrás

La regla de la cadena, evaluada hacia atrás: ∂L/∂w = (∂L/∂ŷ)·(∂ŷ/∂z)·(∂z/∂w). Para una capa ŷ = f(Wx + b) el mismo cálculo da ∂L/∂W = δ xᵀ y ∂L/∂b = δ con δ = (ŷ − y) ⊙ f′(z). Prueba ReLU con z negativo: el gradiente es cero y la neurona no puede aprender («ReLU muerta»).
↑ ↓ para navegar · ↵ · Esc