23  Acordeón de redes fundamentales

Definiciones: Forma canónica de la combinación lineal: $$

h = W X + b = w_1 x_2 + w_n x_n + b\[ **Arquitecturas:** Modelo McCulloch & Pitts: \]

C(E,I,u): ^n ^m $$

Perceptron de Rosenblatt: $$

f(X): ^n$$

Neurona artificial moderna: $$

f(X): ^n $$

Cálculo de la neurona artificial: $$

= f(WX+b)$$

Red simple de múltiples salidas: $$

f(X): ^n ^m$$

Red multicapa: $$

= f{(L)}(f{(L-1)}(f^{(1)}(X) ))$$

Cada capa \(i\) se compone de:

W_i = \[\begin{bmatrix} w_{1,1} & \dots & w_{1,n} \ \vdots & \ddots & \vdots \ w_{m,1} & \dots & w_{m,n} \ \end{bmatrix}\]

w_{m,1} & & w_{m,n}
\end{bmatrix}$$

B_i = [b_1, , b_n]$$

Cantidad de parámetros de un perceptrón: $$

|| = (m + 1) n,$$

donde \(m\) es la cantidad de entradas y \(n\) la cantidad de salidas.

Funciones de activación: Lineal. Para regresión; permite el descenso por gradiente. $$

f_{linear}(h) = h$$

Escalón. Clasificación; se entrena con regla de Rosenblatt. $$

f_{step}(h) = \[\begin{cases} 0 & \text{if } h < 0 \ 1 & \text{if } h \geq 0 \end{cases}\]

\end{cases}$$

Sigmoide. Clasificación logística. Permite descenso. $$

f_{sigmoid}(h) = $$

Tangente hiperbólica. Suele funcionar mejor que sigmoide. $$

f_{tanh}(h) = $$

Rectified Linear Unit (ReLU). Agiliza el entrenamiento en redes profundas. $$

f_{relu}(h) = (0,h)$$

Leaky ReLU: Una variante para evitar el problema de las “neuronas muertas” (cuando \(h < 0\)). $$

f_{lrelu}(h) = (h, h) $$