23 Acordeón de redes fundamentales
Definiciones: Forma canónica de la combinación lineal: $$
h = W X + b = w_1 x_2 + w_n x_n + b\[ **Arquitecturas:** Modelo McCulloch & Pitts: \]
C(E,I,u): ^n ^m $$
Perceptron de Rosenblatt: $$
f(X): ^n$$
Neurona artificial moderna: $$
f(X): ^n $$
Cálculo de la neurona artificial: $$
= f(WX+b)$$
Red simple de múltiples salidas: $$
f(X): ^n ^m$$
Red multicapa: $$
= f{(L)}(f{(L-1)}(f^{(1)}(X) ))$$
Cada capa \(i\) se compone de:
- Pesos, $$
w_{m,1} & & w_{m,n}
\end{bmatrix}$$
- Sesgos, $$
B_i = [b_1, , b_n]$$
- Función de activación, \(f_i(H_i=A_{i-1}W_i+B_i)\).
Cantidad de parámetros de un perceptrón: $$
|| = (m + 1) n,$$
donde \(m\) es la cantidad de entradas y \(n\) la cantidad de salidas.
Funciones de activación: Lineal. Para regresión; permite el descenso por gradiente. $$
f_{linear}(h) = h$$
Escalón. Clasificación; se entrena con regla de Rosenblatt. $$
f_{step}(h) = \[\begin{cases} 0 & \text{if } h < 0 \ 1 & \text{if } h \geq 0 \end{cases}\]\end{cases}$$
Sigmoide. Clasificación logística. Permite descenso. $$
f_{sigmoid}(h) = $$
Tangente hiperbólica. Suele funcionar mejor que sigmoide. $$
f_{tanh}(h) = $$
Rectified Linear Unit (ReLU). Agiliza el entrenamiento en redes profundas. $$
f_{relu}(h) = (0,h)$$
Leaky ReLU: Una variante para evitar el problema de las “neuronas muertas” (cuando \(h < 0\)). $$
f_{lrelu}(h) = (h, h) $$