12 Probabilidad y estadística
La probabilidad y la estadística son fundamentales en el aprendizaje profundo ya que proporcionan un marco teórico para modelar la incertidumbre inherente a los datos y a los modelos de inferencia, permitiendo la estimación de parámetros, la validación rigurosa de modelos, la evaluación de su rendimiento y la realización de inferencias fundamentadas sobre los fenómenos subyacentes.
12.1 Probabilidad
La probabilidad es una medida numérica que representa la posibilidad o verosimilitud de que ocurra un evento específico dentro de un conjunto de eventos posibles. Siguiendo la escuela frecuentista, es la relación entre el número de resultados favorables (eventos que satisfacen cierta condición) y el número total de resultados posibles en un experimento o situación aleatoria. Se expresa típicamente como un valor en el intervalo \([0, 1]\), donde 0 indica que el evento es imposible de ocurrir y 1 indica que es seguro que ocurra. Valores intermedios representan grados de certeza o incertidumbre en la ocurrencia del evento.
El conjunto de todos los posibles resultados de un experimento estadístico se llama espacio muestral y se representa por \(S\) (Walpole et al. 1993). Es como el “universo” de posibilidades en el que se desarrolla un evento probabilístico. Por ejemplo, si estás lanzando un dado, el espacio muestral sería \(\{1, 2, 3, 4, 5, 6\}\), ya que esos son todos los resultados posibles. Un evento es un subconjunto del espacio muestral que describe un resultado específico o una combinación de resultados que nos interesa analizar en un experimento probabilístico. Puede ser tan simple como un solo resultado o tan complejo como una combinación de múltiples resultados. Por ejemplo, si estás lanzando un dado y te interesa obtener un número par, el evento sería \(\{2, 4, 6\}\). Dos eventos \(A\) y \(B\) son mutuamente excluyentes, o disjuntos, si \(A \cap B = \emptyset\), es decir, si \(A\) y \(B\) no tienen elementos en común. Cada punto muestral de un evento tiene asociado un peso que se define como las veces que puede ocurrir dentro del total de elementos en el espacio muestral.
La probabilidad de un evento \(A\) se define como la suma de los pesos de todas las muestras en \(A\). Por lo tanto, \(0 \leq P(A) \leq 1\), \(P(\emptyset) = 0\), y \(P(S) = 1\). Además, si \(A_1, A_2, A_3, ...\) es una secuencia de eventos mutuamente excluyentes, entonces la probabilidad de que ocurra uno de ellos es \(P(A_1 \cup A_2 \cup A_3 \cup \dots) = P(A_1) + P(A_2) + P(A_3) + \dots\).
A menudo es más fácil calcular la probabilidad de algún evento a partir de las probabilidades conocidas de otros eventos siguiendo algunas reglas. Si A y B son dos eventos, entonces \(P(A \cup B) = P(A) + P(B) - P(A \cap B)\). Si A y B son mutuamente excluyentes, entonces \(P(A \cup B) = P(A) + P(B)\).
12.2 Probabilidad condicional
La probabilidad condicional surge cuando la probabilidad de que ocurra un evento se ve afectada por el conocimiento previo de que otro evento ya ha sucedido. La probabilidad de que un evento \(B\) ocurra, dado que el evento \(A\) ya ha ocurrido, se denota por \(P(B|A)\) y se define como:
$$
P(B|A) = , P(A) > 0$$
Desde una perspectiva conceptual, la probabilidad condicional implica una reducción del espacio muestral original \(S\) al subconjunto \(A\). En este nuevo escenario, solo los resultados contenidos en \(A\) son posibles, por lo que la probabilidad de que ocurra \(B\) se limita a la intersección de ambos eventos, normalizada por la probabilidad del nuevo “universo” de referencia \(A\).
12.2.1 Regla del producto e Independencia
A partir de la definición de probabilidad condicional, se deriva la regla multiplicativa, que permite calcular la probabilidad de que dos eventos ocurran simultáneamente: $$
P(A B) = P(A)P(B|A)$$
Se dice que dos eventos \(A\) y \(B\) son independientes si la ocurrencia de uno no altera la probabilidad de ocurrencia del otro. Matemáticamente, esto se cumple si \(P(B|A) = P(B)\) o \(P(A|B) = P(A)\). Para eventos independientes, la regla del producto se simplifica a: $$
P(A B) = P(A)P(B)$$
12.3 Regla de Bayes
El Teorema de Bayes es una extensión fundamental de la probabilidad condicional que permite “invertir” las probabilidades. Si se desea conocer la probabilidad de que ocurra el evento \(A\) dado que ha ocurrido el evento \(B\), se utiliza la relación:
$$
P(A|B) = $$
Donde \(P(A)\) representa la probabilidad a priori, \(P(B|A)\) es la verosimilitud y \(P(A|B)\) es la probabilidad a posteriori. Este teorema es el pilar de la estadística bayesiana, permitiendo actualizar el grado de creencia en una hipótesis a medida que se incorpora nueva evidencia o datos.
12.4 Variable aleatoria
Una variable aleatoria es aquella variable que puede tomar diferentes valores aleatoriamente y esta es una función que asigna un valor numérico a cada resultado de un experimento aleatorio. Las variables aleatorias se pueden clasificar en dos tipos:
Variables aleatorias continuas: Son variables aleatorias que pueden tomar cualquier valor dentro de un intervalo.
Variables aleatorias discretas: Son variables que pueden tomar valores de un numero finito o infinito numerable.
Para generar en Python un número flotante aleatorio entre 0.0 y 1.0, puedes usar la función random() del módulo random:
import randomnumero_aleatorio = random.random()
print(numero_aleatorio)12.5 Distribución de probabilidad
La distribución de probabilidad es una función que asigna una probabilidad a cada valor posible de una variable aleatoria; es decir, describe como se distribuyen los valores de una variable aleatoria.
12.5.1 Distribución de probabilidad discreta
A la distribución de probabilidad sobre variables aleatorias discretas se le puede describir haciendo uso de una función de masa de probabilidad (PMF, por sus siglas en ingles). Esta función se representa con la letra \(P\) y es la encargada de mapear de un estado de la variable aleatoria a la probabilidad de que esa variable toma en ese estado, la probabilidad de una variable \(x\) es denotada por \(P(x)\). Una PDF debe satisfacer las siguientes condiciones:
El dominio de \(P\) debe ser el conjunto de todos los posible estados de \(x\).
Un evento imposible tiene probabilidad cero y ningun estado puede ser menos probable que eso.
La suma de las probabilidades de todos los estados es igual a uno. Algunos se le refieren como ser normalizada.
12.5.2 Distribución de probabilidad continua
A la distribución de probabilidad sobre variables aleatorias continuas se le puede describir haciendo uso de una función de densidad de probabilidad, \(p\),(PDF, por sus siglas en ingles). Esta función no describe la probabilidad de un estado directamente, sino la probabilidad de que esta caiga en una región infinitesimal con volumen \(\delta x\) es dada por \(p(x)\delta x\). Una PDF debe satisfacer las siguientes condiciones:
El dominio de \(p\) debe ser el conjunto de todos los posible estados de \(x\).
Todos los estados tienen una probabilidad mayor o igual a cero y no en necesario que \(p(x)\) sea menor o igual a uno.
Su integral en todo el rango de valores posibles de la variable aleatoria debe ser igual a uno
Distribución uniforme: Esta distribución asigna una densidad de probabilidad constante a todos los puntos dentro de un intervalo específico \([a, b]\), lo que implica que todos los intervalos de la misma longitud dentro del soporte tienen la misma probabilidad de ocurrir. Fuera de este intervalo, la probabilidad es cero. Se denota comúnmente como \(X \sim U(a, b)\) y su función de densidad de probabilidad está dada por:
$$
p(x; a, b) = \[\begin{cases} \frac{1}{b - a} & a \leq x \leq b \ 0 & x < a \text{ o } x > b \end{cases}\]\end{cases}$$
Esta distribución es fundamental en simulaciones estadísticas y procesos donde no existe una preferencia intrínseca por ningún valor dentro de un rango definido.
Distribución Gaussiana o normal: Es, con diferencia, la distribución de probabilidad más importante en estadística y aprendizaje automático debido al Teorema del límite central. Se caracteriza por su forma de campana simétrica y queda completamente definida por dos parámetros: la media (\(\mu\)), que determina el centro de la distribución, y la varianza (\(\sigma^2\)), que determina la dispersión o ancho de la campana.
La función de densidad de probabilidad para una variable aleatoria continua \(x\) sigue una distribución normal \(X \sim N(\mu, \sigma^2)\) si:
$$
p(x; , ^2) = ( - (x - )^2 )$$
Cuando la media es \(\mu = 0\) y la varianza es \(\sigma^2 = 1\), se denomina Distribución normal estándar. La importancia de la distribución Gaussiana radica en que muchos fenómenos naturales y errores de medición tienden a agruparse en torno a un valor central siguiendo este patrón, lo que la convierte en el modelo por defecto para describir el ruido en sistemas complejos.
12.6 Probabilidad marginal
Algunas veces se conoce la distribución de probabilidad sobre todo el conjunto de estados y necesitamos conocer la distribución de probabilidad solo sobre un subconjunto de estados. A la probabilidad sobre un subconjunto se le conoce como distribución de probabilidad marginal. En otras palabras, la probabilidad marginal es la probabilidad de que ocurra un evento específico, sin tener en cuenta la probabilidad de que ocurran otros eventos en conjunto con él. La probabilidad marginal se puede calcular sumando, o integrando el volumen (según sea el caso), las probabilidades conjuntas de todos los eventos que pueden ocurrir en conjunto con el evento específico.
12.7 Ejercicios
Considerando la fecha actual. Suponga un sistema que es capaz de predecir el año de nacimiento de una persona que máximo tiene 120 años. Describa el espacio muestral del sistema.
Supongamos que en una población, el 7% de las personas tienen influenza. Se sabe que la prueba utilizada para detectarla tiene una tasa de falsos positivos del 2% y una tasa de falsos negativos del 1%. Juan se realiza la prueba y el resultado es positivo. ¿Cuál es la probabilidad de que realmente tenga la enfermedad? Tome en cuenta que lo anterior implica: \(P(\text{Enfermedad}) = 0.07\), \(P(\text{No Enfermedad}) = 0.93\), \(P(\text{Positivo}|\text{No Enfermedad}) = 0.02\) y \(P(\text{Negativo}|\text{Enfermedad}) = 0.01\).
12.8 Regresión lineal
La regresión lineal es una técnica estadística fundamental utilizada para modelar la relación entre una variable dependiente y una o más variables independientes. Su objetivo es encontrar una línea recta, conocida como la línea de mejor ajuste, que minimice la suma de los cuadrados de las diferencias entre los valores observados y los predichos por el modelo. Este método se basa en el supuesto de que la relación entre las variables es lineal y que los errores siguen una distribución normal.