Regla de la Multiplicación (Probabilidad)

Estadística y Probabilidad

La regla de la multiplicación da la probabilidad de que ocurran dos eventos a la vez, usando la probabilidad condicional para eventos dependientes.

Formula

P(A \text{ and } B) = P(A) \times P(B|A)
Visualization

Definition

La regla de la multiplicación indica la probabilidad de que dos eventos sucedan ambos: para eventos independientes, simplemente multiplica sus probabilidades individuales. Formalmente, $P(A \text{ and } B) = P(A)P(B|A)$; para eventos independientes, $P(B|A) = P(B)$, así que $P(A \text{ and } B) = P(A)P(B)$, mientras que para eventos dependientes debes usar la probabilidad condicional de $B$ dado que $A$ ocurrió. La regla de la cadena de probabilidad generaliza esto: $P(A_1 \cap A_2 \cap \ldots \cap A_n) = P(A_1)P(A_2|A_1)P(A_3|A_1 \cap A_2) \cdots P(A_n|A_1 \cap \ldots \cap A_{n-1})$, que se simplifica al producto de las probabilidades individuales cuando todos los eventos son independientes.

Example

La probabilidad de lanzar cara Y sacar un $3$ (eventos independientes) es $P = 1/2 \times 1/6 = 1/12$. Sacar $2$ ases sin reemplazo: $P(\text{first ace}) = 4/52$, y dado que se sacó el primer as, $P(\text{second ace}) = 3/51$, así que $P(\text{both aces}) = 4/52 \times 3/51 = 1/221$. En las redes bayesianas, la regla de la cadena factoriza la distribución conjunta sobre todas las variables como un producto de distribuciones condicionales, una por variable dado sus padres en el DAG, reduciendo exponencialmente el número de parámetros necesarios para especificar la distribución conjunta completa.

Key Insight

"Y" en probabilidad usualmente significa multiplicar, mientras que "o" usualmente significa sumar (con resta por la superposición); la regla de la multiplicación se extiende naturalmente, $P(A \text{ and } B \text{ and } C) = P(A)P(B|A)P(C|A \text{ and } B)$, simplificándose a $P(A)P(B)P(C)$ para eventos independientes. La regla de la cadena es el fundamento de la factorización de redes bayesianas: una distribución conjunta $P(X_1, \ldots, X_n)$ requiere $O(2^n)$ parámetros en general, pero una red bayesiana con una estructura de padres dispersa necesita solo $O(n \cdot 2^k)$ parámetros, donde $k$ es el número máximo de padres por nodo.