Frecuencia Relativa

Estadística y Probabilidad

La frecuencia relativa es la proporción de veces que ocurre un valor en un conjunto de datos, expresada como fracción o porcentaje del total.

Formula

\text{Relative Frequency} = \dfrac{\text{frequency}}{\text{total number of values}}

Definition

La frecuencia relativa es la fracción o porcentaje que indica cuántas veces sucedió algo en comparación con el número total de veces que se observó, la razón entre la frecuencia de un valor o clase y el número total de observaciones: frecuencia relativa $= f_i/n$. Las frecuencias relativas suman $1$, se pueden expresar como porcentajes, y son directamente comparables entre conjuntos de datos de distintos tamaños. Formalmente, $f_i/n$ es la probabilidad empírica de la i-ésima categoría, una estimación no paramétrica de la probabilidad subyacente, y la función de distribución empírica $F_n(x) = \frac{1}{n}\sum \mathbb{1}(X_i \le x)$ converge uniformemente a la verdadera CDF $F(x)$ por el teorema de Glivenko-Cantelli.

Example

Si lanzas una moneda $20$ veces y obtienes cara $12$ veces, la frecuencia relativa de cara es $12/20 = 0.6$, o $60\%$. En una clase de $25$ estudiantes donde $10$ prefieren ciencias, $8$ prefieren matemáticas, y $7$ prefieren inglés, las frecuencias relativas son ciencias $= 10/25 = 0.40$, matemáticas $= 8/25 = 0.32$, e inglés $= 7/25 = 0.28$, sumando $1.00$. La desigualdad de Dvoretzky-Kiefer-Wolfowitz da $P(\sup|F_n(x)-F(x)| > \epsilon) \le 2e^{-2n\epsilon^2}$, proporcionando una banda de confianza para la CDF empírica con garantías explícitas de probabilidad.

Key Insight

La frecuencia relativa es útil al comparar grupos de distinto tamaño: decir que "$60\%$ prefiere la opción A" es más significativo que decir "$30$ de $50$ la prefieren" cuando se compara con un grupo de $200$. Es la estimación empírica de la probabilidad, y por la ley de los grandes números converge a la probabilidad verdadera a medida que $n$ crece; este enfoque sustenta el remuestreo bootstrap, que trata la distribución empírica como una aproximación a la distribución verdadera y remuestrea a partir de ella para estimar la incertidumbre.