Moda

Estadística y Probabilidad

La moda es el valor que aparece con mayor frecuencia en un conjunto de datos.

Visualization

Definition

La moda es el valor que aparece con más frecuencia en un conjunto de datos; un conjunto de datos puede tener una moda, dos modas (bimodal), o ninguna moda si todos los valores aparecen igual, y para datos cualitativos es la categoría con la frecuencia más alta. Un conjunto de datos puede ser unimodal, bimodal, o multimodal, y si todos los valores tienen la misma frecuencia no hay moda. Formalmente, la moda de una distribución continua es el valor $x^*$ que maximiza la función de densidad de probabilidad ($f'(x^*) = 0$ y $f''(x^*) < 0$); para una muestra, la moda muestral no es un estadístico bien definido para datos continuos, así que la estimación de la moda para distribuciones continuas usa la estimación de densidad por núcleos, con la moda identificada como el pico de la curva de KDE.

Example

Las tallas de zapato en una clase de $7$, $8$, $8$, $9$, $9$, $9$, $10$, $10$ tienen moda $9$ porque aparece $3$ veces, más que cualquier otra talla. Los datos categóricos de una encuesta sobre el género favorito, Acción ($45$), Comedia ($30$), Drama ($45$), Terror ($20$), son bimodales ya que Acción y Drama aparecen ambos $45$ veces. Una distribución normal $N(\mu, \sigma^2)$ es unimodal con moda $= \mu = \text{mean} = \text{median}$, una propiedad especial de las distribuciones simétricas, mientras que una distribución beta $\text{Beta}(\alpha, \beta)$ con $\alpha > 1$ y $\beta > 1$ tiene moda $= (\alpha-1)/(\alpha+\beta-2)$.

Key Insight

La moda es la única medida de centro que funciona para categorías: puedes encontrar el sabor, color, o respuesta más popular, pero no puedes promediarlos, y corresponde al pico o picos de la distribución de frecuencias. En la estadística bayesiana, la moda de la distribución posterior se llama la estimación MAP (máximo a posteriori), que corresponde a la MLE penalizada y es una estimación puntual común cuando la posterior es intratable.