Muestra (Estadística)
Una muestra es un subconjunto de una población seleccionado para su estudio con el fin de sacar conclusiones sobre toda la población.
Definition
Una muestra es un grupo más pequeño elegido de una población más grande para representarla: en lugar de estudiar a todos, se selecciona y estudia un subconjunto para hacer inferencias sobre el total. La calidad de una muestra depende de cómo se seleccione; una muestra aleatoria le da a cada miembro la misma probabilidad de ser elegido y tiende a ser insesgada. Formalmente, una muestra $\{x_1, \ldots, x_n\}$ es una extracción independiente e idénticamente distribuida (i.i.d.) de la distribución poblacional $F(x; \theta)$, y los estadísticos muestrales (por ejemplo, $\bar{x}$, $s^2$) son funciones de la muestra usadas como estimadores de los parámetros poblacionales, juzgados por propiedades como el no sesgo, la consistencia y la eficiencia.
Example
Para averiguar qué merienda prefiere toda la escuela, podrías preguntar a $50$ estudiantes elegidos al azar; esos $50$ estudiantes son tu muestra. En una escuela de $1{,}200$ estudiantes, un investigador podría seleccionar aleatoriamente a $120$ estudiantes ($10\%$) y registrar su tiempo diario de pantalla, usando el tiempo promedio de esos $120$ como estadístico muestral para estimar la media poblacional. La media muestral $\bar{x} = \frac{1}{n}\sum x_i$ es un estimador insesgado de $\mu$: $E[\bar{x}] = \mu$, mientras que la varianza muestral $s^2 = \frac{1}{n-1}\sum (x_i - \bar{x})^2$ usa $n-1$ (la corrección de Bessel) para permanecer insesgada respecto a $\sigma^2$.
Key Insight
Una buena muestra es como una prueba de sabor: una pequeña cucharada puede decirte mucho sobre toda la olla, siempre que primero la revuelvas, o la aleatorices. El tamaño de la muestra también importa: las muestras más grandes dan estimaciones más precisas, pero una muestra grande y sesgada puede ser peor que una pequeña y aleatoria. El teorema del límite central garantiza que $\bar{x}$ se distribuye aproximadamente de forma normal para $n$ grande, sin importar la distribución poblacional, lo cual permite construir intervalos de confianza y pruebas de hipótesis.