Calculadora de prueba t

Realiza una prueba t de Welch de dos muestras con medias, desviaciones estándar y tamaños muestrales, y obtén al instante el valor p bilateral.

Prueba t de dos muestras independientes
Compara dos medias independientes sin suponer varianzas poblacionales iguales.

Acerca de la prueba t de dos muestras

Una prueba t de dos muestras independientes evalúa si las medias de dos grupos no relacionados difieren más de lo que suele producir la variación del muestreo aleatorio. Esta calculadora utiliza la prueba t de Welch, que no exige varianzas iguales en las dos poblaciones. Trabaja con estadísticos resumidos: media, desviación estándar muestral y tamaño de cada grupo. Es útil cuando no se dispone de observaciones originales, pero sí de resúmenes fiables. El estadístico es la diferencia de medias dividida por su error estándar. En el método de Welch, este error es √(s₁²/n₁ + s₂²/n₂). Un estadístico positivo indica que la primera media es mayor; uno negativo, que la segunda es mayor. Invertir el orden cambia el signo, pero no el valor p bilateral. Su magnitud absoluta expresa la diferencia observada en unidades de error estándar estimado. Los grados de libertad de Welch–Satterthwaite consideran las varianzas y los tamaños de ambos grupos. A menudo son fraccionarios, como cabe esperar. Si coinciden los tamaños y las desviaciones estándar, se reducen a n₁ + n₂ − 2, igual que en la prueba clásica con varianza combinada. Si la variabilidad o los tamaños difieren, el ajuste de Welch suele controlar el error de tipo I de forma más fiable que combinar automáticamente las varianzas. El valor p presentado es bilateral: bajo la hipótesis nula de igualdad de medias poblacionales y los supuestos del modelo, es la probabilidad de obtener un estadístico t al menos tan extremo en cualquiera de las dos direcciones. Un valor p pequeño indica incompatibilidad con el modelo nulo; no mide la probabilidad de que la hipótesis nula sea verdadera. Compáralo con un nivel de significación elegido antes del análisis y no trates un umbral arbitrario como medida de importancia práctica. El procedimiento supone observaciones independientes dentro de cada grupo y entre grupos, un resultado cuantitativo y muestras que representen adecuadamente sus poblaciones. Con muestras pequeñas, la asimetría intensa o los valores atípicos influyentes pueden perjudicar la prueba. Las muestras grandes aportan robustez frente a una no normalidad moderada, pero la independencia y un buen muestreo siguen siendo esenciales. Si las observaciones están emparejadas, como mediciones antes y después en las mismas personas, esta prueba no es adecuada: utiliza una prueba t pareada sobre las diferencias de cada par. La significación estadística debe comunicarse junto con la diferencia real de medias, la incertidumbre y el contexto. Un intervalo de confianza muestra diferencias poblacionales plausibles, y un tamaño del efecto como la d de Cohen ayuda a expresar su magnitud. Esta calculadora ofrece un estadístico de Welch y un valor p precisos para análisis rápidos o comprobaciones aritméticas, pero las decisiones también deben considerar el diseño, las comparaciones múltiples, la calidad de medición y la relevancia de la diferencia en el área de estudio.

Ejemplos de prueba t

Resúmenes de los gruposResultadoInterpretación
G1: 10, DE 2, n 25; G2: 8, DE 2, n 25t = 3.5355; df = 48La misma variabilidad y los mismos tamaños muestrales producen los conocidos grados de libertad enteros.
G1: 5, DE 1, n 10; G2: 4, DE 1, n 10t = 2.2361; df = 18La diferencia observada equivale a unos 2.24 errores estándar.
G1: 20, DE 5, n 12; G2: 20, DE 3, n 18t = 0; p = 1Medias muestrales iguales no aportan evidencia de una diferencia de medias.

Cómo realizar una prueba t de dos muestras

  1. Introduce la media, la desviación estándar muestral y el tamaño de muestra del grupo 1.
  2. Introduce los tres estadísticos correspondientes del grupo independiente 2.
  3. Haz clic en Ejecutar prueba t para calcular el estadístico de Welch, los grados de libertad y el valor p bilateral.
  4. Interpreta el valor p con un alfa preseleccionado y considera la magnitud y dirección de la diferencia de medias.

Preguntas frecuentes sobre la prueba t

¿Por qué se utiliza la prueba t de Welch?

La prueba de Welch sigue siendo válida cuando difieren las varianzas o los tamaños de los grupos. Si son iguales, coincide estrechamente con la prueba de varianza combinada.

¿Qué contrasta el valor p bilateral?

Contrasta una diferencia en cualquier dirección entre medias poblacionales. Incluye resultados al menos tan extremos como el estadístico observado en ambas colas.

¿Por qué los grados de libertad a veces son decimales?

La aproximación de Welch ajusta los grados de libertad según las varianzas y los tamaños desiguales. Los valores fraccionarios son válidos y no deben redondearse antes de calcular el valor p.

¿Sirve para observaciones pareadas?

No. Las observaciones pareadas no son independientes y requieren analizar las diferencias dentro de cada par. Usa una prueba t pareada para mediciones repetidas o sujetos emparejados.

¿Un valor p pequeño implica una diferencia importante?

No. La evidencia estadística y la importancia práctica son conceptos distintos. Revisa la diferencia de medias, un intervalo de confianza y el tamaño del efecto en su contexto.