La prueba t de Student es una prueba estadística que se utiliza para determinar si la diferencia entre la respuesta de dos grupos es estadísticamente significativa . Se trata de cualquier prueba de hipótesis estadística en la que el estadístico de prueba sigue una distribución t de Student bajo la hipótesis nula . Se aplica con mayor frecuencia cuando el estadístico de prueba seguiría una distribución normal si se conociera el valor de un término de escala en el estadístico de prueba (normalmente, el término de escala es desconocido y, por lo tanto, es un parámetro de perturbación ). Cuando el término de escala se estima a partir de los datos , el estadístico de prueba —bajo ciertas condiciones— sigue una distribución t de Student . La aplicación más común de la prueba t es determinar si las medias de dos poblaciones son significativamente diferentes. En muchos casos, una prueba Z arrojará resultados muy similares a una prueba t, ya que esta última converge a la primera a medida que aumenta el tamaño del conjunto de datos.
Historia

El término " estadístico t " es una abreviatura de "estadístico de prueba de hipótesis". [ 1 ] En estadística, la distribución t fue derivada por primera vez como una distribución posterior en 1876 por Helmert [ 2 ] [ 3 ] [ 4 ] y Lüroth . [ 5 ] [ 6 ] [ 7 ] La distribución t también apareció en una forma más general como distribución de Pearson tipo IV en el artículo de Karl Pearson de 1895. [ 8 ] Sin embargo, la distribución t , también conocida como distribución t de Student , recibe su nombre de William Sealy Gosset , quien la publicó por primera vez en inglés en 1908 en la revista científica Biometrika usando el seudónimo "Student" [ 9 ] porque su empleador prefería que el personal usara nombres de pila al publicar artículos científicos. [ 10 ] Gosset trabajaba en la cervecería Guinness en Dublín , Irlanda , y estaba interesado en los problemas de las muestras pequeñas , por ejemplo, las propiedades químicas de la cebada con tamaños de muestra pequeños. Por lo tanto, una segunda versión de la etimología del término "Student" es que Guinness no quería que sus competidores supieran que estaban utilizando la prueba t para determinar la calidad de la materia prima. Aunque fue William Gosset quien acuñó el término "Student", en realidad fue a través del trabajo de Ronald Fisher que la distribución se hizo conocida como "distribución de Student" [ 11 ] y "prueba t de Student ".
Gosset ideó la prueba t como una forma económica de controlar la calidad de la cerveza negra . El trabajo sobre la prueba t fue presentado y aceptado en la revista Biometrika y publicado en 1908. [ 9 ]
Guinness tenía la política de conceder permisos al personal técnico para estudiar (los llamados "permisos de estudio"), que Gosset utilizó durante los dos primeros trimestres del año académico 1906-1907 en el Laboratorio Biométrico del profesor Karl Pearson en el University College de Londres . [ 12 ] La identidad de Gosset era entonces conocida por sus colegas estadísticos y por el editor jefe Karl Pearson. [ 13 ]
Usos


Prueba t de una muestra
Una prueba t de Student de una muestra es una prueba de localización para determinar si la media de una población tiene un valor especificado en una hipótesis nula . Al probar la hipótesis nula de que la media poblacional es igual a un valor especificado μ 0 , se utiliza el estadístico
dóndees la media muestral, s es la desviación estándar muestral y n es el tamaño de la muestra. Los grados de libertad utilizados en esta prueba son n − 1. Aunque la población original no necesita tener una distribución normal, la distribución de la población de medias muestrales sí la tiene.Se supone que es normal.
Según el teorema del límite central , si las observaciones son independientes y existe el segundo momento, entoncesserá aproximadamente normalEsto es solo una aproximación, ya que el teorema del límite central se aplicaría a t si s fuera la desviación estándar real de x , mientras que se trata de la desviación estándar muestral , dado que la desviación estándar real generalmente no se conoce. Por lo tanto, t sigue asintóticamente una distribución t de Student.
Pruebas t de dos muestras


Una prueba de localización de dos muestras para la hipótesis nula de que las medias de dos poblaciones son iguales. Todas estas pruebas se denominan habitualmente pruebas t de Student , aunque, estrictamente hablando, este nombre solo debería utilizarse si también se asume que las varianzas de las dos poblaciones son iguales; la forma de la prueba que se utiliza cuando se omite este supuesto se denomina a veces prueba t de Welch . Estas pruebas suelen denominarse pruebas t para muestras independientes o no pareadas , ya que se aplican normalmente cuando las unidades estadísticas subyacentes a las dos muestras que se comparan no se solapan. [ 14 ]
Las pruebas t de dos muestras para una diferencia en las medias involucran muestras independientes (muestras no pareadas) o muestras pareadas . Las pruebas t pareadas son una forma de bloqueo y tienen mayor potencia (probabilidad de evitar un error de tipo II, también conocido como falso negativo) que las pruebas no pareadas cuando las unidades pareadas son similares con respecto a "factores de ruido" (ver factor de confusión ) que son independientes de la pertenencia a los dos grupos que se comparan. [ 15 ] En un contexto diferente, las pruebas t pareadas pueden usarse para reducir los efectos de los factores de confusión en un estudio observacional .
Muestras independientes (no emparejadas)
La prueba t para muestras independientes se utiliza cuando se obtienen dos conjuntos separados de muestras independientes e idénticamente distribuidas , y se compara una variable de cada una de las dos poblaciones. Por ejemplo, supongamos que estamos evaluando el efecto de un tratamiento médico y reclutamos a 100 sujetos para nuestro estudio, luego asignamos aleatoriamente 50 sujetos al grupo de tratamiento y 50 sujetos al grupo de control. En este caso, tenemos dos muestras independientes y usaríamos la forma no pareada de la prueba t .
Muestras pareadas
Las pruebas t para muestras pareadas suelen consistir en una muestra de pares coincidentes de unidades similares , o en un grupo de unidades que se ha analizado dos veces (una prueba t de "medidas repetidas").
Un ejemplo típico de la prueba t de medidas repetidas sería cuando se examina a los sujetos antes de un tratamiento, por ejemplo, para la hipertensión, y se les vuelve a examinar después del tratamiento con un medicamento antihipertensivo. Al comparar los valores del mismo paciente antes y después del tratamiento, se utiliza a cada paciente como su propio control. De esta forma, el rechazo correcto de la hipótesis nula (en este caso, de que el tratamiento no produce ningún efecto) se vuelve mucho más probable, ya que la potencia estadística aumenta simplemente porque se elimina la variación aleatoria entre pacientes. Sin embargo, un aumento de la potencia estadística tiene un precio: se requieren más exámenes, y cada sujeto debe ser examinado dos veces.
Debido a que la mitad de la muestra ahora depende de la otra mitad, la versión pareada de la prueba t de Student tiene solo n / 2 − 1 grados de libertad (donde n es el número total de observaciones). Los pares se convierten en unidades de prueba individuales, y la muestra debe duplicarse para lograr el mismo número de grados de libertad. Normalmente, hay n − 1 grados de libertad (donde n es el número total de observaciones). [ 16 ]
Una prueba t de muestras pareadas basada en una "muestra de pares emparejados" se obtiene a partir de una muestra no pareada que posteriormente se utiliza para formar una muestra pareada, empleando variables adicionales medidas junto con la variable de interés. [ 17 ] El emparejamiento se realiza identificando pares de valores que consisten en una observación de cada una de las dos muestras, donde el par es similar en términos de otras variables medidas. Este enfoque se utiliza a veces en estudios observacionales para reducir o eliminar los efectos de los factores de confusión.
Las pruebas t para muestras pareadas a menudo se denominan " pruebas t para muestras dependientes ".
Supuestos
La mayoría de las estadísticas de prueba tienen la forma t = Z / s , donde Z y s son funciones de los datos.
Z puede ser sensible a la hipótesis alternativa (es decir, su magnitud tiende a ser mayor cuando la hipótesis alternativa es verdadera), mientras que s es un parámetro de escala que permite determinarla distribución de t .
Como ejemplo, en la prueba t de una muestra
dóndees la media muestral de una muestra X 1 , X 2 , …, X n , de tamaño n , s es el error estándar de la media ,es la estimación de la desviación estándar de la población, y μ es la media poblacional .
Los supuestos subyacentes a una prueba t en la forma más simple descrita anteriormente son los siguientes:
- X sigue una distribución normal con media μ y varianza σ 2 / n .
- s 2 ( n − 1)/ σ 2 sigue una distribución χ 2 con n − 1 grados de libertad . Este supuesto se cumple cuando las observaciones utilizadas para estimar s 2 provienen de una distribución normal (e i.i.d. para cada grupo).
- Z y s son independientes .
En la prueba t que compara las medias de dos muestras independientes, se deben cumplir los siguientes supuestos:
- Las medias de las dos poblaciones que se comparan deberían seguir aproximadamente distribuciones normales . Bajo supuestos débiles, esto se deduce en muestras grandes del teorema del límite central , incluso cuando la distribución de las observaciones en cada grupo no es normal. [ 18 ]
- Si se utiliza la definición original de Student para la prueba t , las dos poblaciones que se comparan deben tener la misma varianza (que se puede comprobar mediante la prueba F , la prueba de Levene , la prueba de Bartlett o la prueba de Brown-Forsythe ; o evaluar gráficamente mediante un gráfico Q-Q ). Si los tamaños de muestra en los dos grupos que se comparan son iguales, la prueba t original de Student es muy robusta ante la presencia de varianzas desiguales. [ 19 ] La prueba t de Welch es insensible a la igualdad de las varianzas, independientemente de si los tamaños de muestra son similares.
- Los datos utilizados para realizar la prueba deben muestrearse de forma independiente de las dos poblaciones que se comparan o estar completamente emparejados. En general, esto no se puede comprobar a partir de los datos, pero si se sabe que los datos son dependientes (por ejemplo, emparejados por diseño de la prueba), se debe aplicar una prueba dependiente. Para datos parcialmente emparejados, las pruebas t independientes clásicas pueden dar resultados inválidos, ya que el estadístico de prueba podría no seguir una distribución t , mientras que la prueba t dependiente es subóptima, ya que descarta los datos no emparejados. [ 20 ]
La mayoría de las pruebas t de dos muestras son robustas, salvo ante grandes desviaciones de los supuestos. [ 21 ]
Para mayor exactitud , la prueba t y la prueba Z requieren la normalidad de las medias muestrales, y la prueba t requiere además que la varianza muestral siga una distribución χ² escalada , y que la media y la varianza muestrales sean estadísticamente independientes . La normalidad de los valores de datos individuales no es necesaria si se cumplen estas condiciones. Según el teorema del límite central , las medias muestrales de muestras moderadamente grandes suelen aproximarse bien mediante una distribución normal, incluso si los datos no siguen una distribución normal. Sin embargo, el tamaño de la muestra necesario para que las medias muestrales converjan a la normalidad depende de la asimetría de la distribución de los datos originales. La muestra puede variar de 30 a 100 o más valores, dependiendo de la asimetría. [ 22 ] [ 23 ]
Para datos no normales, la distribución de la varianza de la muestra puede desviarse sustancialmente de una distribución χ² .
Sin embargo, si el tamaño de la muestra es grande, el teorema de Slutsky implica que la distribución de la varianza de la muestra tiene poco efecto sobre la distribución del estadístico de prueba. Es decir, a medida que el tamaño de la muestra aumentaaumenta:
- según el teorema del límite central ,
- según la ley de los grandes números ,
- .
Cálculos
A continuación se presentan expresiones explícitas que pueden utilizarse para realizar diversas pruebas t . En cada caso, se proporciona la fórmula para un estadístico de prueba que sigue o se aproxima a una distribución t bajo la hipótesis nula. Asimismo, se indican los grados de libertad correspondientes . Cada uno de estos estadísticos puede utilizarse para realizar una prueba unilateral o bilateral .
Una vez determinados el valor t y los grados de libertad, se puede calcular un valor p utilizando una tabla de valores de la distribución t de Student . Si el valor p calculado es inferior al umbral de significación estadística (generalmente 0,10, 0,05 o 0,01), se rechaza la hipótesis nula en favor de la hipótesis alternativa.
Pendiente de una línea de regresión
Supongamos que uno está ajustando el modelo.
donde x es conocido, α y β son desconocidos, ε es una variable aleatoria con distribución normal, media 0 y varianza desconocida σ² , e Y es el resultado de interés. Queremos contrastar la hipótesis nula de que la pendiente β es igual a un valor específico β₀ ( que suele considerarse 0, en cuyo caso la hipótesis nula es que x e y no están correlacionadas).
Dejar
Entonces
tiene una distribución t con n − 2 grados de libertad si la hipótesis nula es verdadera. El error estándar del coeficiente de pendiente es:
puede escribirse en términos de los residuos. Sea
Entonces, la puntuación t viene dada por
Otra forma de determinar la puntuación t es
donde r es el coeficiente de correlación de Pearson .
La puntuación t , intersección, se puede determinar a partir de la puntuación t , pendiente :
donde s x 2 es la varianza de la muestra.
Prueba t de Student para dos muestras independientes
Tamaños de muestra y varianza iguales
Dados dos grupos (1, 2), esta prueba solo es aplicable cuando:
- Los dos tamaños de muestra son iguales,
- Se puede suponer que las dos distribuciones tienen la misma varianza.
Las violaciones de estos supuestos se analizan a continuación.
El estadístico t para comprobar si las medias son diferentes se puede calcular de la siguiente manera:
dónde
Aquí, s p es la desviación estándar combinada para n = n 1 = n 2 , y s 2 X 1 y s 2 X 2 son los estimadores insesgados de la varianza poblacional. El denominador de t es el error estándar de la diferencia entre dos medias.
Para las pruebas de significancia, los grados de libertad para esta prueba son 2 n − 2 , donde n es el tamaño de la muestra.
Tamaños de muestra iguales o desiguales, varianzas similares ( 1 / 2 < s X 1 / s X 2 < 2 )
Esta prueba se utiliza únicamente cuando se puede suponer que las dos distribuciones tienen la misma varianza (cuando se incumple esta suposición, véase más adelante). Las fórmulas anteriores son un caso especial de las fórmulas que aparecen a continuación; se recuperan cuando ambas muestras tienen el mismo tamaño: n = n 1 = n 2 .
El estadístico t para comprobar si las medias son diferentes se puede calcular de la siguiente manera:
dónde
es la desviación estándar combinada de las dos muestras: se define de esta manera para que su cuadrado sea un estimador insesgado de la varianza común, independientemente de si las medias poblacionales son iguales o no. En estas fórmulas, n i − 1 es el número de grados de libertad para cada grupo, y el tamaño total de la muestra menos dos (es decir, n 1 + n 2 − 2 ) es el número total de grados de libertad, que se utiliza en las pruebas de significancia.
El efecto mínimo detectable (EMD) es: [ 24 ]
Tamaños de muestra iguales o desiguales, varianzas desiguales ( s X 1 > 2 s X 2 o s X 2 > 2 s X 1 )
Esta prueba, también conocida como prueba t de Welch , se utiliza únicamente cuando no se asume que las varianzas de las dos poblaciones sean iguales (los tamaños de las dos muestras pueden ser iguales o no) y, por lo tanto, deben estimarse por separado. El estadístico t para probar si las medias poblacionales son diferentes se calcula como
dónde
Aquí s i 2 es el estimador insesgado de la varianza de cada una de las dos muestras con n i = número de participantes en el grupo i ( i = 1 o 2). En este caso no es una varianza combinada. Para su uso en pruebas de significancia, la distribución del estadístico de prueba se aproxima como una distribución t de Student ordinaria con los grados de libertad calculados utilizando
Esto se conoce como la ecuación de Welch-Satterthwaite . La distribución real del estadístico de prueba depende (ligeramente) de las dos varianzas poblacionales desconocidas (véase el problema de Behrens-Fisher ).
Método exacto para varianzas y tamaños de muestra desiguales
La prueba [ 25 ] aborda el famoso problema de Behrens-Fisher , es decir, comparar la diferencia entre las medias de dos poblaciones con distribución normal cuando no se supone que las varianzas de las dos poblaciones sean iguales, basándose en dos muestras independientes.
La prueba se desarrolla como una prueba exacta que permite tamaños de muestra desiguales y varianzas desiguales de dos poblaciones. La propiedad exacta se mantiene incluso con tamaños de muestra extremadamente pequeños y desequilibrados (por ejemplovs.).
La estadística para comprobar si las medias son diferentes se puede calcular de la siguiente manera:
Dejarysean los vectores de muestra i.i.d. (para) deypor separado.
Dejarfrijolmatriz ortogonal cuyos elementos de la primera fila son todosDe manera similar, dejemosSé el primerofilas de unmatriz ortogonal (cuyos elementos de la primera fila son todos).
Entonceses un vector aleatorio normal n -dimensional:
De la distribución anterior vemos que el primer elemento del vector Z es
por lo tanto el primer elemento se distribuye como
y los cuadrados de los elementos restantes de Z se distribuyen según una distribución chi-cuadrado.
y mediante la construcción de las matrices ortogonales P y Q tenemos
por lo tanto , Z 1 , el primer elemento de Z , es estadísticamente independiente de los elementos restantes por ortogonalidad. Finalmente, tomemos para el estadístico de prueba
Prueba t dependiente para muestras pareadas
Esta prueba se utiliza cuando las muestras son dependientes; es decir, cuando hay una sola muestra que se ha analizado dos veces (medidas repetidas) o cuando hay dos muestras que se han emparejado. Este es un ejemplo de una prueba de diferencia pareada . El estadístico t se calcula como
dóndeyson la media y la desviación estándar de las diferencias entre todos los pares. Los pares son, por ejemplo, las puntuaciones de una persona antes y después de la prueba, o bien pares de personas agrupadas de forma significativa (por ejemplo, de la misma familia o grupo de edad: véase la tabla). La constante μ₀ es cero si queremos comprobar si la media de la diferencia es significativamente diferente. El grado de libertad utilizado es n − 1 , donde n representa el número de pares.
Ejemplos resueltos
Sea A 1 un conjunto obtenido al extraer una muestra aleatoria de seis mediciones:
y sea A 2 un segundo conjunto obtenido de manera similar:
Podrían ser, por ejemplo, los pesos de tornillos fabricados por dos máquinas diferentes.
Realizaremos pruebas de la hipótesis nula de que las medias de las poblaciones de las que se tomaron las dos muestras son iguales.
La diferencia entre las dos medias muestrales, cada una denotada por X i , que aparece en el numerador para todos los enfoques de prueba de dos muestras discutidos anteriormente, es
Las desviaciones estándar muestrales para las dos muestras son aproximadamente 0,05 y 0,11, respectivamente. Para muestras tan pequeñas, una prueba de igualdad entre las varianzas poblacionales no sería muy potente. Dado que los tamaños de muestra son iguales, las dos versiones de la prueba t de Student para dos muestras tendrán un rendimiento similar en este ejemplo.
Varianzas desiguales
Si se sigue el enfoque para varianzas desiguales (discutido anteriormente), los resultados son:
y los grados de libertad
El estadístico de prueba es aproximadamente 1,959, lo que da un valor p de prueba bilateral de 0,09077.
Varianzas iguales
Si se sigue el enfoque para varianzas iguales (discutido anteriormente), los resultados son
y los grados de libertad
El estadístico de prueba es aproximadamente igual a 1,959, lo que da un valor p bilateral de 0,07857.
Pruebas estadísticas relacionadas
Alternativas a la prueba t para problemas de localización
La prueba t proporciona una prueba exacta para la igualdad de las medias de dos poblaciones normales i.i.d. con varianzas desconocidas, pero iguales. ( La prueba t de Welch es una prueba casi exacta para el caso en que los datos son normales pero las varianzas pueden diferir). Para muestras moderadamente grandes y una prueba unilateral, la prueba t es relativamente robusta ante violaciones moderadas del supuesto de normalidad. [ 26 ] En muestras suficientemente grandes, la prueba t se aproxima asintóticamente a la prueba z y se vuelve robusta incluso ante grandes desviaciones de la normalidad. [ 18 ]
Si los datos no siguen una distribución normal de forma significativa y el tamaño de la muestra es pequeño, la prueba t puede arrojar resultados engañosos. Consulte la prueba de localización para distribuciones de mezcla de escala gaussiana para obtener información teórica relacionada con una familia particular de distribuciones no normales.
Cuando no se cumple el supuesto de normalidad, una alternativa no paramétrica a la prueba t puede tener mayor potencia estadística . Sin embargo, cuando los datos no son normales con varianzas diferentes entre grupos, una prueba t puede tener un mejor control del error de tipo 1 que algunas alternativas no paramétricas. [ 27 ] Además, los métodos no paramétricos, como la prueba U de Mann-Whitney que se analiza más adelante, generalmente no prueban una diferencia de medias, por lo que deben usarse con precaución si una diferencia de medias es de interés científico primordial. [ 18 ] Por ejemplo, la prueba U de Mann-Whitney mantendrá el error de tipo 1 en el nivel alfa deseado si ambos grupos tienen la misma distribución. También tendrá potencia para detectar una alternativa por la cual el grupo B tiene la misma distribución que A pero después de algún desplazamiento por una constante (en cuyo caso sí habría una diferencia en las medias de los dos grupos). Sin embargo, podría haber casos en los que los grupos A y B tengan distribuciones diferentes pero con la misma media (por ejemplo, dos distribuciones, una con asimetría positiva y la otra con asimetría negativa, pero desplazadas de tal manera que tengan la misma media). En tales casos, MW podría tener una potencia superior al nivel alfa para rechazar la hipótesis nula, pero atribuir la interpretación de la diferencia de medias a dicho resultado sería incorrecto.
En presencia de un valor atípico , la prueba t no es robusta. Por ejemplo, para dos muestras independientes cuando las distribuciones de datos son asimétricas (es decir, las distribuciones están sesgadas ) o las distribuciones tienen colas grandes, entonces la prueba de suma de rangos de Wilcoxon (también conocida como prueba U de Mann-Whitney ) puede tener una potencia de tres a cuatro veces mayor que la prueba t . [ 26 ] [ 28 ] [ 29 ] La contraparte no paramétrica de la prueba t para muestras pareadas es la prueba de rangos con signo de Wilcoxon para muestras pareadas. Para una discusión sobre la elección entre la prueba t y las alternativas no paramétricas, véase Lumley, et al. (2002). [ 18 ]
El análisis de varianza unidireccional (ANOVA) generaliza la prueba t de dos muestras cuando los datos pertenecen a más de dos grupos.
Un diseño que incluye tanto observaciones pareadas como observaciones independientes.
Cuando en el diseño de dos muestras se presentan tanto observaciones pareadas como independientes, suponiendo que los datos faltan completamente al azar (MCAR), las observaciones pareadas o independientes pueden descartarse para proceder con las pruebas estándar mencionadas anteriormente. Alternativamente, utilizando todos los datos disponibles, suponiendo normalidad y MCAR, se podría emplear la prueba t generalizada para muestras parcialmente superpuestas. [ 30 ]
Pruebas multivariadas
Una generalización del estadístico t de Student , denominado estadístico t al cuadrado de Hotelling , permite contrastar hipótesis sobre múltiples medidas (a menudo correlacionadas) dentro de la misma muestra. Por ejemplo, un investigador podría someter a varios sujetos a una prueba de personalidad que consta de múltiples escalas de personalidad (por ejemplo, el Inventario Multifásico de Personalidad de Minnesota ). Dado que las medidas de este tipo suelen estar correlacionadas positivamente, no es recomendable realizar pruebas t univariadas separadas para contrastar hipótesis, ya que estas ignorarían la covarianza entre las medidas e incrementarían la probabilidad de rechazar erróneamente al menos una hipótesis ( error de tipo I ). En este caso, es preferible una única prueba multivariada para contrastar hipótesis. El método de Fisher para combinar múltiples pruebas con alfa reducido para la correlación positiva entre las pruebas es una opción. Otra opción es el estadístico T² de Hotelling, que sigue una distribución T² . Sin embargo, en la práctica , esta distribución rara vez se utiliza, ya que los valores tabulados para T² son difíciles de encontrar. Por lo general, T² se convierte en un estadístico F.
Para una prueba multivariante de una muestra, la hipótesis es que el vector de medias ( μ ) es igual a un vector dado ( μ₀ ) . El estadístico de prueba es la t de Hotelling² :
donde n es el tamaño de la muestra, x es el vector de medias de columna y S es una matriz de covarianza muestral m × m .
Para una prueba multivariante de dos muestras, la hipótesis es que los vectores de medias ( μ₁ , μ₂ ) de dos muestras son iguales. El estadístico de prueba es la t de dos muestras de Hotelling :
La prueba t de dos muestras es un caso especial de regresión lineal simple.
La prueba t de dos muestras es un caso especial de regresión lineal simple [ 31 ] [ 32 ] [ 33 ] [ 34 ] [ 35 ] [ 36 ] . Esta relación se ilustra con el siguiente ejemplo.
En un ensayo clínico se examina a 6 pacientes a quienes se les administra un fármaco o un placebo. Tres (3) pacientes reciben 0 unidades del fármaco (grupo placebo). Tres (3) pacientes reciben 1 unidad del fármaco (grupo de tratamiento activo). Al finalizar el tratamiento, los investigadores miden el cambio con respecto al valor inicial en la cantidad de palabras que cada paciente puede recordar en una prueba de memoria.
![]()
A continuación se muestra una tabla con los valores de recuerdo de palabras y dosis de medicamentos de los pacientes.
Se proporcionan datos y código para el análisis utilizando el lenguaje de programación R con las t.testfunciones lmpara la prueba t y la regresión lineal. Aquí se muestran los mismos datos (ficticios) generados en R.
> word.recall.data = data.frame ( drug.dose = c ( 0 , 0 , 0 , 1 , 1 , 1 ), word.recall = c ( 1 , 2 , 3 , 5 , 6 , 7 ))Realice la prueba t . Tenga en cuenta que se requiere el supuesto de varianza igual, var.equal=T, para que el análisis sea exactamente equivalente a una regresión lineal simple.
> con ( word.recall.data , t.test ( word.recall ~ drug.dose , var.equal = T ))Al ejecutar el código R se obtienen los siguientes resultados.
- El valor medio de recuerdo de palabras en el grupo de dosis de fármaco 0 es 2.
- El valor medio de recuerdo de palabras en el grupo de 1 fármaco y dosis es de 6.
- La diferencia entre los grupos de tratamiento en el recuerdo medio de palabras es 6 – 2 = 4.
- La diferencia en el recuerdo de palabras entre las dosis del fármaco es significativa (p=0,00805).
Realice una regresión lineal con los mismos datos. Los cálculos pueden realizarse utilizando la función de R lm()para un modelo lineal.
> word.recall.data.lm = lm ( word.recall ~ drug.dose , data = word.recall.data ) > summary ( word.recall.data.lm )La regresión lineal proporciona una tabla de coeficientes y valores p.
La tabla de coeficientes arroja los siguientes resultados.
- El valor estimado de 2 para la intersección es el valor medio del recuerdo de la palabra cuando la dosis del fármaco es 0.
- El valor estimado de 4 para la dosis del fármaco indica que, por cada unidad de cambio en la dosis (de 0 a 1), se produce un cambio de 4 unidades en el recuerdo medio de palabras (de 2 a 6). Esta es la pendiente de la línea que une las medias de los dos grupos.
- El valor p de que la pendiente de 4 sea diferente de 0 es p = 0,00805.
Los coeficientes de la regresión lineal especifican la pendiente y la intersección de la línea que une las medias de los dos grupos, como se muestra en el gráfico. La intersección es 2 y la pendiente es 4.

Compare el resultado de la regresión lineal con el resultado de la prueba t .
- Según la prueba t , la diferencia entre las medias de los grupos es 6-2=4.
- Según la regresión, la pendiente también es 4, lo que indica que un cambio de 1 unidad en la dosis del fármaco (de 0 a 1) produce un cambio de 4 unidades en el recuerdo medio de palabras (de 2 a 6).
- El valor p de la prueba t para la diferencia de medias y el valor p de la regresión para la pendiente son ambos 0,00805. Los métodos dan resultados idénticos.
Este ejemplo muestra que, en el caso particular de una regresión lineal simple con una única variable x que toma los valores 0 y 1, la prueba t arroja los mismos resultados que la regresión lineal. Esta relación también puede demostrarse algebraicamente.
Reconocer esta relación entre la prueba t y la regresión lineal facilita el uso de la regresión lineal múltiple y el análisis de varianza multivariado . Estas alternativas a las pruebas t permiten la inclusión de variables explicativas adicionales asociadas con la respuesta. Incluir dichas variables explicativas adicionales mediante regresión o ANOVA reduce la varianza que de otro modo no se explicaría y, por lo general, proporciona mayor potencia para detectar diferencias que las pruebas t de dos muestras . [ 37 ]
Potencia y tamaño de la muestra para las pruebas t
La potencia de una prueba es la probabilidad de que la prueba rechace la hipótesis nula cuando la hipótesis alternativa es verdadera.
El cálculo de potencia para una prueba t de dos muestras requiere la siguiente información. [ 38 ]
- La diferencia entre las medias de los dos grupos
- La desviación estándar intragrupal (si los dos grupos tienen la misma desviación estándar)
- El tamaño de la muestra (número de sujetos) en cada grupo
- El valor p (alfa) requerido para la significancia
Para calcular la potencia estadística, puede ser útil calcular el tamaño del efecto estandarizado, que es la diferencia entre las dos medias dividida por la desviación estándar intragrupal. Por ejemplo, supongamos que la media del grupo A es 14 y la del grupo B es 10, y que la desviación estándar intragrupal es de 8 unidades (suponiendo que ambos grupos tienen la misma desviación estándar). Entonces, la diferencia entre las medias de los grupos es 14-10 = 4 unidades, y el tamaño del efecto estandarizado es (14-10)/8 = 4/8 = 0,5.
El gráfico a continuación muestra la potencia estadística para tamaños del efecto estandarizados de 0,1 a 1, con tamaños de muestra por grupo de 10 a 50, suponiendo un número igual de sujetos por grupo. N por grupo representa el número de observaciones en cada grupo. Por ejemplo, para un tamaño del efecto estandarizado de 0,5, un tamaño de muestra de N = 10 por grupo proporciona una potencia ligeramente inferior a 0,2, mientras que un tamaño de muestra de N = 50 por grupo proporciona una potencia de aproximadamente 0,7.

Existen calculadoras para el cálculo de la potencia estadística y el tamaño de la muestra en numerosos sitios web, como los siguientes.
Calculadora de tamaño de muestra
Calculadora de tamaño de muestra para comparar dos medias independientes
En estos sitios web se describen paquetes de software gratuitos para el cálculo de la potencia y el tamaño de la muestra.
Análisis de potencia para la prueba t de muestras independientes de dos grupos | Ejemplos de análisis de datos en R
G*Power
PD
Los paquetes de software comerciales, como los siguientes, ofrecen potencia y tamaño de muestra para pruebas t y muchas otras pruebas estadísticas.
Software para el cálculo del tamaño de la muestra | Software de análisis de potencia | PASS | NCSS.com
Optimice los diseños de ensayos clínicos con nQuery.
IBM SPSS Statistics
Características de potencia y tamaño de muestra en Stata
¿Qué análisis de potencia y tamaño de muestra incluye Minitab?
Implementaciones de software
Muchos programas de hojas de cálculo y paquetes estadísticos, como QtiPlot , LibreOffice Calc , Microsoft Excel , SAS , SPSS , Stata , DAP , gretl , R , Python , PSPP , Wolfram Mathematica , MATLAB y Minitab , incluyen implementaciones de la prueba t de Student .
Véase también
- Modelo de cambio condicional
- Prueba de equivalencia : herramienta utilizada para extraer inferencias estadísticas a partir de datos observados.
- Prueba F – Prueba de hipótesis estadística
- Distribución t no central en el análisis de potencia – Distribución de probabilidad
- Estadístico t de Student – Razón en estadística Páginas que muestran descripciones breves de destinos de redireccionamiento
- Prueba Z – Prueba estadística
- Prueba U de Mann-Whitney : prueba no paramétrica de la hipótesis nula.
- Corrección de Šidák para la prueba t – Método estadístico
- Prueba t de Welch : prueba estadística para determinar si dos poblaciones tienen medias iguales.
- Análisis de varianza – Recopilación de modelos estadísticos (ANOVA)
- Distribución t – Distribución de probabilidad
- Intervalos de confianza para la media de una distribución normal (también aquí )
Referencias
- ↑ El microbioma en la salud y la enfermedad . Academic Press. 29 de mayo de 2020. pág. 397. ISBN 978-0-12-820001-8.
- ↑ Szabó, István (2003). "Systeme aus einer endlichen Anzahl protagonizada por Körper". Einführung in die Technische Mechanik (en alemán). Springer Berlín Heidelberg. págs. 196-199 . doi : 10.1007/978-3-642-61925-0_16 (inactivo el 12 de julio de 2025). ISBN 978-3-540-13293-6.
{{cite book}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace ) - ^ Schlyvitch, B. (octubre de 1937). "Untersuchungen über den anastomotischen Kanal zwischen der Arteria coeliaca und mesenterica superior und damit in Zusammenhang stehende Fragen". Zeitschrift für Anatomie und Entwicklungsgeschichte (en alemán). 107 (6): 709– 737. doi : 10.1007/bf02118337 . ISSN 0340-2061 . S2CID 27311567 .
- ↑ Helmert (1876). "Die Genauigkeit der Formel von Peters zur Berechnung des wahrscheinlichen Beobachtungsfehlers director Beobachtungen gleicher Genauigkeit" . Astronomische Nachrichten (en alemán). 88 ( 8– 9): 113– 131. Bibcode : 1876AN.....88..113H . doi : 10.1002/asna.18760880802 .
- ^ Lüroth, J. (1876). "Vergleichung von zwei Werthen des wahrscheinlichen Fehlers" . Astronomische Nachrichten (en alemán). 87 (14): 209– 220. Bibcode : 1876AN.....87..209L . doi : 10.1002/asna.18760871402 .
- ↑ Pfanzagl, J. (1996). "Estudios sobre la historia de la probabilidad y la estadística XLIV. Un precursor de la distribución t ". Biometrika . 83 (4): 891– 898. doi : 10.1093/biomet/83.4.891 . MR 1766040 .
- ↑ Sheynin, Oscar (1995). "El trabajo de Helmert en la teoría de los errores". Archivo de Historia de las Ciencias Exactas . 49 (1): 73– 104. doi : 10.1007/BF00374700 . ISSN 0003-9519 . S2CID 121241599 .
- ↑ Pearson, Karl (1895). "X. Contribuciones a la teoría matemática de la evolución.—II. Variación asimétrica en material homogéneo" . Philosophical Transactions of the Royal Society of London A. 186 : 343–414 . Bibcode : 1895RSPTA.186..343P . doi : 10.1098 /rsta.1895.0010 .
- 1 2 Estudiante (1908). "El error probable de una media" (PDF) . Biometrika . 6 (1): 1– 25. doi : 10.1093/biomet/6.1.1 . hdl : 10338.dmlcz/143545 . Recuperado el 24 de julio de 2016 .
- ↑ Wendl, Michael C. (2016). "Fama pseudónima". Science . 351 (6280): 1406. doi : 10.1126/science.351.6280.1406 . PMID 27013722 .
- ↑ Walpole, Ronald E. (2006). Probabilidad y estadística para ingenieros y científicos . Myers, H. Raymond (7.ª ed.). Nueva Delhi: Pearson. ISBN 81-7758-404-9OCLC 818811849
- ↑ Raju, TN (2005). "William Sealy Gosset y William A. Silverman: Dos 'estudiantes' de ciencia". Pediatrics . 116 ( 3): 732– 735. doi : 10.1542/peds.2005-1134 . PMID 16140715. S2CID 32745754 .
- ↑ Dodge, Yadolah (2008). Enciclopedia concisa de estadística . Springer Science & Business Media. págs. 234–235 . ISBN 978-0-387-31742-7.
- ↑ Fadem, Barbara (2008). High-Yield Behavioral Science . High-Yield Series. Hagerstown, MD: Lippincott Williams & Wilkins. ISBN 9781451130300.
- ↑ Rice, John A. (2006). Estadística matemática y análisis de datos (3.ª ed.). Duxbury Advanced.
- ↑ Weisstein, Eric. " Distribución t de Student " . mathworld.wolfram.com .
- ↑ David, H. A.; Gunnink, Jason L. (1997). "La prueba t pareada bajo emparejamiento artificial". The American Statistician . 51 (1): 9– 12. doi : 10.2307/2684684 . JSTOR 2684684 .
- 1 2 3 4 Lumley, Thomas; Diehr, Paula ; Emerson, Scott; Chen, Lu (mayo de 2002). "La importancia del supuesto de normalidad en grandes conjuntos de datos de salud pública" . Annual Review of Public Health . 23 (1): 151– 169. doi : 10.1146/annurev.publhealth.23.100901.140546 . ISSN 0163-7525 . PMID 11910059 .
- ↑ Markowski, Carol A.; Markowski, Edward P. (1990). "Condiciones para la efectividad de una prueba preliminar de varianza". The American Statistician . 44 (4): 322– 326. doi : 10.2307/2684360 . JSTOR 2684360 .
- ↑ Guo, Beibei; Yuan, Ying (2017). "Una revisión comparativa de métodos para comparar medias utilizando datos parcialmente emparejados". Métodos estadísticos en investigación médica . 26 (3): 1323– 1340. doi : 10.1177/0962280215577111 . PMID 25834090. S2CID 46598415 .
- ↑ Bland, Martin (1995). Introducción a la estadística médica . Oxford University Press. pág. 168. ISBN 978-0-19-262428-4.
- ↑ "Teorema del límite central y la suposición de normalidad > Normalidad > Distribuciones continuas > Distribución > Guía de referencia estadística | Documentación de Analyse-it® 6.15" . analyse-it.com . Consultado el 17 de mayo de 2024 .
- ↑ DEMİR, Süleyman (26 de junio de 2022). "Comparación de pruebas de normalidad en términos de tamaños de muestra bajo diferentes coeficientes de asimetría y curtosis" . Revista Internacional de Herramientas de Evaluación en Educación . 9 (2): 397–409 . doi : 10.21449/ijate.1101295 . ISSN 2148-7456 .
- ↑ "Mis archivos de espacio web" (PDF) . webspace.ship.edu .
- ↑ Wang, Chang; Jia, Jinzhu (2022). "Prueba Te: Una nueva prueba T no asintótica para problemas de Behrens-Fisher". arXiv : 2210.16473 [ math.ST ].
- 1 2 Sawilowsky, Shlomo S.; Blair, R. Clifford (1992). "Una mirada más realista a la robustez y las propiedades de error de tipo II de la prueba t ante desviaciones de la normalidad poblacional". Psychological Bulletin . 111 (2): 352– 360. doi : 10.1037/0033-2909.111.2.352 .
- ↑ Zimmerman, Donald W. (enero de 1998). "Invalidación de pruebas estadísticas paramétricas y no paramétricas por violación concurrente de dos supuestos". The Journal of Experimental Education . 67 (1): 55– 68. doi : 10.1080/00220979809598344 . ISSN 0022-0973 .
- ↑ Blair, R. Clifford; Higgins, James J. (1980). "Una comparación del poder de la estadística de suma de rangos de Wilcoxon con la estadística t de Student bajo diversas distribuciones no normales". Journal of Educational Statistics . 5 (4): 309– 335. doi : 10.2307/1164905 . JSTOR 1164905 .
- ↑ Fay, Michael P.; Proschan, Michael A. (2010). "¿Wilcoxon-Mann-Whitney o prueba t ? Sobre supuestos para pruebas de hipótesis e interpretaciones múltiples de reglas de decisión" . Statistics Surveys . 4 : 1–39 . doi : 10.1214/09-SS051 . PMC 2857732. PMID 20414472 .
- ↑ Derrick, B; Toher, D; White, P (2017). "Cómo comparar las medias de dos muestras que incluyen observaciones pareadas y observaciones independientes: Un complemento a Derrick, Russ, Toher y White (2017)" (PDF) . Métodos cuantitativos para la psicología . 13 (2): 120– 126. doi : 10.20982/tqmp.13.2.p120 .
- ↑ Kutner, Michael H.; Nachtsheim, CJ.; Neter, John (2004), Applied Linear Regression Models , McGraw-Hill, ISBN 9780073521442
- ↑ Walker, Michael (2024), Cómo obtener valores p inferiores a 0,05 en la investigación biológica: ejemplos prácticos de cómo aumentar la potencia, reducir el tamaño de la muestra y elegir mejores pruebas estadísticas (PDF) , Amazon, ISBN 979-8877882577
- ↑ Pandis, Nikolaos J (2016). "Uso de la regresión lineal para pruebas t y análisis de varianza" . American Journal of Orthodontics and Dentofacial Orthopedics . 149 (5p769May): 269–284 .
- ↑ Prueba t de dos muestras como caso especial de regresión lineal
- ↑ Prueba t independiente como modelo lineal en R
- ↑ 2.9 Estableciendo conexiones entre la prueba t de dos muestras y la regresión lineal
- ↑ Shieh, Gwowen (marzo de 2020). "Análisis de potencia y planificación del tamaño de la muestra en diseños ANCOVA" . Psychometrika . 85 ( 1): 101–120 . doi : 10.1007/s11336-019-09692-3 . ISSN 1860-0980 . PMC 8225521. PMID 31823115 .
- ↑ Julious, Steven A. (2010), Tamaños de muestra para ensayos clínicos , Chapman and Hall/CRC, ISBN 978-1584887393
Fuentes
- O'Mahony, Michael (1986). Evaluación sensorial de los alimentos: métodos y procedimientos estadísticos . CRC Press . pág. 487. ISBN 0-82477337-3.
- Press, William H.; Teukolsky , Saul A.; Vetterling, William T.; Flannery, Brian P. (1992). Numerical Recipes in C: The Art of Scientific Computing . Cambridge University Press . pág. 616. ISBN 0-521-43108-5.
Lecturas adicionales
- Boneau, C. Alan (1960). "Los efectos de las violaciones de los supuestos subyacentes a la prueba t ". Psychological Bulletin . 57 (1): 49– 64. doi : 10.1037/h0041412 . PMID 13802482 .
- Edgell, Stephen E.; Noon, Sheila M. (1984). "Efecto de la violación de la normalidad en la prueba t del coeficiente de correlación". Psychological Bulletin . 95 (3): 576– 583. doi : 10.1037/0033-2909.95.3.576 .
- Chicco D.; Sichenze A.; Jurman G. (2025). "Una guía sencilla para el uso de la prueba t de Student, la prueba U de Mann-Whitney, la prueba de chi-cuadrado y la prueba de Kruskal-Wallis en bioestadística" . BioData Mining . 18 (56) 56: 1– 51. doi : 10.1186/s13040-025-00465-6 . PMC 12366075. PMID 40835959 .
Enlaces externos
- "Prueba para estudiantes" . Enciclopedia de Matemáticas . EMS Press . 2001 [1994].
- Trochim, William MK " La prueba T ", Base de conocimientos sobre métodos de investigación , conjoint.ly
- Clase de econometría (tema: prueba de hipótesis) en YouTube por Mark Thoma
- Pruebas estadísticas
- estadística paramétrica