Convirtiendo una Puntuación Z en una Probabilidad de Azar
Un valor p es la probabilidad de observar un resultado al menos tan extremo como el observado, únicamente por azar, si en realidad no existiera ningún efecto real. Ingresa una puntuación Z y elige un tipo de prueba, y esta calculadora la convierte en un valor p — la cifra estándar utilizada para decidir si un resultado es estadísticamente significativo. Si tienes datos de muestra sin procesar en lugar de una puntuación Z ya calculada, encuéntrala primero con la Calculadora de Puntuación Z.
Un valor p más pequeño significa que sería menos probable que el resultado observado ocurriera solo por azar, lo cual constituye una evidencia más fuerte en contra del supuesto de que no está pasando nada real (la “hipótesis nula”). Por convención de larga data en la mayoría de los campos, un valor p por debajo de 0.05 generalmente se considera estadísticamente significativo — pero ese umbral es una convención, no una ley de la naturaleza, y lo que cuenta como “suficientemente significativo” puede variar según el campo y según qué tan costosa sería una conclusión equivocada.
La fórmula
Para una prueba unilateral izquierda (¿el resultado es inusualmente bajo?):
Para una prueba unilateral derecha (¿el resultado es inusualmente alto?):
Para una prueba bilateral (¿el resultado es inusual en cualquiera de las dos direcciones?):
Donde es la puntuación Z y es la función de distribución acumulada de la distribución normal estándar — la probabilidad de que un valor tomado al azar de esa distribución caiga en un punto dado o por debajo de él, calculada aquí mediante una aproximación polinómica bien establecida de la función de error.
Ejemplo resuelto
- Una puntuación Z de 1.96 es el punto de referencia clásico para una prueba bilateral al nivel de confianza convencional del 95%: . 2. Un valor p de aproximadamente 0.05 se ubica justo en el umbral de significancia convencional. 3. Una puntuación Z mayor, de 2.576 (el punto de referencia bilateral para el 99% de confianza), da un valor p más pequeño y más significativo, de aproximadamente 0.0100.
Factores Clave a Considerar
- Un valor p NO indica la probabilidad de que la hipótesis nula sea verdadera. Esta es una de las malinterpretaciones más comunes en estadística — un valor p de 0.03 significa que hay un 3% de probabilidad de observar un resultado tan extremo (o más extremo) SI la hipótesis nula fuera verdadera, no un 3% de probabilidad de que la hipótesis nula realmente sea correcta.
- Una prueba de una cola y una de dos colas sobre la misma puntuación Z dan valores p distintos, y elegir la incorrecta puede engañar. Una prueba de una cola solo verifica un efecto en una dirección específica, mientras que una prueba de dos colas verifica un efecto en cualquiera de las dos direcciones — la elección debe decidirse según la pregunta de investigación real ANTES de ver los datos, no seleccionarse después para producir un valor p que se vea más favorable.
- La significancia estadística y la significancia práctica son dos cosas distintas. Con un tamaño de muestra suficientemente grande, incluso un efecto diminuto y prácticamente insignificante puede producir un valor p muy pequeño — un resultado estadísticamente significativo no es automáticamente un efecto importante o grande en el mundo real, y el tamaño del efecto debe considerarse junto con el valor p.
- El umbral convencional de 0.05 es una convención ampliamente utilizada, no una ley científica universal. Algunos campos (como la física de partículas) requieren umbrales mucho más estrictos antes de declarar un descubrimiento, mientras que otros tratan 0.05 como un estándar razonable — lo que cuenta como “suficientemente significativo” depende del campo y del costo de estar equivocado.
Errores Comunes
- Decidir el tipo de prueba después de ver los resultados. La elección entre una prueba de una cola y una de dos colas debe derivarse de la pregunta de investigación real, decidida antes de tener los datos — cambiar a la prueba que produce un valor p más pequeño después de los hechos es una forma de manipulación de datos, incluso si no es intencional.
- Informar un valor p sin ninguna medida del tamaño del efecto. Un valor p solo indica qué tan improbable es un resultado bajo la hipótesis nula — no dice nada sobre qué tan grande o significativo es realmente ese resultado, por lo que un valor p suele informarse junto con un intervalo de confianza o un tamaño del efecto, no por sí solo.
- Tratar p = 0.049 y p = 0.051 como resultados fundamentalmente distintos. El umbral de 0.05 es una convención, no una línea nítida en la naturaleza — dos resultados tan cercanos son prácticamente idénticos en fuerza de evidencia, aunque uno técnicamente supere el umbral y el otro no.
- Ejecutar muchas pruebas e informar solo las que resultaron significativas. Probar suficientes comparaciones eventualmente arrojará un resultado “significativo” por puro azar — el significado de un valor p asume una única prueba planificada de antemano, no el mejor resultado elegido entre muchos.
Útil Saber
- ¿Partes de datos de muestra sin procesar en lugar de una puntuación Z ya conocida? Calculadora de Puntuación Z convierte un valor bruto frente a una media y desviación estándar conocidas en la puntuación Z que necesita esta calculadora.
- ¿Quieres un rango de valores plausibles en lugar de un veredicto único de significancia? Calculadora de Intervalo de Confianza expresa la incertidumbre como un intervalo, un acompañante habitual de un valor p más que un sustituto de él.
- ¿Necesitas primero estadísticas resumidas — media, desviación estándar, varianza — a partir de una lista de números sin procesar? Calculadora de Estadística las calcula directamente a partir de tus datos.