Valor P

Comparar Cálculos

Descargas

Incluye tus datos y resultados de este cálculo, además de cualquier cálculo adicional que hayas comparado.

Convirtiendo una Puntuación Z en una Probabilidad de Azar

Un valor p es la probabilidad de observar un resultado al menos tan extremo como el observado, únicamente por azar, si en realidad no existiera ningún efecto real. Ingresa una puntuación Z y elige un tipo de prueba, y esta calculadora la convierte en un valor p — la cifra estándar utilizada para decidir si un resultado es estadísticamente significativo. Si tienes datos de muestra sin procesar en lugar de una puntuación Z ya calculada, encuéntrala primero con la Calculadora de Puntuación Z.

Un valor p más pequeño significa que sería menos probable que el resultado observado ocurriera solo por azar, lo cual constituye una evidencia más fuerte en contra del supuesto de que no está pasando nada real (la “hipótesis nula”). Por convención de larga data en la mayoría de los campos, un valor p por debajo de 0.05 generalmente se considera estadísticamente significativo — pero ese umbral es una convención, no una ley de la naturaleza, y lo que cuenta como “suficientemente significativo” puede variar según el campo y según qué tan costosa sería una conclusión equivocada.

La fórmula

Para una prueba unilateral izquierda (¿el resultado es inusualmente bajo?):

p=Φ(z)p = \Phi(\vA{z})

Para una prueba unilateral derecha (¿el resultado es inusualmente alto?):

p=1Φ(z)p = 1 - \Phi(\vA{z})

Para una prueba bilateral (¿el resultado es inusual en cualquiera de las dos direcciones?):

p=2×(1Φ(z))p = 2 \times \left(1 - \Phi(|\vA{z}|)\right)

Donde z\vA{z} es la puntuación Z y Φ\Phi es la función de distribución acumulada de la distribución normal estándar — la probabilidad de que un valor tomado al azar de esa distribución caiga en un punto dado o por debajo de él, calculada aquí mediante una aproximación polinómica bien establecida de la función de error.

Ejemplo resuelto

    1. Una puntuación Z de 1.96 es el punto de referencia clásico para una prueba bilateral al nivel de confianza convencional del 95%: p=2×(1Φ(1.96))2×(10.975)0.0500p = 2 \times (1 - \Phi(1.96)) \approx 2 \times (1 - 0.975) \approx 0.0500. 2. Un valor p de aproximadamente 0.05 se ubica justo en el umbral de significancia convencional. 3. Una puntuación Z mayor, de 2.576 (el punto de referencia bilateral para el 99% de confianza), da un valor p más pequeño y más significativo, de aproximadamente 0.0100.

Factores Clave a Considerar

  • Un valor p NO indica la probabilidad de que la hipótesis nula sea verdadera. Esta es una de las malinterpretaciones más comunes en estadística — un valor p de 0.03 significa que hay un 3% de probabilidad de observar un resultado tan extremo (o más extremo) SI la hipótesis nula fuera verdadera, no un 3% de probabilidad de que la hipótesis nula realmente sea correcta.
  • Una prueba de una cola y una de dos colas sobre la misma puntuación Z dan valores p distintos, y elegir la incorrecta puede engañar. Una prueba de una cola solo verifica un efecto en una dirección específica, mientras que una prueba de dos colas verifica un efecto en cualquiera de las dos direcciones — la elección debe decidirse según la pregunta de investigación real ANTES de ver los datos, no seleccionarse después para producir un valor p que se vea más favorable.
  • La significancia estadística y la significancia práctica son dos cosas distintas. Con un tamaño de muestra suficientemente grande, incluso un efecto diminuto y prácticamente insignificante puede producir un valor p muy pequeño — un resultado estadísticamente significativo no es automáticamente un efecto importante o grande en el mundo real, y el tamaño del efecto debe considerarse junto con el valor p.
  • El umbral convencional de 0.05 es una convención ampliamente utilizada, no una ley científica universal. Algunos campos (como la física de partículas) requieren umbrales mucho más estrictos antes de declarar un descubrimiento, mientras que otros tratan 0.05 como un estándar razonable — lo que cuenta como “suficientemente significativo” depende del campo y del costo de estar equivocado.

Errores Comunes

  • Decidir el tipo de prueba después de ver los resultados. La elección entre una prueba de una cola y una de dos colas debe derivarse de la pregunta de investigación real, decidida antes de tener los datos — cambiar a la prueba que produce un valor p más pequeño después de los hechos es una forma de manipulación de datos, incluso si no es intencional.
  • Informar un valor p sin ninguna medida del tamaño del efecto. Un valor p solo indica qué tan improbable es un resultado bajo la hipótesis nula — no dice nada sobre qué tan grande o significativo es realmente ese resultado, por lo que un valor p suele informarse junto con un intervalo de confianza o un tamaño del efecto, no por sí solo.
  • Tratar p = 0.049 y p = 0.051 como resultados fundamentalmente distintos. El umbral de 0.05 es una convención, no una línea nítida en la naturaleza — dos resultados tan cercanos son prácticamente idénticos en fuerza de evidencia, aunque uno técnicamente supere el umbral y el otro no.
  • Ejecutar muchas pruebas e informar solo las que resultaron significativas. Probar suficientes comparaciones eventualmente arrojará un resultado “significativo” por puro azar — el significado de un valor p asume una única prueba planificada de antemano, no el mejor resultado elegido entre muchos.

Útil Saber

  • ¿Partes de datos de muestra sin procesar en lugar de una puntuación Z ya conocida? Calculadora de Puntuación Z convierte un valor bruto frente a una media y desviación estándar conocidas en la puntuación Z que necesita esta calculadora.
  • ¿Quieres un rango de valores plausibles en lugar de un veredicto único de significancia? Calculadora de Intervalo de Confianza expresa la incertidumbre como un intervalo, un acompañante habitual de un valor p más que un sustituto de él.
  • ¿Necesitas primero estadísticas resumidas — media, desviación estándar, varianza — a partir de una lista de números sin procesar? Calculadora de Estadística las calcula directamente a partir de tus datos.

Fuente: Distribución normal estándar y la aproximación de la función de error de Abramowitz y Stegun.

Preguntas Frecuentes

¿Qué se considera un valor p "estadísticamente significativo"?

La convención más común en muchos campos es un valor p inferior a 0.05 (una probabilidad del 5% de que el resultado haya ocurrido solo por azar). Es una convención muy utilizada, no una regla estricta — algunos campos usan umbrales más estrictos (como 0.01) cuando una conclusión errónea resultaría especialmente costosa.

¿Cómo sé si debo usar una prueba de una cola o de dos colas?

Usa una prueba de dos colas cuando te interesa si un resultado es inusual en CUALQUIERA de las dos direcciones (por ejemplo, "¿esta moneda está cargada?"). Usa una prueba de una cola (izquierda o derecha) solo cuando te interesa específicamente UNA dirección desde antes (por ejemplo, "¿este nuevo proceso es MÁS RÁPIDO?") — decidir esto después de ver los datos se considera mala práctica estadística.

¿Cuál es la diferencia entre esta calculadora y la Calculadora de Puntuación Z?

La Calculadora de Puntuación Z convierte un valor bruto en una puntuación z y un percentil frente a una distribución conocida. Esta calculadora parte de una puntuación z ya conocida y responde la pregunta específica que un percentil por sí solo no responde: ¿qué tan probable es que un resultado tan extremo haya ocurrido puramente por azar?

Confirma tu edad

Para crear una cuenta, indícanos tu mes y año de nacimiento.