This account already has saved data. Do you want to keep this device's data, or use your account's saved data?
Appearance
Unit System
Temperature Format
Time Format
P-Value
P-Value
The Numbers
Analysis
P-Value
The Numbers
Analysis
Your Recent & Past Results
Restored a past calculation.
Compare Calculations
Side-by-Side Comparison
A comparison of your calculations' results.
Downloads
Includes your inputs and results for this calculation, plus any additional calculations you've compared.
Share & Print
The link includes your inputs and results, so anyone who opens it sees this exact calculation.
Converting a Z-Score Into a Probability of Chance Alone
A p-value is the probability of seeing a result at least as extreme as the one observed, purely
by chance, if there were actually no real effect. Enter a z-score and choose a test type, and
this calculator converts it into a p-value — the standard figure used to decide whether a result
is statistically significant. If you have raw sample data instead of an already-computed z-score,
find it first with the Z-Score Calculator.
A smaller p-value means the observed result would be less likely to happen by chance alone, which
is stronger evidence against the assumption that nothing real is going on (the “null hypothesis”).
By long-standing convention across most fields, a p-value below 0.05 is generally treated as
statistically significant — but that threshold is a convention, not a law of nature, and what
counts as “significant enough” can vary by field and by how costly a wrong conclusion would be.
The Formula
For a left-tailed test (is the result unusually low?):
p=Φ(z)
For a right-tailed test (is the result unusually high?):
p=1−Φ(z)
For a two-tailed test (is the result unusual in either direction?):
p=2×(1−Φ(∣z∣))
Where z is the z-score and Φ is the standard normal distribution’s cumulative
distribution function — the probability that a randomly drawn value from that distribution falls
at or below a given point, computed here via a well-established polynomial approximation of the
error function.
Worked Example
A z-score of 1.96 is the textbook reference point for a two-tailed test at the conventional
95% confidence level: p=2×(1−Φ(1.96))≈2×(1−0.975)≈0.0500. 2. A p-value of about 0.05 sits right at the conventional significance threshold. 3.
A larger z-score of 2.576 (the two-tailed reference point for 99% confidence) gives a smaller,
more significant p-value of about 0.0100.
Key Factors to Consider
A p-value does NOT tell you the probability that the null hypothesis is true. This is one
of the most common misinterpretations in statistics — a p-value of 0.03 means there’s a 3%
chance of seeing a result this extreme (or more extreme) if the null hypothesis WERE true, not
a 3% chance that the null hypothesis is actually correct.
A one-tailed and two-tailed test on the same z-score give different p-values, and choosing
the wrong one can mislead. A one-tailed test only checks for an effect in one specific
direction, while a two-tailed test checks for an effect in either direction — the choice should
be decided based on the actual research question BEFORE looking at the data, not selected
afterward to produce a more favorable-looking p-value.
Statistical significance and practical significance are two different things. With a large
enough sample size, even a tiny, practically meaningless effect can produce a very small
p-value — a statistically significant result is not automatically an important or
large real-world effect, and effect size should be considered alongside the p-value.
The conventional 0.05 threshold is a widely-used convention, not a universal scientific
law. Some fields (like particle physics) require far stricter thresholds before declaring a
discovery, while others treat 0.05 as a reasonable standard — what counts as “significant
enough” depends on the field and the cost of being wrong.
Common Mistakes
Deciding the test type after looking at the results. The choice between a one-tailed and
two-tailed test should follow from the actual research question, decided before the data is in
hand — switching to whichever test happens to produce a smaller p-value after the fact is a form
of data manipulation, even if unintentional.
Reporting a p-value without any measure of effect size. A p-value only speaks to how
unlikely a result is under the null hypothesis — it says nothing about how large or meaningful
that result actually is, which is why a p-value is usually reported alongside a confidence
interval or effect size, not on its own.
Treating p = 0.049 and p = 0.051 as fundamentally different outcomes. The 0.05 cutoff is a
convention, not a bright line in nature — two results this close are practically identical in
strength of evidence, even though one technically clears the threshold and the other doesn’t.
Running many tests and reporting only the ones that came out significant. Testing enough
comparisons will eventually turn up a “significant” result by chance alone — a p-value’s meaning
assumes a single, pre-planned test, not the best result cherry-picked from many.
Useful to Know
Starting from raw sample data instead of an already-known z-score? Z-Score Calculator
converts a raw value against a known mean and standard deviation into the z-score this
calculator needs.
Want a range of plausible values instead of a single significance verdict?
Confidence Interval Calculator expresses uncertainty as an interval, a common companion to
a p-value rather than a replacement for it.
Need summary statistics — mean, standard deviation, variance — from a raw list of numbers first?
Statistics Calculator computes those directly from your data.
Convirtiendo una Puntuación Z en una Probabilidad de Azar
Un valor p es la probabilidad de observar un resultado al menos tan extremo como el observado,
únicamente por azar, si en realidad no existiera ningún efecto real. Ingresa una puntuación Z y
elige un tipo de prueba, y esta calculadora la convierte en un valor p — la cifra estándar
utilizada para decidir si un resultado es estadísticamente significativo. Si tienes datos de
muestra sin procesar en lugar de una puntuación Z ya calculada, encuéntrala primero con la Calculadora de Puntuación Z.
Un valor p más pequeño significa que sería menos probable que el resultado observado ocurriera
solo por azar, lo cual constituye una evidencia más fuerte en contra del supuesto de que no está
pasando nada real (la “hipótesis nula”). Por convención de larga data en la mayoría de los campos,
un valor p por debajo de 0.05 generalmente se considera estadísticamente significativo — pero
ese umbral es una convención, no una ley de la naturaleza, y lo que cuenta como “suficientemente
significativo” puede variar según el campo y según qué tan costosa sería una conclusión
equivocada.
La fórmula
Para una prueba unilateral izquierda (¿el resultado es inusualmente bajo?):
p=Φ(z)
Para una prueba unilateral derecha (¿el resultado es inusualmente alto?):
p=1−Φ(z)
Para una prueba bilateral (¿el resultado es inusual en cualquiera de las dos direcciones?):
p=2×(1−Φ(∣z∣))
Donde z es la puntuación Z y Φ es la función de distribución acumulada de la
distribución normal estándar — la probabilidad de que un valor tomado al azar de esa distribución
caiga en un punto dado o por debajo de él, calculada aquí mediante una aproximación polinómica
bien establecida de la función de error.
Ejemplo resuelto
Una puntuación Z de 1.96 es el punto de referencia clásico para una prueba bilateral al
nivel de confianza convencional del 95%: p=2×(1−Φ(1.96))≈2×(1−0.975)≈0.0500. 2. Un valor p de aproximadamente 0.05 se ubica justo en el umbral de
significancia convencional. 3. Una puntuación Z mayor, de 2.576 (el punto de referencia
bilateral para el 99% de confianza), da un valor p más pequeño y más significativo, de
aproximadamente 0.0100.
Factores Clave a Considerar
Un valor p NO indica la probabilidad de que la hipótesis nula sea verdadera. Esta es una de
las malinterpretaciones más comunes en estadística — un valor p de 0.03 significa que hay un 3%
de probabilidad de observar un resultado tan extremo (o más extremo) SI la hipótesis nula fuera
verdadera, no un 3% de probabilidad de que la hipótesis nula realmente sea correcta.
Una prueba de una cola y una de dos colas sobre la misma puntuación Z dan valores p distintos,
y elegir la incorrecta puede engañar. Una prueba de una cola solo verifica un efecto en una
dirección específica, mientras que una prueba de dos colas verifica un efecto en cualquiera de
las dos direcciones — la elección debe decidirse según la pregunta de investigación real ANTES de
ver los datos, no seleccionarse después para producir un valor p que se vea más favorable.
La significancia estadística y la significancia práctica son dos cosas distintas. Con un
tamaño de muestra suficientemente grande, incluso un efecto diminuto y prácticamente
insignificante puede producir un valor p muy pequeño — un resultado estadísticamente
significativo no es automáticamente un efecto importante o grande en el mundo real, y el tamaño
del efecto debe considerarse junto con el valor p.
El umbral convencional de 0.05 es una convención ampliamente utilizada, no una ley científica
universal. Algunos campos (como la física de partículas) requieren umbrales mucho más estrictos
antes de declarar un descubrimiento, mientras que otros tratan 0.05 como un estándar razonable —
lo que cuenta como “suficientemente significativo” depende del campo y del costo de estar
equivocado.
Errores Comunes
Decidir el tipo de prueba después de ver los resultados. La elección entre una prueba de una
cola y una de dos colas debe derivarse de la pregunta de investigación real, decidida antes de
tener los datos — cambiar a la prueba que produce un valor p más pequeño después de los hechos es
una forma de manipulación de datos, incluso si no es intencional.
Informar un valor p sin ninguna medida del tamaño del efecto. Un valor p solo indica qué tan
improbable es un resultado bajo la hipótesis nula — no dice nada sobre qué tan grande o
significativo es realmente ese resultado, por lo que un valor p suele informarse junto con un
intervalo de confianza o un tamaño del efecto, no por sí solo.
Tratar p = 0.049 y p = 0.051 como resultados fundamentalmente distintos. El umbral de 0.05 es
una convención, no una línea nítida en la naturaleza — dos resultados tan cercanos son
prácticamente idénticos en fuerza de evidencia, aunque uno técnicamente supere el umbral y el
otro no.
Ejecutar muchas pruebas e informar solo las que resultaron significativas. Probar suficientes
comparaciones eventualmente arrojará un resultado “significativo” por puro azar — el significado
de un valor p asume una única prueba planificada de antemano, no el mejor resultado elegido entre
muchos.
Útil Saber
¿Partes de datos de muestra sin procesar en lugar de una puntuación Z ya conocida?
Calculadora de Puntuación Z convierte un valor bruto frente a una media y desviación
estándar conocidas en la puntuación Z que necesita esta calculadora.
¿Quieres un rango de valores plausibles en lugar de un veredicto único de significancia?
Calculadora de Intervalo de Confianza expresa la incertidumbre como un intervalo, un
acompañante habitual de un valor p más que un sustituto de él.
¿Necesitas primero estadísticas resumidas — media, desviación estándar, varianza — a partir de
una lista de números sin procesar? Calculadora de Estadística las calcula directamente a
partir de tus datos.
What counts as a "statistically significant" p-value?
The most common convention across many fields is a p-value below 0.05 (a 5% chance the result happened by chance alone). This is a widely-used convention, not a strict rule — some fields use stricter thresholds (like 0.01) when a wrong conclusion would be especially costly.
How do I know whether to use a one-tailed or two-tailed test?
Use a two-tailed test when you care whether a result is unusual in EITHER direction (e.g. "is this coin unfair?"). Use a one-tailed test (left- or right-tailed) only when you specifically care about ONE direction ahead of time (e.g. "is this new process FASTER?") — deciding this after seeing the data is considered poor statistical practice.
What's the difference between this and the Z-Score Calculator?
The Z-Score Calculator converts a raw value into a z-score and percentile against a known distribution. This calculator starts from an already-known z-score and answers the specific question a percentile alone does not: how likely is a result this extreme to have happened purely by chance?
We use cookies for analytics and ads to help support this free site. You can accept all, or decline and we'll only use what's needed for the site to work.