P-Değeri

Hesaplamaları Karşılaştır

İndirmeler

Bu hesaplama için girdilerinizi ve sonuçlarınızı, ayrıca karşılaştırdığınız ek hesaplamaları içerir.

Bir Z-Puanını Şans Olasılığına Dönüştürme

Bir p-değeri, gerçekte gerçek bir etki olmasaydı, gözlemlenenle en az aynı derecede aşırı bir sonuç görme olasılığıdır, tamamen şans eseri. Bir z-puanı girin ve bir test türü seçin; bu hesaplayıcı bunu bir p-değerine dönüştürür — bir sonucun istatistiksel olarak anlamlı olup olmadığına karar vermek için kullanılan standart rakam. Zaten hesaplanmış bir z-puanı yerine ham örneklem verileriniz varsa, önce Z-Skoru Hesaplayıcı ile bulun.

Daha küçük bir p-değeri, gözlemlenen sonucun yalnızca şansla gerçekleşme olasılığının daha düşük olduğu anlamına gelir, bu da gerçekte hiçbir şey olmadığı varsayımına (“sıfır hipotezi”) karşı daha güçlü bir kanıttır. Çoğu alanda uzun süredir devam eden bir kurala göre, 0,05’in altındaki bir p-değeri genellikle istatistiksel olarak anlamlı kabul edilir — ancak bu eşik bir doğa yasası değil, bir kuraldır ve neyin “yeterince anlamlı” sayıldığı alana ve yanlış bir sonucun ne kadar maliyetli olacağına göre değişebilir.

Formül

Sol kuyruklu bir test için (sonuç olağandışı derecede düşük mü?):

p=Φ(z)p = \Phi(\vA{z})

Sağ kuyruklu bir test için (sonuç olağandışı derecede yüksek mi?):

p=1Φ(z)p = 1 - \Phi(\vA{z})

Çift kuyruklu bir test için (sonuç herhangi bir yönde olağandışı mı?):

p=2×(1Φ(z))p = 2 \times \left(1 - \Phi(|\vA{z}|)\right)

Burada z\vA{z} z-puanı ve Φ\Phi standart normal dağılımın kümülatif dağılım fonksiyonudur — bu dağılımdan rastgele seçilen bir değerin belirli bir noktaya eşit veya altında kalma olasılığı, burada hata fonksiyonunun köklü bir polinom yaklaşımı ile hesaplanır.

Örnek Hesaplama

    1. 1,96 z-puanı, geleneksel %95 güven düzeyinde çift kuyruklu bir test için ders kitabı referans noktasıdır: p=2×(1Φ(1.96))2×(10,975)0,0500p = 2 \times (1 - \Phi(1.96)) \approx 2 \times (1 - 0,975) \approx 0,0500. 2. Yaklaşık 0,05 p-değeri, geleneksel anlamlılık eşiğinin tam üzerindedir. 3. Daha büyük bir z-puanı olan 2,576 (%99 güven için çift kuyruklu referans noktası), yaklaşık 0,0100 olan daha küçük, daha anlamlı bir p-değeri verir.

Dikkate Alınması Gereken Önemli Faktörler

  • Bir p-değeri, sıfır hipotezinin doğru olma olasılığını SÖYLEMEZ. Bu, istatistikte en yaygın yanlış yorumlardan biridir — 0,03’lük bir p-değeri, sıfır hipotezi DOĞRU OLSAYDI bu kadar aşırı (veya daha aşırı) bir sonuç görme şansının %3 olduğu anlamına gelir, sıfır hipotezinin gerçekten doğru olma şansının %3 olduğu anlamına gelmez.
  • Aynı z-puanı üzerinde tek kuyruklu ve çift kuyruklu bir test farklı p-değerleri verir ve yanlışını seçmek yanıltıcı olabilir. Tek kuyruklu bir test yalnızca belirli bir yönde bir etkiyi kontrol ederken, çift kuyruklu bir test her iki yönde de bir etkiyi kontrol eder — bu seçim, verilere bakıldıktan sonra daha olumlu görünen bir p-değeri üretmek için değil, gerçek araştırma sorusuna dayanarak veriye bakmadan ÖNCE karar verilmelidir.
  • İstatistiksel anlamlılık ve pratik anlamlılık iki farklı şeydir. Yeterince büyük bir örneklem büyüklüğüyle, çok küçük, pratikte anlamsız bir etki bile çok küçük bir p-değeri üretebilir — istatistiksel olarak anlamlı bir sonuç otomatik olarak önemli veya büyük bir gerçek dünya etkisi değildir ve etki büyüklüğü p-değeriyle birlikte değerlendirilmelidir.
  • Geleneksel 0,05 eşiği yaygın olarak kullanılan bir kuraldır, evrensel bir bilimsel yasa değildir. Bazı alanlar (parçacık fiziği gibi) bir keşif ilan etmeden önce çok daha katı eşikler gerektirirken, diğerleri 0,05’i makul bir standart olarak kabul eder — neyin “yeterince anlamlı” sayıldığı alana ve yanlış olmanın maliyetine bağlıdır.

Yaygın Hatalar

  • Test türüne sonuçlara bakıldıktan sonra karar vermek. Tek kuyruklu ile çift kuyruklu test arasındaki seçim, veriler elde edilmeden önce gerçek araştırma sorusuna dayanmalıdır — olay gerçekleştikten sonra hangi test daha küçük bir p-değeri veriyorsa ona geçmek, kasıtsız olsa bile bir tür veri manipülasyonudur.
  • Herhangi bir etki büyüklüğü ölçüsü olmadan bir p-değeri bildirmek. Bir p-değeri yalnızca sıfır hipotezi altında bir sonucun ne kadar olası olmadığından bahseder — bu sonucun gerçekte ne kadar büyük veya anlamlı olduğu hakkında hiçbir şey söylemez, bu yüzden bir p-değeri genellikle tek başına değil, bir güven aralığı veya etki büyüklüğüyle birlikte bildirilir.
  • p = 0,049 ve p = 0,051’i temelde farklı sonuçlar olarak ele almak. 0,05 sınırı bir kuraldır, doğada keskin bir çizgi değildir — bu kadar yakın iki sonuç, biri teknik olarak eşiği geçse ve diğeri geçmese bile, kanıt gücü bakımından pratikte aynıdır.
  • Birçok test çalıştırıp yalnızca anlamlı çıkanları bildirmek. Yeterince karşılaştırma test etmek er ya da geç yalnızca şans eseri “anlamlı” bir sonuç ortaya çıkaracaktır — bir p-değerinin anlamı, önceden planlanmış tek bir testi varsayar, birçoğu arasından seçilmiş en iyi sonucu değil.

Bilmekte Fayda Var

  • Zaten bilinen bir z-puanı yerine ham örneklem verilerinden mi başlıyorsunuz? Z-Skoru Hesaplayıcı, bilinen bir ortalama ve standart sapmaya karşı ham bir değeri bu hesaplayıcının ihtiyaç duyduğu z-puanına dönüştürür.
  • Tek bir anlamlılık kararı yerine olası değerlerin bir aralığını mı istiyorsunuz? Güven Aralığı Hesaplayıcı, belirsizliği bir p-değerinin yerine geçmek yerine ona eşlik eden yaygın bir yöntem olan bir aralık olarak ifade eder.
  • Önce ham bir sayı listesinden özet istatistiklere — ortalama, standart sapma, varyans — mi ihtiyacınız var? İstatistik Hesaplayıcı bunları doğrudan verilerinizden hesaplar.

Kaynak: Standart normal dağılım ve Abramowitz & Stegun hata fonksiyonu yaklaşımı.

Sıkça Sorulan Sorular

"İstatistiksel olarak anlamlı" bir p-değeri olarak ne sayılır?

Birçok alanda en yaygın kural, 0,05'in altındaki bir p-değeridir (sonucun yalnızca şansla gerçekleşme olasılığı %5). Bu yaygın olarak kullanılan bir kuraldır, katı bir kural değildir — bazı alanlar, yanlış bir sonucun özellikle maliyetli olacağı durumlarda daha katı eşikler (0,01 gibi) kullanır.

Tek kuyruklu mu yoksa çift kuyruklu bir test mi kullanacağımı nasıl bilirim?

Bir sonucun HER İKİ yönde de olağandışı olup olmadığıyla ilgilendiğinizde çift kuyruklu bir test kullanın (örneğin, "bu para hileli mi?"). Yalnızca önceden özellikle TEK bir yönle ilgilendiğinizde (örneğin, "bu yeni süreç DAHA HIZLI mı?") tek kuyruklu bir test (sol veya sağ kuyruklu) kullanın — bunu verileri gördükten sonra karar vermek kötü bir istatistiksel uygulama olarak kabul edilir.

Bu ile Z-Puanı Hesaplayıcı arasındaki fark nedir?

Z-Puanı Hesaplayıcı, ham bir değeri bilinen bir dağılıma karşı bir z-puanına ve yüzdelik dilime dönüştürür. Bu hesaplayıcı zaten bilinen bir z-puanından başlar ve tek başına bir yüzdelik dilimin cevaplamadığı belirli soruyu cevaplar: bu kadar aşırı bir sonucun tamamen şans eseri gerçekleşme olasılığı nedir?

Yaşınızı Onaylayın

Hesap oluşturmak için lütfen doğum ayınızı ve yılınızı belirtin.