Akademik Başarı

Nicel Araştırmalarda p-Değeri (p-value) Yanılgısı ve İstatistiksel Anlamlılık 2026

Nicel araştırmalarda p-değeri yanılgısı, p-hacking, etki büyüklüğü (effect size) ve akademik dünyadaki istatistiksel anlamlılık krizine dair bilimsel analiz.

Nicel Araştırmalarda p-Değeri (p-value) Yanılgısı ve İstatistiksel Anlamlılık 2026 için ogrenm.com kapak görseli

Bu Rehberde Neler Var?

  • p-Değerinin Matematiksel Gerçekliği: Ne Değildir?
  • Örneklem Büyüklüğü İllüzyonu ve İstatistiksel Şişirme
  • Kurtarıcı Paradigma: Etki Büyüklüğü (Effect Size) ve Cohen's d
  • p-Hacking (Veri Avcılığı) ve Akademik Etik İhlalleri

Akademik dünyanın en büyük metodolojik saplantılarından biri, nicel araştırmalarda SPSS veya benzeri istatistiksel yazılımların ekranında beliren o sihirli rakama duyulan inançtır: p < 0.05. Birçok yüksek lisans ve doktora öğrencisi, aylarca topladıkları verinin sonucunda bu barajın altına inemedikleri zaman araştırmalarının başarısız (çöp) olduğunu düşünerek derin bir akademik depresyona sürüklenir. Bu "p-değeri fetişizmi", modern bilimin üzerine inşa edildiği Sıfır Hipotezi Anlamlılık Testi (Null Hypothesis Significance Testing - NHST) kurgusunun en yanlış anlaşılan ve en çok istismar edilen bileşenidir.

Amerikan İstatistik Derneği'nin (ASA) konuyla ilgili yayınladığı sert bildirgelerin de işaret ettiği üzere; p-değeri, bir hipotezin doğru veya yanlış olduğunu kanıtlayan kesin bir mühür değildir. Aksine, salt istatistiksel anlamlılık üzerinden yapılan yayınlar, akademide bugün "Replikasyon Krizi" (yayınlanmış makalelerdeki bulguların tekrarlandığında aynı sonucu vermemesi) olarak adlandırılan devasa bir güvenilirlik sorunu yaratmıştır. Bu makalede, p-değerinin matematiksel illüzyonunu, araştırmacıların farkında olmadan düştüğü p-hacking tuzaklarını ve bilimsel değerin asıl ölçütü olan Etki Büyüklüğü (Effect Size) kavramını derinlemesine inceleyeceğiz.

p-Değerinin Matematiksel Gerçekliği: Ne Değildir?

Araştırmacıların p-değeri (olasılık değeri) hakkında düştüğü en temel kognitif hata şudur: Öğrenciler genellikle p-değerini, "Kendi hipotezimin yanlış olma ihtimali" veya "Sonuçların şansa bağlı olma ihtimali" olarak yorumlar. Bu, istatistiksel olarak tamamen hatalı bir çıkarımdır.

Gerçekte p-değeri, Sıfır Hipotezinin (H0) tamamen doğru olduğu varsayıldığında, elde edilen verilerin veya daha aşırı verilerin gözlemlenme olasılığıdır. Yani p-değeri, araştırmacının kurduğu alternatif hipotezin (H1) doğruluğu hakkında hiçbir şey söylemez. Yalnızca verilerinizin, hiçbir etkinin olmadığı (sıfır) bir evren modeliyle ne kadar "uyumsuz" olduğunu gösterir. Örneğin p = 0.03 bulmanız, %97 ihtimalle haklı olduğunuzu kanıtlamaz; sadece "eğer iki grup arasında gerçekten hiçbir fark yoksa, bu kadar farklı bir veri setini tesadüfen bulma ihtimalim %3'tür" anlamına gelir.

Örneklem Büyüklüğü İllüzyonu ve İstatistiksel Şişirme

p-değerinin en zayıf noktası, doğrudan Örneklem Büyüklüğüne (Sample Size) olan matematiksel bağımlılığıdır. İstatistiksel testlerin formülasyonu gereği, örneklem sayısını (N) sonsuza doğru artırdığınızda, evrendeki en ufak, en önemsiz ve en anlamsız farklılıklar bile p < 0.05 sınırının altına inerek "istatistiksel olarak anlamlı" hale gelir.

Örneğin, yeni bir eğitim metodunun öğrencilerin sınav notlarını artırıp artırmadığını test ettiğinizi düşünelim. Eğer 10.000 öğrenci üzerinde bir test yaparsanız, yeni metodun notları sadece 0.1 puan (100 üzerinden) artırması bile p=0.001 gibi devasa bir "anlamlılık" verecektir. Bir araştırmacı bu sonucu makalesinde "Yeni eğitim metodu istatistiksel olarak son derece anlamlı bir fark yaratmıştır (p<0.01)" diye pazarlayabilir. Matematiksel olarak yalan söylememektedir, ancak pratik gerçeklikte 0.1 puanlık bir artışın pedagojik hiçbir değeri yoktur. Bu durum, istatistiksel anlamlılığın, pratik (klinik) anlamlılıkla aynı şey olmadığı gerçeğini yüzümüze çarpar.

İstatistiksel Çıktı ve Etki Büyüklüğü (Effect Size) Analizörü

Nicel araştırmanızdaki p-değeri, örneklem büyüklüğü ve etki büyüklüğü parametrelerini girerek bulgularınızın gerçek bilimsel gücünü analiz edin.

İstatistiksel Analiz Raporu

Analiz ediliyor...
Değerlendirme bekleniyor.

Kurtarıcı Paradigma: Etki Büyüklüğü (Effect Size) ve Cohen's d

Eğer p-değeri sadece bir etkinin "var olup olmadığını" test ediyorsa, o etkinin "ne kadar büyük ve önemli olduğunu" nasıl ölçeceğiz? İşte bu noktada modern nicel araştırmaların vazgeçilmezi olan Etki Büyüklüğü (Effect Size) devreye girer. P-değerinin aksine, etki büyüklüğü örneklem sayısından bağımsızdır. İki grup arasındaki farkın standart sapma cinsinden ne kadar büyük olduğunu gösterir.

Literatürde en çok kullanılan etki büyüklüğü ölçütlerinden biri Cohen's d katsayısıdır. Bir araştırmada p-değeri > 0.05 çıksa bile (yani sonuç istatistiksel olarak anlamsız bulunsa bile), eğer etki büyüklüğü yüksekse (örn: d = 0.85), bu durum araştırmanın çöp olduğu anlamına gelmez. Bu tablo araştırmacıya şunu söyler: "Evrende gerçekten güçlü bir etki var, ancak sen bu etkiyi istatistiksel olarak kanıtlamak için yeterli sayıda veri (örneklem) toplayamadın." Buna literatürde İstatistiksel Güç (Statistical Power) Eksikliği (Tip II Hata) denir. APA 7 formatı, araştırmacıların sadece p-değerlerini değil, mutlaka etki büyüklüğü değerlerini ve Güven Aralıklarını (Confidence Intervals) da raporlamasını zorunlu tutmaktadır.

p-Hacking (Veri Avcılığı) ve Akademik Etik İhlalleri

Akademik dergilerin genellikle sadece "anlamlı" (p<0.05) sonuçlar bulan makaleleri yayınlama eğilimi (Publication Bias), araştırmacıları karanlık bir yola, yani p-Hacking (Data Dredging / Veri Avcılığı) yapmaya iter. P-hacking, araştırmacının verilerle bilinçli veya bilinçsiz şekilde oynayarak o sihirli 0.05 sınırının altına inmeye çalışmasıdır.

Bir araştırmacı p-hacking yaparken verileri uydurmaz; ancak analize dahil edeceği değişkenleri sürekli değiştirir. Örneğin hipotezi doğrulanmayınca anketten bazı demografik yaş gruplarını çıkartır, aykırı (outlier) değerleri siler, değişkenleri birleştirir veya böler, ta ki programda p=0.049 yazısını görene kadar analiz modelini eğip büker. 20 farklı değişkeni birbiriyle rastgele test ederseniz, saf şans eseri en az bir tanesinin p<0.05 çıkma ihtimali matematiken garantidir (Çoklu Karşılaştırma Sorunu). Bu tür manipüle edilmiş bulgular literatüre girer ancak başka bir araştırmacı aynı deneyi tekrarladığında bu sonuç asla bulunamaz (Replikasyon Krizi).

Bilimsel liyakat; veriyi eğip bükerek p < 0.05 çıkarmak değil, hipoteziniz reddedilse bile (p > 0.05) o anlamsızlığın arkasındaki bilimsel gerçeği dürüstçe tartışabilmektir. Akademik literatür, doğrulanmış hipotezler kadar, "nehrin o tarafında su olmadığını" gösteren dürüst araştırmalara da ihtiyaç duyar.