On binlerce kişinin yer aldığı bir çalışma, belirti puanında onda birlik farkı çok düşük p değeriyle saptayabilir. Ölçüm gerçektir; kişi bu değişimi hissetmeyebilir. İstatistiksel anlamlılık ile klinik önem aynı soruya cevap vermez. 1 2
P değeri, belirlenmiş istatistiksel model ve sıfır hipotezi altında gözlenen ya da daha uç verilerin ne kadar uyumsuz olduğunu ifade eder. Hipotezin doğru olma olasılığını veya sonucun “şans eseri çıkma” olasılığını vermez. 1
0,049 ile 0,051 arasında bilimsel bir uçurum yoktur. Bir eşiğin iki yanındaki sonuçları “etki var” ve “etki yok” diye ayırmak tahminin büyüklüğünü, yönünü ve belirsizliğini kaybettirir. 1 2
Tahmin ve aralık birlikte okunur
Nokta tahmini çalışmanın bulduğu farkı, güven aralığı bu farkın istatistiksel belirsizliğini gösterir. Aralık dar ve klinik önem eşiğinin bütünüyle üzerindeyse yorum farklı; hem önemsiz farkı hem belirgin yararı kapsıyorsa farklıdır. 2
Küçük çalışma p>0,05 verdiğinde “tedavi etkisizdir” sonucu çıkmaz. Geniş güven aralığı kayda değer yararı ve zararı birlikte kapsıyorsa asıl bulgu belirsizliktir. Daha çok veri karar açısından önemli farkları ayırabilir. 2
Büyük örneklem güven aralığını daraltır ve küçük etkileri saptar. Bu istatistiksel hassasiyet, küçük farkı otomatik olarak değerli hale getirmez. Mutlak değişim ve sonucun hasta açısından ağırlığı ayrıca değerlendirilir. 1 2
Klinik önem sonuçla birlikte tanımlanır
Minimal önemli fark, bir ölçek değişiminin hasta veya karar verici için anlamlı sayılacağı eşiği temsil eder. Eşik ölçüm aracına, hastalığın ağırlığına ve bağlama göre değişebilir; makale bunu nereden aldığını açıklamalıdır. 2
Ölüm, yeniden ameliyat, ağrı puanı ve laboratuvar değeri aynı ağırlıkta değildir. Vekil sonlanımdaki istatistiksel fark, kişinin nasıl hissettiği veya ne kadar yaşadığı konusunda karşılık bulmayabilir. Sonuç seçiminin klinik gerekçesi raporlanır. 3
Çok sayıda sonuç, zaman noktası ve alt grup sınandığında en az bir küçük p değeri bulma olasılığı artar. Önceden belirlenmiş birincil sonuçlar ve çoklu test yaklaşımı, hangi bulgunun doğrulayıcı hangisinin keşif amaçlı olduğunu ayırır. 3
CONSORT 2025 her gruptaki sonucu, aradaki etkiyi ve güven aralığını birlikte istemektedir. İkili sonuçlarda göreli ve mutlak etkilerin yan yana verilmesi, “anlamlı” etiketinden daha fazla karar bilgisi taşır. 3
Okunabilir yorum; etkinin büyüklüğünü, güven aralığını, klinik önem eşiğini, mutlak karşılığını, zararları ve kanıt kesinliğini içerir. P değeri bu kaydın bir parçasıdır, hükmü değildir. 1 2 3
Güven aralığı yalnız “anlamlı mı?” sorusu için değildir
Bir etki tahmininin güven aralığı sıfır farkını aşsa da karar açısından kabul edilemeyecek kadar geniş olabilir. Örneğin aralık küçük zarardan büyük yarara kadar uzanıyorsa p değeri 0,05’in biraz üzerinde diye “etki yok” demek yerine kanıtın belirsiz olduğu söylenmelidir. Tersi biçimde aralık sıfırı dışlasa bile tamamı klinik olarak önemsiz küçük farklar içindeyse sonuç istatistiksel ama pratik olarak değersiz olabilir. 1 2
Aralığın yorumu, sonuç ölçeğine bağlıdır. Risk farkında sıfır, risk oranı veya hazard oranında bir “etkisizlik” değeridir. Klinik önem eşiği ise bu istatistiksel nötr değerden farklı olabilir. İyi rapor hem nötr değeri hem karar açısından anlamlı eşiği görünür kılar. 2 3
Çoklu testler neden sahte kesinlik üretir?
Bir çalışmada onlarca sonlanım, zaman noktası ve alt grup sınandığında rastlantı sonucu küçük p değerleri çıkabilir. Önceden kayıtlı birincil sonlanım, analiz planı ve uygun çoklu test yaklaşımı hangi bulgunun doğrulayıcı olduğunu ayırmaya yardım eder. Sonradan keşfedilen alt grup bulguları hipotez üretmek için değerli olabilir; bağımsız doğrulama olmadan kesin sonuç gibi sunulmamalıdır. 3
“Kadınlarda anlamlı, erkeklerde anlamsız” ifadesi gruplar arasında gerçekten fark olduğu anlamına gelmez. Bunun için alt gruplar arasındaki etkileşim doğrudan test edilmelidir. Bir grupta p<0,05, diğerinde p>0,05 olması tek başına etkileşim kanıtı değildir. 1 3
Klinik önem kişiden kişiye değişebilir
Minimal önemli fark araştırmalardan veya hasta tercih çalışmalarından türetilebilir, ancak tek bir evrensel eşik değildir. Hafif hastalıkta küçük bir değişim değersiz olabilirken ağır semptomlu ve alternatifsiz bir kişide aynı değişim anlamlı bulunabilir. Ayrıca ciddi zararların çok küçük mutlak artışı bile karar için önemli olabilir. 2
Bu nedenle sonuç cümlesi yalnız “istatistiksel olarak anlamlıydı” ile bitmemelidir. Etki büyüklüğü, güven aralığı, mutlak karşılık, takip süresi, hasta açısından önemli sonuçlar ve kanıtın kesinliği birlikte verilmelidir. 1 2 3
“Anlamlı değil” ile “eşdeğer” aynı şey değildir
İki tedavi arasındaki fark p>0,05 olduğunda yalnız verinin seçilen sıfır hipoteziyle güçlü biçimde çelişmediği söylenebilir. Bu sonuç iki tedavinin eşdeğer olduğunu göstermez. Eşdeğerlik veya non-inferiority için önceden tanımlanmış klinik marjlar ve buna uygun çalışma tasarımı gerekir. 1 3
Benzer biçimde bir güven aralığı hem önemli yararı hem önemli zararı kapsıyorsa “fark yok” değil “belirsizlik yüksek” demek daha doğrudur. Özellikle küçük çalışmaların negatif sonuçları bu nedenle dikkatli yorumlanmalıdır. 2
Etki büyüklüğü hangi ölçekte daha anlaşılır?
Sürekli sonuçlarda ortalama fark, ölçeğin klinik anlamı bilinmiyorsa soyut kalabilir. Standartlaştırılmış ortalama fark farklı ölçekleri birleştirmeye yarar ama günlük klinik yorumu zorlaştırır. İkili sonuçlarda göreli ölçü yanında mutlak risk farkının verilmesi, kararın büyüklüğünü daha görünür kılar. 2 3
İstatistiksel raporun amacı tek bir “evet/hayır” kararı üretmek değil, etkinin büyüklüğü ve belirsizliği hakkında şeffaf bir tahmin sunmaktır. 1 2
Kaynaklar
- American Statistical Association. Statement on Statistical Significance and P-Values. 2016.
- Schünemann HJ, et al. Interpreting results and drawing conclusions. Cochrane Handbook, Chapter 15.
- Hopewell S, et al. CONSORT 2025 explanation and elaboration. 2025.
