الوحدة السادسة: اختبار الفرضيات واتخاذ القرار
مقدمة: هذه الوحدة تركز على منطق الاستدلال نفسه: الفرضيات، الأخطاء، القوة، القيمة الاحتمالية، حجم الأثر، فترات الثقة، وحدود التفكير الثنائي في NHST. أما تفاصيل اختيار وتنفيذ t-tests وANOVA وكاي تربيع والبدائل اللامعلمية فقد انتقلت إلى الوحدة السابعة: مقارنة المجموعات.
الدرس 6.1 — اختبار الفرضيات Hypothesis Testing
الهدف هو اتخاذ قرار موضوعي بشأن ادعاء حول مجتمع، بناءً على بيانات عينة.
القيمة الاحتمالية p-value
احتمال الحصول على نتيجة مساوية للنتيجة المشاهدة أو أكثر تطرفاً منها، افتراضاً أن الفرضية العدمية صحيحة. قيمة p صغيرة = دليل قوي ضد H₀.
- p = 0.03 لا يعني أن احتمال الخطأ 3% ولا أن "الفرق حقيقي بنسبة 97%".
- الدلالة الإحصائية لا تعني الأهمية العملية: فرق 0.1 ثانية في 100م قد يكون دالاً إحصائياً في عينة كبيرة لكنه غير ذي قيمة عملية.
- استخدم دائماً حجم الأثر Effect Size (مثل Cohen's d) جنباً إلى جنب مع p-value.
الدرس 6.1ب — أخطاء الاستدلال الإحصائي
| نوع الخطأ | الوصف | مثال رياضي | كيفية التحكم |
|---|---|---|---|
| الخطأ من النوع الأول (α) | رفض H₀ وهي صحيحة (إيجاد فرق غير موجود) | الادّعاء بأن برنامج تدريبي فعّال وهو لا يختلف عن البرنامج العادي | تقليل α (مثلاً إلى 0.01) |
| الخطأ من النوع الثاني (β) | عدم رفض H₀ وهي خاطئة (تفويت فرق حقيقي) | عدم اكتشاف فائدة حقيقية لبرنامج تدريبي بسبب عينة صغيرة | زيادة حجم العينة، تحسين قوة الاختبار |
قوة الاختبار = 1 − β = احتمال اكتشاف فرق حقيقي عندما يكون موجوداً.
- القيمة المقبولة: ≥ 0.80 (80%)
- تزداد بزيادة حجم العينة، وزيادة حجم الأثر، وزيادة مستوى الدلالة α
- يجب حسابها قبل إجراء الدراسة (Power Analysis)
الدرس 6.1ج — حجم الأثر مهم جداً Effect Size
حجم الأثر يقيس حجم الفرق بين المجموعات، بغض النظر عن دلالته الإحصائية. فهو يجيب على السؤال: "هل الفرق مهم عملياً؟"
| المعامل | الصيغة الكاملة | صغير | متوسط | كبير | ملاحظة |
|---|---|---|---|---|---|
| Cohen's d | (M₁ − M₂) / SD_pooled | 0.2 | 0.5 | 0.8 | SD_pooled = √[(n₁−1)s₁² + (n₂−1)s₂²) / (n₁+n₂−2)] |
| Hedges' g | Cohen's d مُصحَّح للعينات الصغيرة | 0.2 | 0.5 | 0.8 | مُفضَّل على d عند n < 20 |
| η² (إيتا تربيع) | SS_effect / SS_total | 0.01 | 0.06 | 0.14 | يُبالغ في التقدير بالعينات الصغيرة |
| ω² (أوميغا تربيع) | (SS_effect − df_effect × MS_error) / (SS_total + MS_error) | 0.01 | 0.06 | 0.14 | مُفضَّل: أقل تحيزاً من η² |
| r (معامل الارتباط) | √(t² / (t² + df)) | 0.1 | 0.3 | 0.5 | يُستخدم عند الإبلاغ عن t-test |
الصيغة "(M₁ − M₂) / SD" غامضة لأن "SD" قد تعني:
- SD المُجمَّع (pooled SD): الأكثر شيوعاً في مقارنة مجموعتين متكافئتين — وهو التعريف الأصلي لكوهين.
- SD المجموعة الضابطة فقط: يُستخدم في دراسات المقارنة مع معيار مرجعي (Glass's Δ).
- SD مشترك (average SD): يُستخدم حين تكون المجموعتان متساويتي الحجم.
القاعدة العملية: دائماً اذكر تعريف SD المستخدم عند الإبلاغ عن d. استخدم SD المُجمَّع الموزون (weighted pooled SD) عند الحجوم غير المتساوية.
مجموعة تجريبية (n=20): M₁=58.2، s₁=5.1 مل/كجم/دقيقة | مجموعة ضابطة (n=20): M₂=53.7، s₂=4.8
التفسير وصيغة الإبلاغ (APA): "أظهر البرنامج التدريبي تأثيراً كبيراً على VO₂max (t(38) = 2.89، p = 0.006، d = 0.91، 95% CI للفرق: [1.3، 7.7] مل/كجم/دقيقة)."
الأهمية العملية: أصغر تغيير ذي قيمة SWC & MCID
الدلالة الإحصائية تُجيب عن "هل الفرق حقيقي؟" لكن الأهمية العملية تُجيب عن "هل الفرق يستحق الاهتمام؟". في علوم الرياضة، يُستخدم مفهومان مكملان:
أصغر تغيير ذو قيمة SWC
SWC = 0.2 × الانحراف المعياري البيني (Hopkins, 2000)
هو أصغر تحسن في الأداء يُعدّ ذا معنى تنافسياً. مثال:
- إذا كان SD بين الرياضيين في زمن 100م = 0.5 ثانية
- فإن SWC = 0.2 × 0.5 = 0.1 ثانية
- أي تحسن أقل من 0.1 ث غير ذي قيمة تنافسية
الفرق الإكلينيكي الأدنى MCID
أصغر تغيير يُدركه المريض/الرياضي كتحسن ملموس في حياته
يُحدَّد عادةً من الدراسات الإكلينيكية باستخدام المرساة (anchor-based). مثال:
- MCID لمقياس VAS للألم = 1.5 نقطة من أصل 10
- MCID لزمن اختبار VO₂max = 3.5 مل/كجم/دقيقة
- أي تحسن أقل من MCID لا يُحسّ به الفرد
| السيناريو | الدلالة الإحصائية | SWC / MCID | القرار |
|---|---|---|---|
| المثالي | p < 0.05 | ≥ SWC | الفرق حقيقي ومهم عملياً |
| مُضلِّل إيجابياً | p < 0.05 | < SWC | حقيقي إحصائياً، لكن غير ذي قيمة عملية |
| محدودية القدرة | p > 0.05 | ≥ SWC | مهم عملياً، لكن العينة صغيرة للكشف عنه |
| لا شيء | p > 0.05 | < SWC | لا دلالة ولا أهمية عملية |
الدرس 6.2 — فترات الثقة Confidence Intervals
فترة الثقة تعطي نطاقاً محتملاً لقيمة المجتمع الحقيقية، بدلاً من نقطة واحدة (مثل المتوسط).
"فترة الثقة 95%" تعني: إذا أجرينا الدراسة 100 مرة، فإن 95 منها ستُنتج فترات تحتوي على الوسط الحقيقي للمجتمع. ليس احتمال 95% أن تكون القيمة الحقيقية ضمن الفترة الحالية.
عينة من 50 لاعباً: المتوسط = 52.5 ml/kg/min، SD = 6.0
فترة الثقة 95%: 52.5 ± (1.96 × 6/√50) = 52.5 ± 1.66 = [50.8, 54.2]
التفسير: نحن واثقون بنسبة 95% أن متوسط VO2max الحقيقي لكل اللاعبين يقع بين 50.8 و 54.2.
إذا كانت فترة الثقة 95% للفرق بين مجموعتين لا تحتوي على الصفر → فإن p < 0.05 (الفرق دال).
حدود NHST والنزاهة البحثية
اختبار الفرضيات أداة نافعة، لكنه يصبح خطيراً عندما يُعامل كآلة لإنتاج قرار "دال/غير دال" من غير تقدير لحجم الأثر، فترات الثقة، جودة التصميم، والشفافية التحليلية.
- لا تقول إن احتمال صحة الفرضية العدمية هو p.
- لا تقول إن النتيجة مهمة عملياً.
- لا تعوض ضعف التصميم أو عينة صغيرة أو قياس غير ثابت.
- لا تمنحك إذناً بإخفاء التحليلات غير المناسبة أو غير الدالة.
يحدث P-hacking عندما يغيّر الباحث التحليلات أو يستبعد قيماً أو يختبر فرضيات متعددة بعد رؤية البيانات حتى يحصل على p < 0.05، ثم يبلّغ عن النتيجة المختارة فقط. في علوم الرياضة قد يؤدي ذلك إلى قرارات تدريبية أو علاجية خاطئة.
- سجّل الفرضيات وخطة التحليل مسبقاً كلما أمكن.
- أبلغ عن جميع النتائج الأساسية، لا النتائج الدالة فقط.
- صحح المقارنات المتعددة عندما تختبر عدداً كبيراً من الفرضيات.
- اجعل حجم الأثر وفترة الثقة جزءاً من القرار، لا ملحقاً شكلياً.
هذه القيود لا تعني ترك الإحصاء التكراري، بل استخدامه بمسؤولية. في الوحدة 16 ستتعلم كيف يقدم الإحصاء البايزي طريقة أخرى للتفكير في الدليل عبر التوزيعات السابقة واللاحقة وعوامل بايز.
محاكي اختيار الاختبار
أنت الآن تعرف ما يكفي لاستخدام المحاكي بوعي: ليس لاختيار اختبار آلياً، بل لمراجعة منطق القرار. بعد كل وحدة جديدة، عُد إلى المحاكي ولاحظ كيف تتغير الخيارات عندما تتوسع أدواتك.
الدرس 6.3 — اختبار t t-test
يُستخدم لمقارنة متوسط مجموعتين. ثلاثة أنواع رئيسية:
| النوع | متى يُستخدم؟ | مثال رياضي |
|---|---|---|
| مستقل (Independent) | مجموعتان مختلفتان من الأفراد | مقارنة قوة القبضة بين لاعبي كرة القدم وكرة السلة |
| مرتبط (Paired) | نفس الأفراد في وضعين مختلفين | مقارنة أداء اللاعبين قبل وبعد برنامج تدريبي |
| عينة واحدة (One-sample) | مقارنة عينة بقيمة مرجعية معروفة | مقارنة متوسط VO2max لفريق بمعيار النخبة الوطنية |
- البيانات كمية متصلة (نسبية أو فاصلة)
- التوزيع طبيعي (أو n ≥ 30 لكل مجموعة)
- تباين متقارب بين المجموعات (للاختبار المستقل)
- استقلالية المشاهدات
الدرس 6.4 — تحليل التباين ANOVA
يُستخدم لمقارنة متوسطات ثلاث مجموعات أو أكثر. لماذا لا نستخدم t-test متعدداً؟ لأن ذلك يزيد من احتمال الخطأ من النوع الأول (مشكلة المقارنات المتعددة).
| النوع | العوامل | مثال رياضي |
|---|---|---|
| ANOVA أحادي الاتجاه (One-way) | عامل واحد بـ 3+ مستويات | مقارنة القوة بين لاعبي (كرة قدم، سلة، طائرة، سباحة) |
| ANOVA ثنائي الاتجاه (Two-way) | عاملان (مع تأثيراتهما التفاعلية) | تأثير (نوع الرياضة) و(الجنس) على القوة + تفاعلهما |
| ANOVA بإجراءات متكررة (Repeated Measures) | نفس الأفراد عبر زمن/شروط | تغير لياقة اللاعبين عبر (قبل، أسبوع 4، أسبوع 8، أسبوع 12) |
لماذا لا نُجري t-tests متكررة بدلاً من ANOVA؟ لأن كل اختبار إضافي يزيد من احتمال الخطأ من النوع الأول:
- 3 مجموعات → 3 مقارنات: FWER = 1 − (0.95)³ = 14.3%
- 4 مجموعات → 6 مقارنات: FWER = 1 − (0.95)⁶ = 26.5%
- 5 مجموعات → 10 مقارنات: FWER = 1 − (0.95)¹⁰ = 40.1%
ANOVA تضبط هذا الخطأ بإجراء اختبار واحد. ثم تأتي اختبارات Post-hoc لتحديد المجموعات المختلفة مع ضبط التعددية.
اختبارات المقارنات البعدية Post-hoc Tests
متى كان اختبار F دالاً، نُجري مقارنات زوجية بعدية مع تصحيح لمستوى الدلالة. اختيار الاختبار يعتمد على طبيعة البيانات:
| الاختبار | متى يُستخدم؟ | التحفظية | التوصية |
|---|---|---|---|
| Tukey HSD | أحجام متساوية، تباينات متساوية | معتدل | الأكثر شيوعاً في علوم الرياضة |
| Bonferroni | أي تصميم — يقسم α على عدد المقارنات | محافظ جداً | لعدد مقارنات صغير (≤ 5) |
| Games-Howell | أحجام غير متساوية أو تباينات غير متساوية | معتدل | الأفضل عند عدم استيفاء تجانس التباين (Violation of Assumptions) |
| Scheffé | أي مقارنات بما فيها المُركَّبة | الأكثر تحفظاً | عند الحاجة لمقارنات خطية معقدة |
| Dunnett | مقارنة جميع المجموعات بمجموعة ضابطة واحدة | معتدل | دراسات التدخل مع ضابطة |
دراسة تقارن VO₂max بين 3 مجموعات تدريبية (هوائي، مقاومة، مختلط):
- ANOVA: F(2, 57) = 8.45، p = 0.001 ← يوجد فرق بين المجموعات
- Tukey HSD: هوائي > مقاومة (p = 0.001)، هوائي > مختلط (p = 0.04)، مقاومة ≈ مختلط (p = 0.28)
التفسير: التدريب الهوائي يتفوق على كلا النوعَين الآخرَين في تطوير VO₂max، بينما لا يختلف المختلط معنوياً عن المقاومة.
تحليل التباين للقياسات المتكررة Repeated Measures ANOVA
أكثر تصاميم ANOVA شيوعاً في أبحاث التدريب الرياضي: نفس الأفراد يُقاسون في أوقات أو شروط متعددة. يتميز بقدرته على عزل تباين الفروق الفردية، مما يزيد من قوته الإحصائية مقارنةً بـ ANOVA المجموعات المستقلة.
الافتراض الجوهري لـ Repeated Measures ANOVA هو الكروية: تباينات الفروق بين كل زوج من الأوقات متساوية. يُختبر باختبار Mauchly W:
- إذا كان p (Mauchly) > 0.05: الكروية مستوفاة — استخدم النتائج كما هي.
- إذا كان p (Mauchly) < 0.05: انتُهكت الكروية — طبّق تصحيح Greenhouse-Geisser (ε) أو Huynh-Feldt على درجات الحرية.
- كلما اقترب ε من 1، كانت بيانات أكثر قرباً من الكروية المثالية.
البيانات: قياسات VO₂max (مل/كجم/دقيقة) لـ 15 رياضياً في 4 نقاط زمنية:
| النقطة الزمنية | الأسبوع 0 (قبل) | الأسبوع 4 | الأسبوع 8 | الأسبوع 12 |
|---|---|---|---|---|
| المتوسط | 42.3 | 45.1 | 47.8 | 50.2 |
| الانحراف المعياري | 4.8 | 4.6 | 5.0 | 5.1 |
الإبلاغ: "أظهر تحليل التباين للقياسات المتكررة تأثيراً دالاً للزمن على VO₂max [F(3, 42) = 24.7، p < 0.001، η²_p = 0.64]. كشفت مقارنات Bonferroni البعدية عن تحسن معنوي في كل مرحلة خلال الـ 12 أسبوعاً."
عند عدم استيفاء الطبيعية مع قياسات متكررة، استبدل Repeated Measures ANOVA بـ اختبار فريدمان. يعتمد على ترتيب القيم بدلاً من قيمها الفعلية، وهو الأنسب للبيانات الترتيبية أو المنحرفة بشدة.
الدرس 6.5 — اختبار كاي تربيع Chi-Square χ²
يُستخدم للبيانات الفئوية (الاسمية/الترتيبية). يختبر:
- Goodness of fit: هل توزيع العينة يطابق توزيعاً متوقعاً؟
- Independence: هل متغيران فئويان مستقلان؟
| نوع الإصابة | كرة القدم | كرة السلة | السباحة |
|---|---|---|---|
| عضلية | 45 | 30 | 15 |
| مفاصل | 25 | 40 | 10 |
| عظام | 20 | 15 | 5 |
هل نوع الإصابة مستقل عن نوع الرياضة؟ اختبار χ² يجيب على هذا السؤال.
- جميع التكرارات المتوقعة ≥ 5 (أو على الأقل 80% منها)
- البيانات فئوية (اسمية أو ترتيبية)
- المشاهدات مستقلة
الدرس 6.6 — الاختبارات اللامعلمية Non-parametric Tests
تُستخدم عندما لا تُستوفى شروط الاختبارات المعلمية (الطبيعية، التباين المتساوي، البيانات الفاصلة).
| الاختبار المعلمي | البديل اللامعلمي | متى يُستخدم؟ |
|---|---|---|
| Independent t-test | Mann-Whitney U | مجموعتان، بيانات غير طبيعية |
| Paired t-test | Wilcoxon Signed-Rank | عينتان مرتبطتان، بيانات غير طبيعية |
| One-way ANOVA | Kruskal-Wallis H | 3+ مجموعات، بيانات غير طبيعية |
| Pearson Correlation | Spearman's ρ | بيانات ترتيبية أو غير خطية |
- البيانات ترتيبية (وليست فاصلة)
- التوزيع شديد الانحراف مع n < 30
- وجود قيم شاذة شديدة
- العينة صغيرة جداً (n < 15)