الوحدة السادسة: اختبار الفرضيات واتخاذ القرار

مقدمة: هذه الوحدة تركز على منطق الاستدلال نفسه: الفرضيات، الأخطاء، القوة، القيمة الاحتمالية، حجم الأثر، فترات الثقة، وحدود التفكير الثنائي في NHST. أما تفاصيل اختيار وتنفيذ t-tests وANOVA وكاي تربيع والبدائل اللامعلمية فقد انتقلت إلى الوحدة السابعة: مقارنة المجموعات.

الدرس 6.1 — اختبار الفرضيات Hypothesis Testing

الهدف هو اتخاذ قرار موضوعي بشأن ادعاء حول مجتمع، بناءً على بيانات عينة.

خطوات اختبار الفرضية
1
صياغة الفرضية العدمية H₀: الافتراض الأساسي (لا يوجد فرق / لا يوجد تأثير). مثال: "لا يوجد فرق في سرعة اللاعبين قبل وبعد البرنامج التدريبي."
2
صياغة الفرضية البديلة H₁: ما نريد إثباته. مثال: "البرنامج التدريبي يزيد السرعة."
3
تحديد مستوى الدلالة α: عادةً α = 0.05 (5%) في البحث الرياضي، ويُستخدم أحياناً 0.01 للدراسات الطبية.
4
اختيار الاختبار الإحصائي المناسب بناءً على نوع البيانات وعدد المجموعات.
5
حساب الإحصاء الاختباري (t, F, χ²...) والقيمة الاحتمالية p.
6
اتخاذ القرار: إذا كان p ≤ α → نرفض H₀ (النتيجة دالة إحصائياً). إذا كان p > α → لا نرفض H₀.

القيمة الاحتمالية p-value

تعريف p-value

احتمال الحصول على نتيجة مساوية للنتيجة المشاهدة أو أكثر تطرفاً منها، افتراضاً أن الفرضية العدمية صحيحة. قيمة p صغيرة = دليل قوي ضد H₀.

تنبيه — سوء فهم p-value
  • p = 0.03 لا يعني أن احتمال الخطأ 3% ولا أن "الفرق حقيقي بنسبة 97%".
  • الدلالة الإحصائية لا تعني الأهمية العملية: فرق 0.1 ثانية في 100م قد يكون دالاً إحصائياً في عينة كبيرة لكنه غير ذي قيمة عملية.
  • استخدم دائماً حجم الأثر Effect Size (مثل Cohen's d) جنباً إلى جنب مع p-value.

الدرس 6.1ب — أخطاء الاستدلال الإحصائي

نوع الخطأ الوصف مثال رياضي كيفية التحكم
الخطأ من النوع الأول (α) رفض H₀ وهي صحيحة (إيجاد فرق غير موجود) الادّعاء بأن برنامج تدريبي فعّال وهو لا يختلف عن البرنامج العادي تقليل α (مثلاً إلى 0.01)
الخطأ من النوع الثاني (β) عدم رفض H₀ وهي خاطئة (تفويت فرق حقيقي) عدم اكتشاف فائدة حقيقية لبرنامج تدريبي بسبب عينة صغيرة زيادة حجم العينة، تحسين قوة الاختبار
قوة الاختبار Statistical Power

قوة الاختبار = 1 − β = احتمال اكتشاف فرق حقيقي عندما يكون موجوداً.

  • القيمة المقبولة: ≥ 0.80 (80%)
  • تزداد بزيادة حجم العينة، وزيادة حجم الأثر، وزيادة مستوى الدلالة α
  • يجب حسابها قبل إجراء الدراسة (Power Analysis)

الدرس 6.1ج — حجم الأثر مهم جداً Effect Size

حجم الأثر يقيس حجم الفرق بين المجموعات، بغض النظر عن دلالته الإحصائية. فهو يجيب على السؤال: "هل الفرق مهم عملياً؟"

المعامل الصيغة الكاملة صغير متوسط كبير ملاحظة
Cohen's d (M₁ − M₂) / SD_pooled 0.2 0.5 0.8 SD_pooled = √[(n₁−1)s₁² + (n₂−1)s₂²) / (n₁+n₂−2)]
Hedges' g Cohen's d مُصحَّح للعينات الصغيرة 0.2 0.5 0.8 مُفضَّل على d عند n < 20
η² (إيتا تربيع) SS_effect / SS_total 0.01 0.06 0.14 يُبالغ في التقدير بالعينات الصغيرة
ω² (أوميغا تربيع) (SS_effect − df_effect × MS_error) / (SS_total + MS_error) 0.01 0.06 0.14 مُفضَّل: أقل تحيزاً من η²
r (معامل الارتباط) √(t² / (t² + df)) 0.1 0.3 0.5 يُستخدم عند الإبلاغ عن t-test
تحذير: غموض صيغة Cohen's d

الصيغة "(M₁ − M₂) / SD" غامضة لأن "SD" قد تعني:

  • SD المُجمَّع (pooled SD): الأكثر شيوعاً في مقارنة مجموعتين متكافئتين — وهو التعريف الأصلي لكوهين.
  • SD المجموعة الضابطة فقط: يُستخدم في دراسات المقارنة مع معيار مرجعي (Glass's Δ).
  • SD مشترك (average SD): يُستخدم حين تكون المجموعتان متساويتي الحجم.

القاعدة العملية: دائماً اذكر تعريف SD المستخدم عند الإبلاغ عن d. استخدم SD المُجمَّع الموزون (weighted pooled SD) عند الحجوم غير المتساوية.

مثال محلول: حساب Cohen's d و ω²

مجموعة تجريبية (n=20): M₁=58.2، s₁=5.1 مل/كجم/دقيقة | مجموعة ضابطة (n=20): M₂=53.7، s₂=4.8

1
SD_pooled = √[(19×5.1² + 19×4.8²) / (20+20−2)] = √[(494.19 + 437.76) / 38] = √[931.95/38] = √24.52 = 4.95
2
Cohen's d = (58.2 − 53.7) / 4.95 = 4.5 / 4.95 = 0.91 (أثر كبير)

التفسير وصيغة الإبلاغ (APA): "أظهر البرنامج التدريبي تأثيراً كبيراً على VO₂max (t(38) = 2.89، p = 0.006، d = 0.91، 95% CI للفرق: [1.3، 7.7] مل/كجم/دقيقة)."

الأهمية العملية: أصغر تغيير ذي قيمة SWC & MCID

الدلالة الإحصائية تُجيب عن "هل الفرق حقيقي؟" لكن الأهمية العملية تُجيب عن "هل الفرق يستحق الاهتمام؟". في علوم الرياضة، يُستخدم مفهومان مكملان:

أصغر تغيير ذو قيمة SWC

SWC = 0.2 × الانحراف المعياري البيني (Hopkins, 2000)

هو أصغر تحسن في الأداء يُعدّ ذا معنى تنافسياً. مثال:

  • إذا كان SD بين الرياضيين في زمن 100م = 0.5 ثانية
  • فإن SWC = 0.2 × 0.5 = 0.1 ثانية
  • أي تحسن أقل من 0.1 ث غير ذي قيمة تنافسية

الفرق الإكلينيكي الأدنى MCID

أصغر تغيير يُدركه المريض/الرياضي كتحسن ملموس في حياته

يُحدَّد عادةً من الدراسات الإكلينيكية باستخدام المرساة (anchor-based). مثال:

  • MCID لمقياس VAS للألم = 1.5 نقطة من أصل 10
  • MCID لزمن اختبار VO₂max = 3.5 مل/كجم/دقيقة
  • أي تحسن أقل من MCID لا يُحسّ به الفرد
الإطار المتكامل للتفسير
السيناريو الدلالة الإحصائية SWC / MCID القرار
المثالي p < 0.05 ≥ SWC الفرق حقيقي ومهم عملياً
مُضلِّل إيجابياً p < 0.05 < SWC حقيقي إحصائياً، لكن غير ذي قيمة عملية
محدودية القدرة p > 0.05 ≥ SWC مهم عملياً، لكن العينة صغيرة للكشف عنه
لا شيء p > 0.05 < SWC لا دلالة ولا أهمية عملية

الدرس 6.2 — فترات الثقة Confidence Intervals

فترة الثقة تعطي نطاقاً محتملاً لقيمة المجتمع الحقيقية، بدلاً من نقطة واحدة (مثل المتوسط).

التفسير الصحيح

"فترة الثقة 95%" تعني: إذا أجرينا الدراسة 100 مرة، فإن 95 منها ستُنتج فترات تحتوي على الوسط الحقيقي للمجتمع. ليس احتمال 95% أن تكون القيمة الحقيقية ضمن الفترة الحالية.

مثال: تقدير VO2max للمجتمع

عينة من 50 لاعباً: المتوسط = 52.5 ml/kg/min، SD = 6.0

فترة الثقة 95%: 52.5 ± (1.96 × 6/√50) = 52.5 ± 1.66 = [50.8, 54.2]

التفسير: نحن واثقون بنسبة 95% أن متوسط VO2max الحقيقي لكل اللاعبين يقع بين 50.8 و 54.2.

العلاقة بين CI و p-value

إذا كانت فترة الثقة 95% للفرق بين مجموعتين لا تحتوي على الصفر → فإن p < 0.05 (الفرق دال).

حدود NHST والنزاهة البحثية

اختبار الفرضيات أداة نافعة، لكنه يصبح خطيراً عندما يُعامل كآلة لإنتاج قرار "دال/غير دال" من غير تقدير لحجم الأثر، فترات الثقة، جودة التصميم، والشفافية التحليلية.

ما الذي لا تقوله القيمة الاحتمالية؟
  • لا تقول إن احتمال صحة الفرضية العدمية هو p.
  • لا تقول إن النتيجة مهمة عملياً.
  • لا تعوض ضعف التصميم أو عينة صغيرة أو قياس غير ثابت.
  • لا تمنحك إذناً بإخفاء التحليلات غير المناسبة أو غير الدالة.
P-hacking وتحيز النشر

يحدث P-hacking عندما يغيّر الباحث التحليلات أو يستبعد قيماً أو يختبر فرضيات متعددة بعد رؤية البيانات حتى يحصل على p < 0.05، ثم يبلّغ عن النتيجة المختارة فقط. في علوم الرياضة قد يؤدي ذلك إلى قرارات تدريبية أو علاجية خاطئة.

  • سجّل الفرضيات وخطة التحليل مسبقاً كلما أمكن.
  • أبلغ عن جميع النتائج الأساسية، لا النتائج الدالة فقط.
  • صحح المقارنات المتعددة عندما تختبر عدداً كبيراً من الفرضيات.
  • اجعل حجم الأثر وفترة الثقة جزءاً من القرار، لا ملحقاً شكلياً.
الجسر إلى الإحصاء البايزي

هذه القيود لا تعني ترك الإحصاء التكراري، بل استخدامه بمسؤولية. في الوحدة 16 ستتعلم كيف يقدم الإحصاء البايزي طريقة أخرى للتفكير في الدليل عبر التوزيعات السابقة واللاحقة وعوامل بايز.

محاكي اختيار الاختبار

أنت الآن تعرف ما يكفي لاستخدام المحاكي بوعي: ليس لاختيار اختبار آلياً، بل لمراجعة منطق القرار. بعد كل وحدة جديدة، عُد إلى المحاكي ولاحظ كيف تتغير الخيارات عندما تتوسع أدواتك.

تنظيم جديد: الأقسام التالية باقية حالياً كمرجع انتقالي، لكن المسار الرسمي الجديد يدرس تفاصيل اختبارات المقارنة في الوحدة السابعة: مقارنة المجموعات.

الدرس 6.3 — اختبار t t-test

يُستخدم لمقارنة متوسط مجموعتين. ثلاثة أنواع رئيسية:

النوع متى يُستخدم؟ مثال رياضي
مستقل (Independent) مجموعتان مختلفتان من الأفراد مقارنة قوة القبضة بين لاعبي كرة القدم وكرة السلة
مرتبط (Paired) نفس الأفراد في وضعين مختلفين مقارنة أداء اللاعبين قبل وبعد برنامج تدريبي
عينة واحدة (One-sample) مقارنة عينة بقيمة مرجعية معروفة مقارنة متوسط VO2max لفريق بمعيار النخبة الوطنية
شروط اختبار t
  • البيانات كمية متصلة (نسبية أو فاصلة)
  • التوزيع طبيعي (أو n ≥ 30 لكل مجموعة)
  • تباين متقارب بين المجموعات (للاختبار المستقل)
  • استقلالية المشاهدات

الدرس 6.4 — تحليل التباين ANOVA

يُستخدم لمقارنة متوسطات ثلاث مجموعات أو أكثر. لماذا لا نستخدم t-test متعدداً؟ لأن ذلك يزيد من احتمال الخطأ من النوع الأول (مشكلة المقارنات المتعددة).

النوع العوامل مثال رياضي
ANOVA أحادي الاتجاه (One-way) عامل واحد بـ 3+ مستويات مقارنة القوة بين لاعبي (كرة قدم، سلة، طائرة، سباحة)
ANOVA ثنائي الاتجاه (Two-way) عاملان (مع تأثيراتهما التفاعلية) تأثير (نوع الرياضة) و(الجنس) على القوة + تفاعلهما
ANOVA بإجراءات متكررة (Repeated Measures) نفس الأفراد عبر زمن/شروط تغير لياقة اللاعبين عبر (قبل، أسبوع 4، أسبوع 8، أسبوع 12)
مشكلة المقارنات المتعددة ومعدل الخطأ الأسري FWER

لماذا لا نُجري t-tests متكررة بدلاً من ANOVA؟ لأن كل اختبار إضافي يزيد من احتمال الخطأ من النوع الأول:

  • 3 مجموعات → 3 مقارنات: FWER = 1 − (0.95)³ = 14.3%
  • 4 مجموعات → 6 مقارنات: FWER = 1 − (0.95)⁶ = 26.5%
  • 5 مجموعات → 10 مقارنات: FWER = 1 − (0.95)¹⁰ = 40.1%

ANOVA تضبط هذا الخطأ بإجراء اختبار واحد. ثم تأتي اختبارات Post-hoc لتحديد المجموعات المختلفة مع ضبط التعددية.

اختبارات المقارنات البعدية Post-hoc Tests

متى كان اختبار F دالاً، نُجري مقارنات زوجية بعدية مع تصحيح لمستوى الدلالة. اختيار الاختبار يعتمد على طبيعة البيانات:

الاختبار متى يُستخدم؟ التحفظية التوصية
Tukey HSD أحجام متساوية، تباينات متساوية معتدل الأكثر شيوعاً في علوم الرياضة
Bonferroni أي تصميم — يقسم α على عدد المقارنات محافظ جداً لعدد مقارنات صغير (≤ 5)
Games-Howell أحجام غير متساوية أو تباينات غير متساوية معتدل الأفضل عند عدم استيفاء تجانس التباين (Violation of Assumptions)
Scheffé أي مقارنات بما فيها المُركَّبة الأكثر تحفظاً عند الحاجة لمقارنات خطية معقدة
Dunnett مقارنة جميع المجموعات بمجموعة ضابطة واحدة معتدل دراسات التدخل مع ضابطة
مثال: ANOVA + Tukey HSD

دراسة تقارن VO₂max بين 3 مجموعات تدريبية (هوائي، مقاومة، مختلط):

  • ANOVA: F(2, 57) = 8.45، p = 0.001 ← يوجد فرق بين المجموعات
  • Tukey HSD: هوائي > مقاومة (p = 0.001)، هوائي > مختلط (p = 0.04)، مقاومة ≈ مختلط (p = 0.28)

التفسير: التدريب الهوائي يتفوق على كلا النوعَين الآخرَين في تطوير VO₂max، بينما لا يختلف المختلط معنوياً عن المقاومة.

تحليل التباين للقياسات المتكررة Repeated Measures ANOVA

أكثر تصاميم ANOVA شيوعاً في أبحاث التدريب الرياضي: نفس الأفراد يُقاسون في أوقات أو شروط متعددة. يتميز بقدرته على عزل تباين الفروق الفردية، مما يزيد من قوته الإحصائية مقارنةً بـ ANOVA المجموعات المستقلة.

افتراض الكروية Sphericity

الافتراض الجوهري لـ Repeated Measures ANOVA هو الكروية: تباينات الفروق بين كل زوج من الأوقات متساوية. يُختبر باختبار Mauchly W:

  • إذا كان p (Mauchly) > 0.05: الكروية مستوفاة — استخدم النتائج كما هي.
  • إذا كان p (Mauchly) < 0.05: انتُهكت الكروية — طبّق تصحيح Greenhouse-Geisser (ε) أو Huynh-Feldt على درجات الحرية.
  • كلما اقترب ε من 1، كانت بيانات أكثر قرباً من الكروية المثالية.
مثال محلول: برنامج تدريبي 12 أسبوعاً

البيانات: قياسات VO₂max (مل/كجم/دقيقة) لـ 15 رياضياً في 4 نقاط زمنية:

النقطة الزمنية الأسبوع 0 (قبل) الأسبوع 4 الأسبوع 8 الأسبوع 12
المتوسط 42.3 45.1 47.8 50.2
الانحراف المعياري 4.8 4.6 5.0 5.1
1
Mauchly W = 0.62، p = 0.09 → الكروية مستوفاة (p > 0.05)
2
F(3, 42) = 24.7، p < 0.001، η²_p = 0.64 (حجم أثر كبير جداً)
3
Bonferroni post-hoc: كل مقارنتين متتاليتين دالتان (p < 0.05) — التطور مستمر ومعنوي في كل مرحلة

الإبلاغ: "أظهر تحليل التباين للقياسات المتكررة تأثيراً دالاً للزمن على VO₂max [F(3, 42) = 24.7، p < 0.001، η²_p = 0.64]. كشفت مقارنات Bonferroni البعدية عن تحسن معنوي في كل مرحلة خلال الـ 12 أسبوعاً."

المكافئ اللامعلمي: اختبار فريدمان Friedman Test

عند عدم استيفاء الطبيعية مع قياسات متكررة، استبدل Repeated Measures ANOVA بـ اختبار فريدمان. يعتمد على ترتيب القيم بدلاً من قيمها الفعلية، وهو الأنسب للبيانات الترتيبية أو المنحرفة بشدة.

الدرس 6.5 — اختبار كاي تربيع Chi-Square χ²

يُستخدم للبيانات الفئوية (الاسمية/الترتيبية). يختبر:

  • Goodness of fit: هل توزيع العينة يطابق توزيعاً متوقعاً؟
  • Independence: هل متغيران فئويان مستقلان؟
مثال: توزيع إصابات حسب نوع الرياضة
نوع الإصابة كرة القدم كرة السلة السباحة
عضلية 45 30 15
مفاصل 25 40 10
عظام 20 15 5

هل نوع الإصابة مستقل عن نوع الرياضة؟ اختبار χ² يجيب على هذا السؤال.

شروط χ²
  • جميع التكرارات المتوقعة ≥ 5 (أو على الأقل 80% منها)
  • البيانات فئوية (اسمية أو ترتيبية)
  • المشاهدات مستقلة

الدرس 6.6 — الاختبارات اللامعلمية Non-parametric Tests

تُستخدم عندما لا تُستوفى شروط الاختبارات المعلمية (الطبيعية، التباين المتساوي، البيانات الفاصلة).

الاختبار المعلمي البديل اللامعلمي متى يُستخدم؟
Independent t-test Mann-Whitney U مجموعتان، بيانات غير طبيعية
Paired t-test Wilcoxon Signed-Rank عينتان مرتبطتان، بيانات غير طبيعية
One-way ANOVA Kruskal-Wallis H 3+ مجموعات، بيانات غير طبيعية
Pearson Correlation Spearman's ρ بيانات ترتيبية أو غير خطية
متى تختار اللامعلمي؟
  • البيانات ترتيبية (وليست فاصلة)
  • التوزيع شديد الانحراف مع n < 30
  • وجود قيم شاذة شديدة
  • العينة صغيرة جداً (n < 15)