الوحدة السابعة: مقارنة المجموعات

تمثل مقارنة المجموعات الجسر بين السؤال البحثي والقرار الإحصائي. لا يكفي أن نسأل "هل يوجد فرق؟" بل نحدد أولاً نوع المتغير، وعدد المجموعات، وهل القياسات مستقلة أم مرتبطة، ثم نختار الاختبار الذي يطابق التصميم والافتراضات.

في علوم الرياضة قد نقارن لاعبي رياضتين في السرعة، أو نقارن الفريق نفسه قبل وبعد برنامج تدريبي، أو نقارن ثلاث جرعات تدريبية، أو نفحص هل نوع الإصابة مرتبط بالمركز داخل الملعب. كل مثال من هذه الأمثلة يحتاج اختباراً مختلفاً، لكن منطق القرار واحد: تصميم واضح، افتراضات مفحوصة، حجم أثر، وتفسير عملي.

مقارنة مجموعتين

عند وجود مجموعتين فقط يكون القرار الأول هو: هل الشخص نفسه قيس مرتين، أم لدينا مجموعتان مستقلتان؟ الاستقلالية هنا ليست تفصيلاً فنياً؛ إنها تحدد صيغة الخطأ المعياري ودرجات الحرية والاختبار المناسب.

السؤال البحثي التصميم الاختبار المعلمي البديل اللامعلمي
هل تختلف مجموعتان مستقلتان في متوسط متغير كمي؟ لاعبو كرة قدم مقابل لاعبي كرة سلة في الوثب العمودي Independent samples t-test Mann-Whitney U
هل تغيرت المجموعة نفسها بين قياسين؟ القوة العضلية قبل وبعد برنامج تدريبي لثمانية أسابيع Paired samples t-test Wilcoxon signed-rank
هل تختلف عينة واحدة عن قيمة مرجعية؟ VO2max لفريق جامعي مقارنة بمعيار النخبة One-sample t-test Sign test أو Wilcoxon one-sample
هل تختلف نسبتان أو فئتان؟ نسبة حدوث الإصابة بين برنامجين وقائيين اختبار z للنسب أو Chi-square Fisher's exact test عند صغر التكرارات

Independent samples t-test

يقارن متوسطين من مجموعتين لا يتكرر فيهما الفرد نفسه. الفرضية الصفرية تقول إن الفرق الحقيقي بين المتوسطين يساوي صفراً. إذا كان تباين المجموعتين غير متقارب، استخدم نسخة Welch لأنها أكثر مرونة مع عدم تجانس التباين.

مثال: هل متوسط زمن العدو 30 متراً يختلف بين لاعبي كرة القدم ولاعبي كرة اليد؟ أبلغ عن المتوسط والانحراف المعياري لكل مجموعة، قيمة t، درجات الحرية، قيمة p، وفترة الثقة للفرق.

Paired samples t-test

يقارن متوسط الفروق داخل الأفراد، وليس متوسطات مجموعتين منفصلتين. هنا نحلل فرق كل لاعب بين القياس القبلي والبعدي، ولذلك يكون افتراض الاعتدالية متعلقاً بتوزيع الفروق.

مثال: تحسن متوسط القوة القصوى من 92 كجم إلى 101 كجم بعد برنامج مقاومة. السؤال الإحصائي: هل متوسط التحسن 9 كجم أكبر من التذبذب المتوقع بالصدفة؟

قبل الاختبار
  • حدد وحدة التحليل: لاعب، مباراة، محاولة، أو فريق. لا تعامل المحاولات المتكررة للاعب واحد كأنها أفراد مستقلون.
  • راجع وحدة 4 لفحص الاعتدالية والقيم الشاذة، وميّز بين القيم الخاطئة والقيم الحقيقية المتطرفة.
  • استخدم Levene's test أو Welch correction عند الشك في تجانس التباين بين المجموعات المستقلة.
  • أبلغ عن حجم الأثر مع الاختبار: Cohen's d أو Hedges' g للعينات الصغيرة، ويفضل إضافة فترة ثقة لحجم الأثر.
مثال إبلاغ

كان متوسط الوثب العمودي أعلى لدى لاعبي كرة السلة (M = 54.2 cm, SD = 6.8) مقارنة بلاعبي كرة القدم (M = 48.7 cm, SD = 7.1). أظهر اختبار t للعينات المستقلة فرقاً دالاً، t(38) = 2.49, p = 0.017, d = 0.79، مما يشير إلى أثر متوسط إلى كبير عملياً.

مقارنة المتغيرات الفئوية: كاي تربيع

عندما تكون النتيجة فئوية، لا نقارن متوسطات بل نقارن تكرارات أو نسباً. مثال ذلك: هل نوع الإصابة مرتبط بنوع الرياضة؟ هل الالتزام بالبرنامج الوقائي يختلف بين الذكور والإناث؟ وهل توزيع المراكز في العينة يطابق التوزيع المتوقع في المجتمع؟

الاستخدام مثال شرط مهم حجم الأثر
Goodness of fit هل توزيع الإصابات يطابق التوزيع المتوقع؟ فئات متبادلة الحصر وتكرارات متوقعة كافية Cramer's V أو نسبة الانحراف عن المتوقع
Test of independence هل نوع الإصابة مستقل عن نوع الرياضة؟ استقلالية المشاهدات في جدول تقاطعي Phi لجدول 2×2 أو Cramer's V للجداول الأكبر
Fisher's exact test إصابات نادرة في عينة صغيرة مناسب عند انخفاض التكرارات المتوقعة Odds ratio مع فترة ثقة
McNemar test نفس اللاعبين: مصاب/غير مصاب قبل وبعد تدخل وقائي بيانات ثنائية مرتبطة نسبة التغير في الحالات غير المتطابقة
كيف نفكر في جدول كاي تربيع؟

إذا كان لدينا جدول نوع الرياضة × نوع الإصابة، يقارن الاختبار بين التكرارات المشاهدة والتكرارات المتوقعة لو لم توجد علاقة. كلما كبر الفرق بين المشاهد والمتوقع زادت قيمة chi-square. لكن الدلالة وحدها لا تكفي، فقد تصبح الفروق الصغيرة دالة في العينات الكبيرة؛ لذلك نضيف Cramer's V لتقدير قوة العلاقة.

مقارنة ثلاث مجموعات أو أكثر: ANOVA

يستخدم تحليل التباين ANOVA عندما نريد مقارنة ثلاثة متوسطات أو أكثر. فكرته الأساسية هي مقارنة التباين بين المجموعات بالتباين داخل المجموعات. إذا كان التباين بين المجموعات كبيراً مقارنة بالتباين داخلها، فهذا دليل على أن المتوسطات ليست كلها متساوية.

سبب استخدام ANOVA بدلاً من إجراء اختبارات t كثيرة هو حماية معدل الخطأ من النوع الأول. كل اختبار إضافي يزيد احتمال الحصول على نتيجة دالة بالصدفة؛ لذلك نبدأ باختبار شامل، ثم ننتقل إلى المقارنات البعدية إذا كانت النتيجة دالة.

One-way ANOVA

عامل مستقل واحد بثلاثة مستويات أو أكثر. مثال: مقارنة القوة القصوى بين لاعبي كرة القدم، كرة السلة، وألعاب القوى.

بعد الدلالة: استخدم Tukey عند تجانس التباين، Bonferroni للمقارنات المحددة مسبقاً، أو Games-Howell عند عدم تجانس التباين.

Two-way ANOVA

عاملان مستقلان، مثل نوع الرياضة × الجنس. يختبر التأثير الرئيسي لكل عامل ويختبر كذلك التفاعل بينهما.

انتبه: وجود تفاعل دال يعني أن أثر أحد العاملين يختلف حسب مستوى العامل الآخر، وعندها يصبح تفسير التأثيرات الرئيسية وحدها ناقصاً.

ANCOVA

يقارن المجموعات بعد ضبط متغير مصاحب مثل العمر، كتلة الجسم، أو القياس القبلي. يفيد عندما نريد مقارنة برامج تدريبية مع تقليل أثر الفروق الابتدائية بين المشاركين.

مثال: مقارنة تحسن السرعة بين ثلاث برامج تدريبية بعد ضبط السرعة القبلية.

MANOVA

يستخدم عندما تكون لدينا عدة نتائج كمية مترابطة، مثل القوة، السرعة، والمرونة معاً. يقلل الحاجة إلى اختبارات منفصلة كثيرة، لكنه يحتاج عينة كافية وتفسيراً حذراً.

مثال: أثر برنامج تدريبي على حزمة مؤشرات الأداء البدني بدلاً من مؤشر واحد.

افتراض ANOVA كيف نفحصه؟ ما العمل عند عدم الاستيفاء (Violation of Assumptions)؟
استقلالية المشاهدات من تصميم الدراسة وطريقة أخذ العينة استخدم نماذج مختلطة إذا كانت البيانات متداخلة أو متكررة
اعتدالية البواقي داخل المجموعات Q-Q plot، Shapiro-Wilk، وفحص القيم الشاذة تحويل مناسب، Bootstrap، أو Kruskal-Wallis عند الحاجة
تجانس التباين Levene's test ومقارنة الانحرافات المعيارية Welch ANOVA أو Games-Howell للمقارنات البعدية
قالب إبلاغ مختصر

أظهر تحليل التباين أحادي الاتجاه فرقاً دالاً بين المجموعات في VO2max، F(2, 57) = 8.45, p = 0.001, omega squared = 0.19. أوضحت مقارنات Tukey أن مجموعة التدريب الهوائي تفوقت على المقاومة والمختلط، بينما لم يظهر فرق دال بين المقاومة والمختلط.

القياسات المتكررة والتصاميم المختلطة

عندما نقيس اللاعبين أنفسهم أكثر من مرة، تصبح القياسات مرتبطة. تجاهل هذا الارتباط يؤدي غالباً إلى تقدير خاطئ للخطأ المعياري. لذلك نستخدم اختبارات تقارن التغير داخل الفرد أو نماذج تراعي البنية المتكررة للبيانات.

التصميم متى يستخدم؟ افتراض أو قرار خاص مثال رياضي
Repeated-measures ANOVA نفس اللاعبين في ثلاث نقاط زمنية أو أكثر Sphericity عبر Mauchly's test القياس قبل، منتصف، وبعد موسم تدريبي
Mixed ANOVA عامل بيني + عامل داخل الأفراد تفسير تفاعل المجموعة × الزمن برنامجان تدريبيان يقاسان قبل وبعد وبعد متابعة
Linear mixed-effects model بيانات غير متوازنة أو قياسات مفقودة أو تداخل داخل فرق تحديد التأثيرات الثابتة والعشوائية أحمال تدريب يومية متكررة داخل لاعبين وفرق
Friedman test قياسات متكررة غير طبيعية أو ترتيبية الاختبار يعتمد على الرتب تقييم الألم في ثلاث مراحل علاجية
الكروية

الكروية تعني أن تباينات الفروق بين كل زوج من النقاط الزمنية متقاربة. إذا كان Mauchly p < 0.05 فطبّق Greenhouse-Geisser أو Huynh-Feldt على درجات الحرية قبل الإبلاغ عن قيمة F. عند وجود بيانات مفقودة أو تباعد زمني غير منتظم، تكون النماذج المختلطة غالباً أكثر مناسبة من repeated-measures ANOVA التقليدي.

مثال تفاعل

إذا تحسنت مجموعة التدريب المتقطع عالي الشدة بوضوح من القياس القبلي إلى البعدي، بينما بقيت مجموعة التدريب المستمر شبه ثابتة، فالسؤال الأهم ليس "هل يوجد فرق بين المجموعتين؟" ولا "هل يوجد تغير مع الزمن؟" بل: هل يختلف نمط التغير عبر الزمن بين المجموعتين؟ هذا هو تفاعل المجموعة × الزمن.

البدائل اللامعلمية

ليست الاختبارات اللامعلمية "خطة ب ضعيفة"، بل اختيار صحيح عندما تكون البيانات ترتيبية، منحرفة بشدة، أو تحتوي قيماً شاذة مؤثرة مع عينات صغيرة. معظمها لا يقارن المتوسطات مباشرة، بل يعتمد على الرتب أو الإشارات، لذلك يجب أن ينعكس ذلك في التفسير.

المعلمي اللامعلمي متى أستخدمه؟ حجم الأثر المناسب
Independent t-testMann-Whitney Uمجموعتان مستقلتان مع بيانات ترتيبية أو انحراف قويr أو rank-biserial correlation
Paired t-testWilcoxon signed-rankقياسان مرتبطان مع فروق غير معتدلةr
One-way ANOVAKruskal-Wallis Hثلاث مجموعات مستقلة أو أكثر مع رتب أو انحراف واضحepsilon squared
Repeated-measures ANOVAFriedman testثلاث قياسات مرتبطة أو أكثر مع بيانات ترتيبيةKendall's W
Pearson correlationSpearman correlationعلاقة رتيبة أو متغيرات ترتيبيةrho مع فترة ثقة إن أمكن
تفسير مهم

عند استخدام Mann-Whitney أو Kruskal-Wallis لا تقل تلقائياً إن "المتوسطات تختلف" إلا إذا كان ذلك مدعوماً بوصف البيانات. الأفضل أن تقول إن توزيع القيم أو الرتب اختلف بين المجموعات، ثم تعرض الوسيط والمدى الربيعي إلى جانب الرسم المناسب.

الإبلاغ العلمي

التقرير الجيد لا يكتفي باسم الاختبار. القارئ يحتاج أن يرى التصميم، الإحصاءات الوصفية، نتيجة الاختبار، حجم الأثر، وفترة الثقة، ثم جملة تفسيرية تربط النتيجة بسياق الأداء أو الصحة الرياضية.

ما يجب ذكره لماذا؟ مثال مختصر
الإحصاءات الوصفية توضح اتجاه الفرق وحجمه قبل الدلالة M = 48.7, SD = 7.1 أو median = 4, IQR = 2
الاختبار ودرجات الحرية يسمح بتقييم التحليل وإعادة حسابه t(28) = 2.31 أو F(2, 57) = 8.45
قيمة p توضح قوة الدليل ضد الفرضية الصفرية p = 0.028، وليس فقط p < 0.05
حجم الأثر وفترة الثقة يميز الأهمية العملية عن الدلالة الإحصائية d = 0.62, 95% CI [0.12, 1.10]
المقارنات البعدية عند الحاجة تحدد أين يوجد الفرق بعد اختبار شامل دال Tukey أو Games-Howell أو Dunn مع تصحيح
قائمة قرار سريعة
  • متغير النتيجة كمي ومجموعتان مستقلتان: independent t-test أو Welch t-test.
  • متغير النتيجة كمي ونفس المشاركين قيسوا مرتين: paired t-test.
  • متغير النتيجة كمي وثلاث مجموعات مستقلة أو أكثر: one-way ANOVA أو Welch ANOVA.
  • متغير النتيجة كمي مع عاملين مستقلين: two-way ANOVA، مع فحص التفاعل أولاً.
  • قياسات متكررة عبر الزمن: repeated-measures ANOVA أو mixed-effects model.
  • متغير النتيجة فئوي: chi-square، Fisher's exact، أو McNemar حسب التصميم.
  • بيانات ترتيبية أو افتراضات غير مستوفاة بشدة: اختر البديل اللامعلمي المناسب وفسر الرتب أو الوسيط.
  • اذكر التصميم، الاختبار، الافتراضات التي فُحصت، وحجم الأثر.
  • لا تكتف بعبارة "دال/غير دال"؛ اربط النتيجة بحجم الأثر وفترة الثقة والأهمية العملية.
  • عند استخدام بديل لامعلمي، اشرح سبب الاختيار بدلاً من الاعتذار عنه.
  • إذا كان الاختبار شاملاً مثل ANOVA أو Kruskal-Wallis، وضح طريقة المقارنات البعدية وتصحيح تعدد المقارنات.

نقطة تحقق: محاكي اختيار الاختبار

بعد هذه الوحدة، يفترض أن تستطيع تبرير اختيارك بين t-test وANOVA وكاي تربيع والبدائل اللامعلمية والنماذج المختلطة. استخدم المحاكي لاختبار قرارك، ثم قارنه بمنطق التصميم والافتراضات وحجم الأثر المناسب.