الوحدة الرابعة: الاحتمال والتوزيع الطبيعي

مقدمة: تبني هذه الوحدة أساس الإحصاء الاستدلالي: كيف نستخدم الاحتمال لفهم عدم اليقين، وكيف تتحول العينة الصغيرة إلى دليل عن مجتمع أكبر، ولماذا تعتمد الاختبارات اللاحقة على التوزيع الطبيعي، الخطأ المعياري، وتوزيع t.

في البحث الرياضي، لا نعرف الحقيقة الكاملة عن جميع اللاعبين أو جميع المباريات؛ بل نأخذ عينة ونحاول تقدير ما يحدث في المجتمع. لذلك لا تكون النتيجة "يقيناً" بل حكماً احتماليّاً: ما مدى ندرة هذه النتيجة إذا كانت الفرضية الصفرية صحيحة؟ وما مدى دقة تقديرنا؟

الدرس 4.1 — أساسيات الاحتمالات Probability

أهداف التعلم

  • فهم الاحتمال بوصفه لغة كمية للتعامل مع عدم اليقين في البيانات الرياضية.
  • تطبيق قواعد الجمع والضرب والاحتمال الشرطي على مواقف بحثية حقيقية.
  • التمييز بين الاستقلال، الترابط، والخطر النسبي عند تفسير الجداول.
  • ربط الاحتمالات بالقيمة الاحتمالية، فترات الثقة، وتفسير الاختبارات الإحصائية.

من الاحتمال إلى الاستدلال

الاحتمال هو مقياس عددي لدرجة عدم التأكد من وقوع حدث معين. تتراوح قيمته بين 0 (مستحيل الوقوع) و 1 (مؤكد الوقوع)، أو بين 0% و 100%. أما الاستدلال الإحصائي فيستخدم هذه اللغة للإجابة عن سؤال أعمق: هل ما رأيناه في العينة يمكن أن يحدث غالباً بالصدفة، أم أنه دليل على فرق أو علاقة حقيقية؟

احتمال وصفي

يصف ما حدث أو ما قد يحدث بناءً على بيانات متاحة. مثال: نسبة نجاح لاعب في ركلات الجزاء خلال الموسم = 78%.

احتمال استدلالي

يقيّم مدى ندرة نتيجة بحثية تحت افتراض معين. مثال: إذا لم يكن للبرنامج التدريبي أثر، ما احتمال أن نرى تحسناً بهذا الحجم أو أكبر؟

المفاهيم الأساسية:
  • التجربة العشوائية: عملية تؤدي إلى نتيجة غير مؤكدة مسبقاً، مثل نتيجة مباراة أو حدوث إصابة في أسبوع تدريبي.
  • فضاء العينة (Sample Space): جميع النتائج الممكنة للتجربة. مثال مباراة كرة قدم: فوز، تعادل، خسارة.
  • الحدث (Event): مجموعة جزئية من فضاء العينة، مثل "الفوز" أو "حدوث إصابة".
  • الحدث المتمم: كل النتائج التي لا تحقق الحدث. إذا كان احتمال الإصابة 0.15 فإن احتمال عدم الإصابة 0.85.
  • الاستقلال: وقوع حدث لا يغير احتمال الحدث الآخر. إذا غيّر الحدث الأول احتمال الثاني فلدينا اعتماد أو ارتباط احتمالي.

أنواع الاحتمالات

النوع الوصف مثال من علوم الرياضة متى يفيد؟
الاحتمال الكلاسيكي يعتمد على تساوي فرص وقوع جميع النتائج. احتمال اختيار لاعب واحد عشوائياً من فريق مكوّن من 20 لاعباً. مناسب للألعاب أو الاختيارات العشوائية البسيطة.
الاحتمال التكراري يعتمد على البيانات التاريخية والتكرار النسبي. نسبة نجاح اللاعب في ركلات الجزاء بناءً على آخر 100 ركلة. مهم في التحليلات القائمة على سجلات الأداء والإصابات.
الاحتمال الذاتي يعتمد على تقدير الخبراء والظروف المحيطة. توقعات المدرب لفرص الفوز بناءً على الإصابات وحالة المنافس. يستخدم عند نقص البيانات أو في التوقعات المبكرة.
الاحتمال الشرطي احتمال حدث بعد معرفة أن حدثاً آخر وقع. احتمال الإصابة بشرط أن اللاعب شارك في تدريب مكثف. أساسي في تحليل المخاطر والتشخيص والتنبؤ.

قواعد الاحتمالات الأساسية

1. قاعدة الجمع (OR)

تستخدم لحساب احتمال وقوع حدث A أو حدث B.

P(A ∪ B) = P(A) + P(B) − P(A ∩ B)

إذا كان الحدثان مانعين، مثل فوز وخسارة في النتيجة نفسها، فإن P(A ∩ B) = 0.

2. قاعدة الضرب (AND)

تستخدم لحساب احتمال وقوع حدثين معاً.

P(A ∩ B) = P(A) × P(B)

هذه الصيغة المباشرة صحيحة عند الاستقلال. عند عدم الاستقلال نستخدم P(A ∩ B) = P(A | B) × P(B).

الاحتمال الشرطي
P(A | B) = P(A ∩ B) / P(B)
نقرأها: احتمال وقوع A بشرط أن B قد وقع. يجب أن يكون P(B) أكبر من صفر.
مثال تطبيقي محلول: التدريب المكثف وخطر الإصابة

السياق: دراسة العلاقة بين التدريب المكثف وإصابات العضلات في فريق مكوّن من 100 لاعب.

أُصيب لم يُصَب المجموع
تدريب مكثف 10 30 40
تدريب عادي 5 55 60
المجموع 15 85 100
1
P(إصابة | تدريب مكثف) = 10 / 40 = 0.25 (25%)
2
P(إصابة | تدريب عادي) = 5 / 60 = 0.083 (8.3%)
3
الخطر النسبي = 0.25 / 0.083 = 3.0
4
الفرق المطلق في الخطر = 25% − 8.3% = 16.7 نقطة مئوية

استنتاج: اللاعبون في التدريب المكثف تعرضوا لخطر إصابة أعلى بثلاثة أضعاف تقريباً. لاحقاً، سنسأل: هل هذا الفرق كبير بما يكفي ليتجاوز التذبذب العشوائي؟ هنا يبدأ دور كاي تربيع، فترات الثقة، والقيمة الاحتمالية.

الربط المفاهيمي: القيمة الاحتمالية (p-value) ليست احتمال صحة الفرضية الصفرية، بل احتمال الحصول على نتيجة مثل نتيجتنا أو أكثر تطرفاً إذا افترضنا أن الفرضية الصفرية صحيحة.

تطبيقات للتقييم

مستوى: التذكر والفهم

س1: إذا كان فضاء العينة لنتائج مباراة كرة قدم هو {فوز، خسارة، تعادل}، فما هو مجموع احتمالات هذه الأحداث؟

مستوى: التطبيق

س2: لاعب كرة سلة يسجل الرميات الحرة بنسبة 80% (0.8). إذا رمى رميتين مستقلتين، فما احتمال أن ينجح في التسجيل في كليهما؟

الدرس 4.2 — التوزيعات الاحتمالية المنفصلة

التوزيع الاحتمالي يصف جميع القيم الممكنة لمتغير عشوائي واحتمال كل قيمة. في الدراسات الرياضية نستخدم التوزيعات المنفصلة عندما تكون النتيجة عدّاً أو فئة: عدد الإصابات، عدد النجاحات، عدد الأهداف، أو وجود/عدم وجود حدث.

التوزيع نوع السؤال مثال رياضي المعلمات الأساسية
Bernoulli محاولة واحدة: نجاح/فشل هل سجل اللاعب رمية حرة واحدة؟ p
Binomial عدد النجاحات في عدد ثابت من المحاولات عدد الرميات الناجحة من 10 محاولات n و p
Poisson عدد أحداث نادرة في زمن أو مساحة محددة عدد الإصابات في موسم أو عدد الأخطاء خلال مباراة λ
Geometric عدد المحاولات حتى أول نجاح كم محاولة يحتاج اللاعب حتى يسجل أول رمية؟ p

توزيع ذات الحدين Binomial Distribution

شروط تطبيق توزيع ذات الحدين

يجب توافر الشروط الأربعة قبل استخدام هذا التوزيع:

  1. عدد محاولات ثابت (n): مثلاً 5 رميات حرة محددة مسبقاً.
  2. كل محاولة تنتهي بنتيجة ثنائية: نجاح أو فشل، مصاب أو غير مصاب، التزام أو عدم التزام.
  3. احتمال النجاح (p) ثابت: لا يتغير بين المحاولات. إذا أثر التعب في المحاولات اللاحقة فإن p ليس ثابتاً.
  4. المحاولات مستقلة: نتيجة محاولة لا تؤثر في المحاولة التالية.
P(X = k) = C(n,k) × pᵏ × (1−p)^(n−k)
n = عدد المحاولات | k = عدد النجاحات المطلوبة | p = احتمال النجاح في محاولة واحدة
مثال: رامي سلة نسبة نجاحه 70%، يرمي 5 رميات

ما احتمال تسجيل 4 رميات بالضبط؟

1
C(5,4) = 5! / (4! × 1!) = 5
2
P(X=4) = 5 × (0.7)⁴ × (0.3)¹ = 0.360 (36%)
3
القيمة المتوقعة E(X) = n × p = 5 × 0.7 = 3.5 رمية ناجحة

تفسير: تسجيل 4 من 5 نتيجة معقولة جداً للاعب نسبة نجاحه 70%. أما تسجيل 5 من 5 فليس مستحيلاً، لكنه أقل احتمالاً.

توزيع بواسون Poisson Distribution

يستخدم بواسون لعدّ الأحداث التي تقع في فترة محددة عندما تكون الأحداث نادرة نسبياً ومتوسط حدوثها معروفاً. لا نحتاج إلى عدد محاولات ثابت كما في التوزيع الثنائي؛ نحتاج إلى معدل حدوث λ.

P(X = k) = (e^−λ × λᵏ) / k!
λ = متوسط عدد الأحداث في الفترة المحددة | k = عدد الأحداث المطلوب | e = 2.718
مثال: إصابات الرباط الصليبي

متوسط إصابات الرباط الصليبي في دوري ما = 3 إصابات في الموسم. ما احتمال حدوث 5 إصابات في الموسم القادم؟

1
P(X=5) = (e^−3 × 3⁵) / 5! = 0.101 (10.1%)

تفسير: هناك احتمال يقارب 10% لحدوث 5 إصابات في موسم واحد إذا كان المعدل الحقيقي 3 إصابات.

متى لا يصلح بواسون؟

إذا كانت الأحداث متجمعة بسبب عامل مشترك، مثل ملعب سيئ يزيد الإصابات في مباريات معينة، أو إذا تغير معدل الخطر عبر الموسم، فقد لا يكون افتراض المعدل الثابت مناسباً. عندها نحتاج نماذج أكثر مرونة مثل الانحدار البواسوني أو النماذج المختلطة.

الدرس 4.3 — التوزيع الطبيعي والدرجة المعيارية Normal Distribution & Z-Score

التوزيع الطبيعي، أو المنحنى الجرسي، هو أشهر التوزيعات المتصلة في الإحصاء. يوصف بمعلمتين: المتوسط μ الذي يحدد مركز التوزيع، والانحراف المعياري σ الذي يحدد درجة الانتشار حول المتوسط.

خصائص التوزيع الطبيعي

  • متماثل حول المتوسط.
  • المتوسط = الوسيط = المنوال.
  • المساحة الكلية تحت المنحنى = 1.
  • القيم القريبة من المتوسط أكثر شيوعاً من القيم البعيدة.

قاعدة 68-95-99.7

  • نحو 68% من القيم تقع داخل ±1 SD.
  • نحو 95% من القيم تقع داخل ±2 SD.
  • نحو 99.7% من القيم تقع داخل ±3 SD.
الدرجة المعيارية Z
Z = (X − μ) / σ
X = القيمة الفردية | μ = متوسط المجتمع | σ = الانحراف المعياري | Z = بُعد X عن المتوسط بوحدات الانحراف المعياري
قيمة Z التفسير مثال في الأداء الرياضي
0 القيمة تساوي المتوسط تماماً لاعب في متوسط الفريق
+1 أعلى من المتوسط بانحراف معياري واحد لياقة أعلى من معظم الفريق
−1 أقل من المتوسط بانحراف معياري واحد نتيجة تحتاج متابعة مقارنة بالمجموعة
+1.96 أو −1.96 تقريباً حدود 95% في التوزيع الطبيعي قيمة نادرة نسبياً إذا كان التوزيع طبيعياً
تطبيق: انتقاء المواهب بالـ Z-Score

المعطيات: متوسط VO2max للناشئين = 50 مل/كجم/دقيقة، σ = 5، التوزيع طبيعي. المطلوب: انتقاء أعلى 2.5% لياقةً.

1
أعلى 2.5% = الأفراد الذين تفوق قيمتهم 97.5% من العينة. من جدول Z: Z = +1.96
2
الحد الأدنى للاختيار: X = μ + Z×σ = 50 + 1.96×5 = 59.8 مل/كجم/دقيقة
3
القرار: يُختار كل ناشئ يُسجّل VO2max ≥ 60 مل/كجم/دقيقة تقريباً.

مهم: إذا كانت القيمة الأقل أفضل، مثل زمن سباق 100م، فإن Z السالب قد يعني أداءً أفضل. دائماً فسّر اتجاه المتغير قبل الحكم على الدرجة المعيارية.

الدرس 4.4 — نظرية الحد المركزي Central Limit Theorem (CLT)

تُعدّ نظرية الحد المركزي أحد أهم المبادئ في علم الإحصاء الاستدلالي. فهمها يفتح الباب لاختبارات t وANOVA وفترات الثقة، لأنها تشرح لماذا يمكننا استخدام التوزيع الطبيعي لوصف متوسطات العينات حتى عندما لا تكون البيانات الفردية طبيعية تماماً.

نظرية الحد المركزي CLT

إذا سحبنا عينات عشوائية متكررة حجمها n من أي مجتمع، فإن توزيع متوسطات تلك العينات يقترب من التوزيع الطبيعي كلما زاد حجم العينة. لا يعني ذلك أن البيانات الأصلية أصبحت طبيعية؛ بل يعني أن متوسطات العينات تصبح أكثر انتظاماً وقابلية للاستدلال.

ملاحظة مهمة: يعتمد حجم العينة الكافي لتقريب توزيع المتوسطات من الطبيعي على درجة انحراف المجتمع الأصلي. للبيانات شديدة الانحراف أو ذات القيم الشاذة المؤثرة، قد يحتاج حجم عينة أكبر من 30، وقد لا تكون CLT كافية وحدها دون تحويل بيانات أو استخدام طرق لامعلمية.

العينة، المجتمع، وتوزيع المعاينة

المفهوم المعنى مثال
المجتمع كل الأفراد أو القياسات التي نهتم بها جميع لاعبي الدوري الجامعي
العينة جزء من المجتمع نقيسه فعلياً 40 لاعباً اختيروا للدراسة
الإحصاء قيمة محسوبة من العينة متوسط VO2max في العينة
المعلم قيمة حقيقية في المجتمع، غالباً لا نعرفها متوسط VO2max الحقيقي لجميع لاعبي الدوري
توزيع المعاينة توزيع إحصاء العينة لو كررنا أخذ العينات كثيراً توزيع متوسطات VO2max لعشرات العينات المتكررة

لماذا هذا مهم في علوم الرياضة؟

كثير من البيانات الرياضية لا تتبع التوزيع الطبيعي تماماً، مثل عدد الإصابات، أوقات التعافي، أو مقاييس الألم. غير أن نظرية الحد المركزي تبرر استخدام كثير من الاختبارات المعلمية على متوسطات العينات متى كان حجم العينة كافياً وكانت المشاهدات مستقلة ولا توجد قيم شاذة مهيمنة.

مثال توضيحي: توزيع أوقات التعافي من الإصابة

المجتمع: أوقات التعافي من إصابات العضلة الرباعية في دوري المحترفين. البيانات الأصلية منحرفة يميناً لأن بعض اللاعبين يتعافون ببطء شديد.

  • إذا سحبنا عينة واحدة n=5، فقد يكون متوسطها متأثراً جداً بلاعب واحد طويل التعافي.
  • إذا كررنا سحب عينات n=30، يصبح توزيع المتوسطات أقرب إلى الطبيعي.
  • النتيجة: يمكن استخدام t-test لمقارنة متوسط التعافي بين بروتوكولي علاج إذا كانت الافتراضات الأخرى مقبولة.

قاعدة عملية: n ≥ 30 مفيدة للانحراف الخفيف إلى المتوسط، لكن الانحراف الشديد أو القيم الشاذة الكبيرة قد يحتاجان تحويلات، Bootstrap، أو اختبارات لامعلمية.

الخطأ المعياري للمتوسط Standard Error of the Mean — SEM

نظرية الحد المركزي تخبرنا بشكل توزيع المتوسطات؛ أما الخطأ المعياري فيخبرنا بمدى انتشار تلك المتوسطات. كلما صغر الخطأ المعياري كان متوسط العينة أكثر دقة في تقدير متوسط المجتمع.

الخطأ المعياري للمتوسط
SEM = σ / √n    (أو)    SEM = s / √n
σ = الانحراف المعياري للمجتمع | s = الانحراف المعياري للعينة | n = حجم العينة
تطبيق: دقة تقدير VO2max

دراسة قاست VO2max لعينة n=25 من عدّائي المسافات: s = 6 مل/كجم/دقيقة، ومتوسط العينة = 58.0.

1
SEM = 6 / √25 = 6 / 5 = 1.2 مل/كجم/دقيقة
2
فترة الثقة 95% تقريباً = 58.0 ± 1.96 × 1.2 = 55.6 إلى 60.4
3
إذا زاد n إلى 100 مع نفس s، يصبح SEM = 6 / 10 = 0.6

تفسير: زيادة حجم العينة لا تقلل تشتت اللاعبين أنفسهم، لكنها تقلل عدم اليقين حول متوسط المجتمع.

فترات الثقة Confidence Intervals

فترة الثقة تعرض نطاقاً من القيم المعقولة للمعلم الحقيقي. إذا قلنا إن فترة الثقة 95% لمتوسط VO2max هي 55.6 إلى 60.4، فهذا لا يعني أن احتمال وقوع المتوسط الحقيقي داخل هذه الفترة بعد حسابها هو 95% بالمعنى الحرفي؛ بل يعني أن الطريقة المستخدمة ستنتج فترات تحتوي المعلم الحقيقي في نحو 95% من العينات المتكررة.

صيغة عامة لفترة الثقة
التقدير ± القيمة الحرجة × الخطأ المعياري
القيمة الحرجة تكون Z أو t حسب معرفة σ وحجم العينة.

توزيع ستيودنت t Student's t-Distribution

في الواقع العملي، نادراً ما يُعرف الانحراف المعياري للمجتمع. عند استبداله بالانحراف المعياري للعينة، يصبح عدم اليقين أكبر، ولذلك نستخدم توزيع t بدلاً من Z. كلما صغرت العينة زادت أذناب t، أي أصبحت القيم الحرجة أكبر وأكثر تحفظاً.

متى نستخدم Z؟

  • σ المجتمع معروف، وهذا نادر في الأبحاث التطبيقية.
  • حجم العينة كبير جداً، فيصبح t قريباً جداً من Z.
  • مثال: مقارنة قيمة فرد بمعيار منشور مع σ معروف.

متى نستخدم t؟

  • σ المجتمع غير معروف، وهو الوضع المعتاد.
  • نقدّر التباين بالانحراف المعياري للعينة.
  • مثال: مقارنة متوسط مجموعة تدريبية بمتوسط مجموعة ضابطة.
التوزيع أين يظهر لاحقاً؟ الفكرة الأساسية
Z الدرجات المعيارية، النسب، وبعض فترات الثقة الكبيرة توزيع طبيعي معياري متوسطه 0 وانحرافه 1
t اختبارات t وفترات الثقة للمتوسطات يشبه Z لكن بأذناب أثقل عند العينات الصغيرة
Chi-square اختبارات المتغيرات الفئوية وتقدير التباين يعتمد على مجموع مربعات قيم معيارية
F ANOVA والانحدار نسبة تباينين، مثل التباين بين المجموعات إلى داخلها
الربط بالوحدات القادمة

في وحدة فحص الافتراضات ستتأكد من أن البيانات مناسبة للتحليل. في وحدة اختبار الفرضيات ستستخدم القيمة الاحتمالية وفترات الثقة لاتخاذ القرار. وفي وحدة مقارنة المجموعات ستظهر توزيعات t وF وchi-square عملياً في t-test وANOVA وكاي تربيع.

حجم العينة حالة المجتمع الأصلي توزيع المتوسطات القرار العملي
أي n طبيعي تقريباً طبيعي تقريباً يمكن استخدام الاختبارات المعلمية غالباً
n ≥ 30 انحراف خفيف إلى متوسط قريب من الطبيعي بفضل CLT غالباً مناسب مع فحص القيم الشاذة
n < 15 منحرف بشدة أو يحتوي قيماً شاذة مؤثرة غير مستقر فكر في بديل لامعلمي أو Bootstrap
تنبيه — CLT لا تُلغي افتراض الطبيعية

نظرية الحد المركزي تنطبق على توزيع المتوسطات، وليس على البيانات الفردية. اختبار t للعينات الصغيرة مع بيانات منحرفة بشدة لا يزال مشكلة. كما أن CLT لا يصلح مشكلة عدم الاستقلال، مثل قياسات متكررة للاعب نفسه تعامل خطأً كأنها لاعبين مختلفين.

أسئلة تقويمية — الفصل الثالث
حسابي لاعب كرة قدم يسجل ركلات حرة بنسبة 60%. في مباراة، لديه 4 ركلات. احسب احتمال إصابة 3 منها بالضبط.
تطبيقي متوسط سرعة عدائي 100م في بطولة = 10.8 ثانية، σ = 0.3 ث. احسب Z لعداء يُسجل 10.2 ث، وحدد هل القيمة الأعلى أم الأقل أفضل في هذا المتغير.
تفسير لماذا يؤدي رفع حجم العينة من 25 إلى 100 إلى تقليل SEM إلى النصف فقط، وليس إلى الربع؟