الوحدة الرابعة: الاحتمال والتوزيع الطبيعي
مقدمة: تبني هذه الوحدة أساس الإحصاء الاستدلالي: كيف نستخدم الاحتمال لفهم عدم اليقين، وكيف تتحول العينة الصغيرة إلى دليل عن مجتمع أكبر، ولماذا تعتمد الاختبارات اللاحقة على التوزيع الطبيعي، الخطأ المعياري، وتوزيع t.
في البحث الرياضي، لا نعرف الحقيقة الكاملة عن جميع اللاعبين أو جميع المباريات؛ بل نأخذ عينة ونحاول تقدير ما يحدث في المجتمع. لذلك لا تكون النتيجة "يقيناً" بل حكماً احتماليّاً: ما مدى ندرة هذه النتيجة إذا كانت الفرضية الصفرية صحيحة؟ وما مدى دقة تقديرنا؟
الدرس 4.1 — أساسيات الاحتمالات Probability
أهداف التعلم
- فهم الاحتمال بوصفه لغة كمية للتعامل مع عدم اليقين في البيانات الرياضية.
- تطبيق قواعد الجمع والضرب والاحتمال الشرطي على مواقف بحثية حقيقية.
- التمييز بين الاستقلال، الترابط، والخطر النسبي عند تفسير الجداول.
- ربط الاحتمالات بالقيمة الاحتمالية، فترات الثقة، وتفسير الاختبارات الإحصائية.
من الاحتمال إلى الاستدلال
الاحتمال هو مقياس عددي لدرجة عدم التأكد من وقوع حدث معين. تتراوح قيمته بين 0 (مستحيل الوقوع) و 1 (مؤكد الوقوع)، أو بين 0% و 100%. أما الاستدلال الإحصائي فيستخدم هذه اللغة للإجابة عن سؤال أعمق: هل ما رأيناه في العينة يمكن أن يحدث غالباً بالصدفة، أم أنه دليل على فرق أو علاقة حقيقية؟
احتمال وصفي
يصف ما حدث أو ما قد يحدث بناءً على بيانات متاحة. مثال: نسبة نجاح لاعب في ركلات الجزاء خلال الموسم = 78%.
احتمال استدلالي
يقيّم مدى ندرة نتيجة بحثية تحت افتراض معين. مثال: إذا لم يكن للبرنامج التدريبي أثر، ما احتمال أن نرى تحسناً بهذا الحجم أو أكبر؟
- التجربة العشوائية: عملية تؤدي إلى نتيجة غير مؤكدة مسبقاً، مثل نتيجة مباراة أو حدوث إصابة في أسبوع تدريبي.
- فضاء العينة (Sample Space): جميع النتائج الممكنة للتجربة. مثال مباراة كرة قدم: فوز، تعادل، خسارة.
- الحدث (Event): مجموعة جزئية من فضاء العينة، مثل "الفوز" أو "حدوث إصابة".
- الحدث المتمم: كل النتائج التي لا تحقق الحدث. إذا كان احتمال الإصابة 0.15 فإن احتمال عدم الإصابة 0.85.
- الاستقلال: وقوع حدث لا يغير احتمال الحدث الآخر. إذا غيّر الحدث الأول احتمال الثاني فلدينا اعتماد أو ارتباط احتمالي.
أنواع الاحتمالات
| النوع | الوصف | مثال من علوم الرياضة | متى يفيد؟ |
|---|---|---|---|
| الاحتمال الكلاسيكي | يعتمد على تساوي فرص وقوع جميع النتائج. | احتمال اختيار لاعب واحد عشوائياً من فريق مكوّن من 20 لاعباً. | مناسب للألعاب أو الاختيارات العشوائية البسيطة. |
| الاحتمال التكراري | يعتمد على البيانات التاريخية والتكرار النسبي. | نسبة نجاح اللاعب في ركلات الجزاء بناءً على آخر 100 ركلة. | مهم في التحليلات القائمة على سجلات الأداء والإصابات. |
| الاحتمال الذاتي | يعتمد على تقدير الخبراء والظروف المحيطة. | توقعات المدرب لفرص الفوز بناءً على الإصابات وحالة المنافس. | يستخدم عند نقص البيانات أو في التوقعات المبكرة. |
| الاحتمال الشرطي | احتمال حدث بعد معرفة أن حدثاً آخر وقع. | احتمال الإصابة بشرط أن اللاعب شارك في تدريب مكثف. | أساسي في تحليل المخاطر والتشخيص والتنبؤ. |
قواعد الاحتمالات الأساسية
1. قاعدة الجمع (OR)
تستخدم لحساب احتمال وقوع حدث A أو حدث B.
P(A ∪ B) = P(A) + P(B) − P(A ∩ B)
إذا كان الحدثان مانعين، مثل فوز وخسارة في النتيجة نفسها، فإن P(A ∩ B) = 0.
2. قاعدة الضرب (AND)
تستخدم لحساب احتمال وقوع حدثين معاً.
P(A ∩ B) = P(A) × P(B)
هذه الصيغة المباشرة صحيحة عند الاستقلال. عند عدم الاستقلال نستخدم P(A ∩ B) = P(A | B) × P(B).
السياق: دراسة العلاقة بين التدريب المكثف وإصابات العضلات في فريق مكوّن من 100 لاعب.
| أُصيب | لم يُصَب | المجموع | |
|---|---|---|---|
| تدريب مكثف | 10 | 30 | 40 |
| تدريب عادي | 5 | 55 | 60 |
| المجموع | 15 | 85 | 100 |
استنتاج: اللاعبون في التدريب المكثف تعرضوا لخطر إصابة أعلى بثلاثة أضعاف تقريباً. لاحقاً، سنسأل: هل هذا الفرق كبير بما يكفي ليتجاوز التذبذب العشوائي؟ هنا يبدأ دور كاي تربيع، فترات الثقة، والقيمة الاحتمالية.
الربط المفاهيمي: القيمة الاحتمالية (p-value) ليست احتمال صحة الفرضية الصفرية، بل احتمال الحصول على نتيجة مثل نتيجتنا أو أكثر تطرفاً إذا افترضنا أن الفرضية الصفرية صحيحة.
تطبيقات للتقييم
س1: إذا كان فضاء العينة لنتائج مباراة كرة قدم هو {فوز، خسارة، تعادل}، فما هو مجموع احتمالات هذه الأحداث؟
س2: لاعب كرة سلة يسجل الرميات الحرة بنسبة 80% (0.8). إذا رمى رميتين مستقلتين، فما احتمال أن ينجح في التسجيل في كليهما؟
الدرس 4.2 — التوزيعات الاحتمالية المنفصلة
التوزيع الاحتمالي يصف جميع القيم الممكنة لمتغير عشوائي واحتمال كل قيمة. في الدراسات الرياضية نستخدم التوزيعات المنفصلة عندما تكون النتيجة عدّاً أو فئة: عدد الإصابات، عدد النجاحات، عدد الأهداف، أو وجود/عدم وجود حدث.
| التوزيع | نوع السؤال | مثال رياضي | المعلمات الأساسية |
|---|---|---|---|
| Bernoulli | محاولة واحدة: نجاح/فشل | هل سجل اللاعب رمية حرة واحدة؟ | p |
| Binomial | عدد النجاحات في عدد ثابت من المحاولات | عدد الرميات الناجحة من 10 محاولات | n و p |
| Poisson | عدد أحداث نادرة في زمن أو مساحة محددة | عدد الإصابات في موسم أو عدد الأخطاء خلال مباراة | λ |
| Geometric | عدد المحاولات حتى أول نجاح | كم محاولة يحتاج اللاعب حتى يسجل أول رمية؟ | p |
توزيع ذات الحدين Binomial Distribution
يجب توافر الشروط الأربعة قبل استخدام هذا التوزيع:
- عدد محاولات ثابت (n): مثلاً 5 رميات حرة محددة مسبقاً.
- كل محاولة تنتهي بنتيجة ثنائية: نجاح أو فشل، مصاب أو غير مصاب، التزام أو عدم التزام.
- احتمال النجاح (p) ثابت: لا يتغير بين المحاولات. إذا أثر التعب في المحاولات اللاحقة فإن p ليس ثابتاً.
- المحاولات مستقلة: نتيجة محاولة لا تؤثر في المحاولة التالية.
ما احتمال تسجيل 4 رميات بالضبط؟
تفسير: تسجيل 4 من 5 نتيجة معقولة جداً للاعب نسبة نجاحه 70%. أما تسجيل 5 من 5 فليس مستحيلاً، لكنه أقل احتمالاً.
توزيع بواسون Poisson Distribution
يستخدم بواسون لعدّ الأحداث التي تقع في فترة محددة عندما تكون الأحداث نادرة نسبياً ومتوسط حدوثها معروفاً. لا نحتاج إلى عدد محاولات ثابت كما في التوزيع الثنائي؛ نحتاج إلى معدل حدوث λ.
متوسط إصابات الرباط الصليبي في دوري ما = 3 إصابات في الموسم. ما احتمال حدوث 5 إصابات في الموسم القادم؟
تفسير: هناك احتمال يقارب 10% لحدوث 5 إصابات في موسم واحد إذا كان المعدل الحقيقي 3 إصابات.
إذا كانت الأحداث متجمعة بسبب عامل مشترك، مثل ملعب سيئ يزيد الإصابات في مباريات معينة، أو إذا تغير معدل الخطر عبر الموسم، فقد لا يكون افتراض المعدل الثابت مناسباً. عندها نحتاج نماذج أكثر مرونة مثل الانحدار البواسوني أو النماذج المختلطة.
الدرس 4.3 — التوزيع الطبيعي والدرجة المعيارية Normal Distribution & Z-Score
التوزيع الطبيعي، أو المنحنى الجرسي، هو أشهر التوزيعات المتصلة في الإحصاء. يوصف بمعلمتين: المتوسط μ الذي يحدد مركز التوزيع، والانحراف المعياري σ الذي يحدد درجة الانتشار حول المتوسط.
خصائص التوزيع الطبيعي
- متماثل حول المتوسط.
- المتوسط = الوسيط = المنوال.
- المساحة الكلية تحت المنحنى = 1.
- القيم القريبة من المتوسط أكثر شيوعاً من القيم البعيدة.
قاعدة 68-95-99.7
- نحو 68% من القيم تقع داخل ±1 SD.
- نحو 95% من القيم تقع داخل ±2 SD.
- نحو 99.7% من القيم تقع داخل ±3 SD.
| قيمة Z | التفسير | مثال في الأداء الرياضي |
|---|---|---|
| 0 | القيمة تساوي المتوسط تماماً | لاعب في متوسط الفريق |
| +1 | أعلى من المتوسط بانحراف معياري واحد | لياقة أعلى من معظم الفريق |
| −1 | أقل من المتوسط بانحراف معياري واحد | نتيجة تحتاج متابعة مقارنة بالمجموعة |
| +1.96 أو −1.96 | تقريباً حدود 95% في التوزيع الطبيعي | قيمة نادرة نسبياً إذا كان التوزيع طبيعياً |
المعطيات: متوسط VO2max للناشئين = 50 مل/كجم/دقيقة، σ = 5، التوزيع طبيعي. المطلوب: انتقاء أعلى 2.5% لياقةً.
مهم: إذا كانت القيمة الأقل أفضل، مثل زمن سباق 100م، فإن Z السالب قد يعني أداءً أفضل. دائماً فسّر اتجاه المتغير قبل الحكم على الدرجة المعيارية.
الدرس 4.4 — نظرية الحد المركزي Central Limit Theorem (CLT)
تُعدّ نظرية الحد المركزي أحد أهم المبادئ في علم الإحصاء الاستدلالي. فهمها يفتح الباب لاختبارات t وANOVA وفترات الثقة، لأنها تشرح لماذا يمكننا استخدام التوزيع الطبيعي لوصف متوسطات العينات حتى عندما لا تكون البيانات الفردية طبيعية تماماً.
إذا سحبنا عينات عشوائية متكررة حجمها n من أي مجتمع، فإن توزيع متوسطات تلك العينات يقترب من التوزيع الطبيعي كلما زاد حجم العينة. لا يعني ذلك أن البيانات الأصلية أصبحت طبيعية؛ بل يعني أن متوسطات العينات تصبح أكثر انتظاماً وقابلية للاستدلال.
ملاحظة مهمة: يعتمد حجم العينة الكافي لتقريب توزيع المتوسطات من الطبيعي على درجة انحراف المجتمع الأصلي. للبيانات شديدة الانحراف أو ذات القيم الشاذة المؤثرة، قد يحتاج حجم عينة أكبر من 30، وقد لا تكون CLT كافية وحدها دون تحويل بيانات أو استخدام طرق لامعلمية.
العينة، المجتمع، وتوزيع المعاينة
| المفهوم | المعنى | مثال |
|---|---|---|
| المجتمع | كل الأفراد أو القياسات التي نهتم بها | جميع لاعبي الدوري الجامعي |
| العينة | جزء من المجتمع نقيسه فعلياً | 40 لاعباً اختيروا للدراسة |
| الإحصاء | قيمة محسوبة من العينة | متوسط VO2max في العينة |
| المعلم | قيمة حقيقية في المجتمع، غالباً لا نعرفها | متوسط VO2max الحقيقي لجميع لاعبي الدوري |
| توزيع المعاينة | توزيع إحصاء العينة لو كررنا أخذ العينات كثيراً | توزيع متوسطات VO2max لعشرات العينات المتكررة |
لماذا هذا مهم في علوم الرياضة؟
كثير من البيانات الرياضية لا تتبع التوزيع الطبيعي تماماً، مثل عدد الإصابات، أوقات التعافي، أو مقاييس الألم. غير أن نظرية الحد المركزي تبرر استخدام كثير من الاختبارات المعلمية على متوسطات العينات متى كان حجم العينة كافياً وكانت المشاهدات مستقلة ولا توجد قيم شاذة مهيمنة.
المجتمع: أوقات التعافي من إصابات العضلة الرباعية في دوري المحترفين. البيانات الأصلية منحرفة يميناً لأن بعض اللاعبين يتعافون ببطء شديد.
- إذا سحبنا عينة واحدة n=5، فقد يكون متوسطها متأثراً جداً بلاعب واحد طويل التعافي.
- إذا كررنا سحب عينات n=30، يصبح توزيع المتوسطات أقرب إلى الطبيعي.
- النتيجة: يمكن استخدام t-test لمقارنة متوسط التعافي بين بروتوكولي علاج إذا كانت الافتراضات الأخرى مقبولة.
قاعدة عملية: n ≥ 30 مفيدة للانحراف الخفيف إلى المتوسط، لكن الانحراف الشديد أو القيم الشاذة الكبيرة قد يحتاجان تحويلات، Bootstrap، أو اختبارات لامعلمية.
الخطأ المعياري للمتوسط Standard Error of the Mean — SEM
نظرية الحد المركزي تخبرنا بشكل توزيع المتوسطات؛ أما الخطأ المعياري فيخبرنا بمدى انتشار تلك المتوسطات. كلما صغر الخطأ المعياري كان متوسط العينة أكثر دقة في تقدير متوسط المجتمع.
دراسة قاست VO2max لعينة n=25 من عدّائي المسافات: s = 6 مل/كجم/دقيقة، ومتوسط العينة = 58.0.
تفسير: زيادة حجم العينة لا تقلل تشتت اللاعبين أنفسهم، لكنها تقلل عدم اليقين حول متوسط المجتمع.
فترات الثقة Confidence Intervals
فترة الثقة تعرض نطاقاً من القيم المعقولة للمعلم الحقيقي. إذا قلنا إن فترة الثقة 95% لمتوسط VO2max هي 55.6 إلى 60.4، فهذا لا يعني أن احتمال وقوع المتوسط الحقيقي داخل هذه الفترة بعد حسابها هو 95% بالمعنى الحرفي؛ بل يعني أن الطريقة المستخدمة ستنتج فترات تحتوي المعلم الحقيقي في نحو 95% من العينات المتكررة.
توزيع ستيودنت t Student's t-Distribution
في الواقع العملي، نادراً ما يُعرف الانحراف المعياري للمجتمع. عند استبداله بالانحراف المعياري للعينة، يصبح عدم اليقين أكبر، ولذلك نستخدم توزيع t بدلاً من Z. كلما صغرت العينة زادت أذناب t، أي أصبحت القيم الحرجة أكبر وأكثر تحفظاً.
متى نستخدم Z؟
- σ المجتمع معروف، وهذا نادر في الأبحاث التطبيقية.
- حجم العينة كبير جداً، فيصبح t قريباً جداً من Z.
- مثال: مقارنة قيمة فرد بمعيار منشور مع σ معروف.
متى نستخدم t؟
- σ المجتمع غير معروف، وهو الوضع المعتاد.
- نقدّر التباين بالانحراف المعياري للعينة.
- مثال: مقارنة متوسط مجموعة تدريبية بمتوسط مجموعة ضابطة.
| التوزيع | أين يظهر لاحقاً؟ | الفكرة الأساسية |
|---|---|---|
| Z | الدرجات المعيارية، النسب، وبعض فترات الثقة الكبيرة | توزيع طبيعي معياري متوسطه 0 وانحرافه 1 |
| t | اختبارات t وفترات الثقة للمتوسطات | يشبه Z لكن بأذناب أثقل عند العينات الصغيرة |
| Chi-square | اختبارات المتغيرات الفئوية وتقدير التباين | يعتمد على مجموع مربعات قيم معيارية |
| F | ANOVA والانحدار | نسبة تباينين، مثل التباين بين المجموعات إلى داخلها |
في وحدة فحص الافتراضات ستتأكد من أن البيانات مناسبة للتحليل. في وحدة اختبار الفرضيات ستستخدم القيمة الاحتمالية وفترات الثقة لاتخاذ القرار. وفي وحدة مقارنة المجموعات ستظهر توزيعات t وF وchi-square عملياً في t-test وANOVA وكاي تربيع.
| حجم العينة | حالة المجتمع الأصلي | توزيع المتوسطات | القرار العملي |
|---|---|---|---|
| أي n | طبيعي تقريباً | طبيعي تقريباً | يمكن استخدام الاختبارات المعلمية غالباً |
| n ≥ 30 | انحراف خفيف إلى متوسط | قريب من الطبيعي بفضل CLT | غالباً مناسب مع فحص القيم الشاذة |
| n < 15 | منحرف بشدة أو يحتوي قيماً شاذة مؤثرة | غير مستقر | فكر في بديل لامعلمي أو Bootstrap |
نظرية الحد المركزي تنطبق على توزيع المتوسطات، وليس على البيانات الفردية. اختبار t للعينات الصغيرة مع بيانات منحرفة بشدة لا يزال مشكلة. كما أن CLT لا يصلح مشكلة عدم الاستقلال، مثل قياسات متكررة للاعب نفسه تعامل خطأً كأنها لاعبين مختلفين.