الوحدة الثانية عشرة: الصدق والثبات ونظرية الاختبار الكلاسيكية
مقدمة: هذه الوحدة تؤسس علم القياس: لماذا نثق في الأداة؟ ماذا يعني الصدق والثبات؟ وكيف نختار معامل الثبات المناسب مثل كابا أو ICC؟ حسابات SEM وMDC وBland-Altman أصبحت في الوحدة 13.
نظرية الاختبار الكلاسيكية
تبدأ جودة القياس من الفكرة الآتية: الدرجة الملاحظة = الدرجة الحقيقية + خطأ القياس. لذلك لا يكفي أن نحصل على رقم؛ يجب أن نعرف مقدار الثقة في هذا الرقم ومصادر الخطأ العشوائي والمنهجي.
الدرس 12.1 — الصدق Validity
الصدق هو درجة دقة الأداة في قياس ما صُممت لقياسه. هو الأهم في جميع خصائص القياس — فأداة غير صادقة (حتى لو كانت ثابتة) عديمة القيمة.
| نوع الصدق | السؤال | طريقة التقييم | مثال رياضي |
|---|---|---|---|
| محتوى (Content) | هل الأداة تغطي كل جوانب المفهوم؟ | خبراء، تحليل محتوى | هل اختبار اللياقة يغطي جميع مكونات اللياقة (هوائية، قوة، مرونة)؟ |
| تركيبي (Construct) | هل تقيس المفهوم النظري المقصود؟ | تحليل عاملي، ارتباطات | هل مقياس "القلق الرياضي" حقاً يقيس القلق وليس شيئاً آخر؟ |
| معياري (Criterion) | هل تتنبأ بالأداء المستقبلي؟ | صدق متزامن، صدق تنبؤي | هل اختبار الركض 12 دقيقة يتنبأ بأداء الماراثون؟ |
- صدق متزامن (Concurrent): مقارنة مع معيار ذهبي معروف في نفس الوقت.
- صدق تنبؤي (Predictive): القدرة على التنبؤ بأداء مستقبلي (مثل اختبارات القبول بالأكاديميات الرياضية).
اختبار جديد لقياس "القوة الانفجارية للساقين".
- صدق محتوى: هل يشمل الاختبار جميع حركات الساق الرئيسية؟ → مراجعة الخبراء.
- صدق تركيبي: هل يترابط مع اختبارات القوة الأخرى؟ → معامل ارتباط 0.75 مع اختبار الوثب العمودي.
- صدق تنبؤي: هل يتنبأ بأداء سباق 100م؟ → r = 0.68 مع الأداء بعد 6 أشهر.
الدرس 12.2 — الثبات Reliability
الثبات هو درجة الاتساق في النتائج. إذا أجرينا القياس مرة أخرى (بنفس الأداة، نفس الأفراد، نفس الظروف)، هل نحصل على نتائج مماثلة؟
| نوع الثبات | متى يُقاس؟ | الطريقة | المعامل المقبول |
|---|---|---|---|
| زمني (Test-Retest) | نفس الاختبار في وقتين مختلفين | معامل ارتباط بين الجلستين | r ≥ 0.80 |
| شكلي (Parallel Forms) | نسختان متكافئتان من الاختبار | معامل ارتباط بين النسختين | r ≥ 0.80 |
| داخلي (Internal Consistency) | داخل الاختبار الواحد | Cronbach's α (ألفا) | α ≥ 0.70 |
| بين محكمين (Inter-rater) | محكمون مختلفون | κ كوهن (Kappa) أو r | κ ≥ 0.60 أو r ≥ 0.80 |
| داخل المحكم (Intra-rater) | نفس المحكم في وقتين مختلفين | κ كوهن (Kappa) أو r | κ ≥ 0.60 أو r ≥ 0.80 |
أكثر طريقة شيوعاً لتقدير الثبات الداخلي. تتراوح بين 0 و 1. قيم ≥ 0.70 مقبولة، ≥ 0.80 جيدة، ≥ 0.90 ممتازة. تنطبق على الاختبارات متعددة البنود (مثل الاستبيانات).
يُستخدم κ لتقييم الاتفاق بين المحكمين في المتغيرات الاسمية والرتبية. تعتمد معظم الدراسات الرياضية معيار κ ≥ 0.61 (جيد) حداً أدنى للقبول:
| قيمة κ | التفسير | القبول البحثي |
|---|---|---|
| < 0.00 | سيء (Poor) | غير مقبول |
| 0.00 – 0.20 | ضعيف جداً (Slight) | غير مقبول |
| 0.21 – 0.40 | ضعيف (Fair) | يحتاج تحسيناً |
| 0.41 – 0.60 | متوسط (Moderate) | مقبول بتحفظ |
| 0.61 – 0.80 | جيد (Substantial) ✓ | مقبول |
| 0.81 – 1.00 | ممتاز (Almost Perfect) ✓ | ممتاز |
مثال رياضي: محكمان يصنّفان "جودة تقنية الرمي" في 50 محاولة (صحيح/خاطئ). κ = 0.74 → اتفاق جيد، مقبول في البحث.
• أداة صادقة يجب أن تكون ثابتة.
• لكن أداة ثابتة قد لا تكون صادقة (قد تقيس الشيء الخطأ باستمرار!).
• الصدق محدود بالثبات (الصدق ≤ الثبات).
الدرس 12.3 — معامل الارتباط داخل الفئة ICC
معامل الارتباط داخل الفئة (Intraclass Correlation Coefficient) يُستخدم لتقييم:
- ثبات القياسات المتكررة (زمنياً أو بين محكمين)
- الاتفاق بين قيمتين أو أكثر لنفس المتغير
| النموذج | الوصف | متى يُستخدم؟ |
|---|---|---|
| ICC(1,1) | أحادي الاتجاه عشوائي — كل فرد يُقاس من محكمين مختلفين منتقَين عشوائياً | حكام مسابقات مختلفون يقيّمون أفراداً مختلفين |
| ICC(2,1) | ثنائي عشوائي — نفس المحكمين العشوائيين يقيسون جميع الأفراد (يحتسب التحيز المنهجي) | الثبات الزمني والاتفاق المطلق — الأنسب لعلوم الرياضة |
| ICC(3,1) | ثنائي مختلط — نفس المحكمين الثابتين يقيسون جميع الأفراد (لا يحتسب التحيز المنهجي) | التناسق الداخلي داخل المختبر (يتجاهل الانحياز المنهجي بين المحكمين) |
| قيمة ICC | التفسير |
|---|---|
| < 0.50 | ضعيف — غير مقبول |
| 0.50 – 0.75 | متوسط — محدود القبول |
| 0.75 – 0.90 | جيد — مقبول |
| > 0.90 | ممتاز — موصى به للقياسات السريرية |
محللان حركيان يقيمان "جودة التمرير" في كرة القدم (مقياس 1-10).
ICC(2,1) = 0.85
التفسير: اتفاق جيد بين المحكمين. يمكن الاعتماد على التقييم في البحث.
الدرس 12.4 — الخطأ المعياري للقياس SEM
الخطأ المعياري للقياس (Standard Error of Measurement) يقدم معلومات عن دقة القياس الفردي. يُحسب من الثبات:
إذا كان SEM = 2.5 كجم لقياس القوة، فهذا يعني:
- النتيجة الحقيقية للفرد تقع ضمن ±2.5 كجم من النتيجة المقاسة (احتمال 68%).
- ضمن ±5 كجم (2×SEM) احتمال 95%.
- أي تغيير أقل من 2×SEM قد يكون بسبب خطأ القياس وليس تغييراً حقيقياً!
لاعب قفز عمودي:
- قبل التدريب: 60 سم
- بعد التدريب: 64 سم
- SEM = 2 سم
السؤال: هل التحسن 4 سم حقيقي أم مجرد خطأ قياس؟
الإجابة: التغيير = 4 سم = 2×SEM. الاحتمال 95% أن التغيير الحقيقي بين 0 و 8 سم. التحسن "ربما" حقيقي لكنه عند حد الأدنى للثقة. لحكم أكثر قوة، نحتاج تغيير ≥ 5 سم (أو عدة قياسات).
MDC₉₅ هو أصغر تغيير يمكن اعتباره حقيقياً بثقة 95%، متجاوزاً حدود خطأ القياس:
التفسير: تحسّن ≥ 5.4 سم في الوثب العمودي يُعدّ حقيقياً (بثقة 95%). تحسّن أقل من ذلك قد يكون ناتجاً عن تقلبات القياس.
أسئلة تقويمية — الفصل السادس
الدرس 12.5 — تحليل بلاند-ألتمان Bland-Altman
تحليل بلاند-ألتمان (Bland-Altman Analysis) هو الأسلوب الإحصائي المعياري لمقارنة طريقتَي قياس لنفس المتغير وتحديد ما إذا كانتا قابلتَين للتبادل. يتجاوز قصور معامل الارتباط في تقييم الاتفاق.
الخطوات الأساسية
- احسب الفرق لكل فرد: d = A − B
- احسب المتوسط لكل فرد: m = (A+B)/2
- ارسم d (محور Y) مقابل m (محور X)
- احسب التحيز المتوسط: mean(d)
- احسب حدود الاتفاق 95%: LoA
أساس القرار
- الصفر داخل LoA → لا يوجد تحيز منهجي مهم
- LoA ضيقة (أقل من MCID) → الطريقتان قابلتان للتبادل
- تحيز متزايد مع القيم الأعلى → تحيز تناسبي (proportional bias)
حدود الاتفاق 95% (LoA) = mean(d) ± 1.96 × SD_d
20 لاعب خضعوا لقياس الحد الأقصى لاستهلاك الأوكسجين بطريقتين:
- الطريقة أ: تحليل الغازات في المختبر (Douglas Bag) — المعيار الذهبي
- الطريقة ب: اختبار كوبر الميداني 12 دقيقة
التفسير: يوجد تحيز منهجي طفيف (+1.2 مل/كجم/دقيقة)، لكن الفروق الفردية قد تتراوح بين −2.9 و+5.3 مل/كجم/دقيقة.
القرار: إذا كان الفرق المقبول سريرياً (MCID) = 3 مل/كجم/دقيقة، فنطاق LoA = 8.2 أوسع بكثير → الطريقتان ليستا قابلتَين للتبادل الكامل في البيئة السريرية الدقيقة.
يُخطئ كثير من الباحثين باستخدام معامل بيرسون r لمقارنة طريقتَي قياس. الارتباط العالي (r = 0.99) لا يعني الاتفاق — يمكن لطريقتَين أن ترتبطا ارتباطاً قوياً مع وجود تحيز منهجي ثابت بينهما. الحل الصحيح هو تحليل بلاند-ألتمان دائماً.
الدرس 12.6 — الخطأ النموذجي Typical Error (TE)
الخطأ النموذجي (Typical Error) هو مقياس في إطار هوبكنز (Hopkins, 2000) يُقدّر تقلبات القياس بوحدة القياس الأصلية. يُكمل ICC بتقديم معلومات مطلقة (لا نسبية) عن دقة الأداة، ويدعم حساب CV% ونسبة الإشارة إلى الضوضاء.
نسبة الإشارة إلى الضوضاء (Signal:Noise)
Signal:Noise = SD_between / TE
- > 4: ممتازة — الأداة تُميّز الفروق الدقيقة
- 2–4: جيدة — مناسبة لأغراض البحث
- < 2: ضعيفة — الأداة لا تُميّز الفروق الفردية بدقة كافية
معامل التباين للقياس (CV%)
CV% = (TE / Mean) × 100
- < 2%: ممتاز
- 2–5%: جيد
- 5–10%: متوسط
- > 10%: ضعيف
20 رياضياً أجروا اختبار الحد الأقصى لاستهلاك الأوكسجين مرتَين بفاصل أسبوع واحد:
الاستنتاج: TE = 1.2 مل/كجم/دقيقة يعني أن التغيير ≥ 2.4 مل/كجم/دقيقة أكبر من الضوضاء. نسبة الإشارة:الضوضاء = 6.25 تعني أن الاختبار يُميّز بين مستويات اللياقة المختلفة بدقة ممتازة.
| المعيار | SEM | TE (هوبكنز) | MDC₉₅ |
|---|---|---|---|
| الصيغة | SD × √(1−r) | SD_diff / √2 | SEM × 2.77 |
| الوحدة | وحدة القياس | وحدة القياس | وحدة القياس |
| الإطار النظري | نظرية الاختبار الكلاسيكية | إطار الفروق الصغيرة ذات المعنى | مشتق من SEM |
| الاستخدام الأساسي | حدود الثقة للقياس الفردي | CV%، نسبة الإشارة:الضوضاء | حد القرار السريري (هل التغيير حقيقي؟) |
ملاحظة عملية: TE ≈ SEM في معظم الحالات؛ استخدم TE عند التركيز على التطبيق الرياضي العملي، وMDC₉₅ عند اتخاذ قرارات سريرية مبنية على الثقة الإحصائية.