الوحدة الثانية عشرة: الصدق والثبات ونظرية الاختبار الكلاسيكية

مقدمة: هذه الوحدة تؤسس علم القياس: لماذا نثق في الأداة؟ ماذا يعني الصدق والثبات؟ وكيف نختار معامل الثبات المناسب مثل كابا أو ICC؟ حسابات SEM وMDC وBland-Altman أصبحت في الوحدة 13.

نظرية الاختبار الكلاسيكية

تبدأ جودة القياس من الفكرة الآتية: الدرجة الملاحظة = الدرجة الحقيقية + خطأ القياس. لذلك لا يكفي أن نحصل على رقم؛ يجب أن نعرف مقدار الثقة في هذا الرقم ومصادر الخطأ العشوائي والمنهجي.

Classical Test Theory
X = T + E
X الدرجة الملاحظة، T الدرجة الحقيقية، E خطأ القياس.

الدرس 12.1 — الصدق Validity

الصدق هو درجة دقة الأداة في قياس ما صُممت لقياسه. هو الأهم في جميع خصائص القياس — فأداة غير صادقة (حتى لو كانت ثابتة) عديمة القيمة.

نوع الصدق السؤال طريقة التقييم مثال رياضي
محتوى (Content) هل الأداة تغطي كل جوانب المفهوم؟ خبراء، تحليل محتوى هل اختبار اللياقة يغطي جميع مكونات اللياقة (هوائية، قوة، مرونة)؟
تركيبي (Construct) هل تقيس المفهوم النظري المقصود؟ تحليل عاملي، ارتباطات هل مقياس "القلق الرياضي" حقاً يقيس القلق وليس شيئاً آخر؟
معياري (Criterion) هل تتنبأ بالأداء المستقبلي؟ صدق متزامن، صدق تنبؤي هل اختبار الركض 12 دقيقة يتنبأ بأداء الماراثون؟
أنواع الصدق المعياري
  • صدق متزامن (Concurrent): مقارنة مع معيار ذهبي معروف في نفس الوقت.
  • صدق تنبؤي (Predictive): القدرة على التنبؤ بأداء مستقبلي (مثل اختبارات القبول بالأكاديميات الرياضية).
مثال عملي: تقييم صدق اختبار جديد

اختبار جديد لقياس "القوة الانفجارية للساقين".

  • صدق محتوى: هل يشمل الاختبار جميع حركات الساق الرئيسية؟ → مراجعة الخبراء.
  • صدق تركيبي: هل يترابط مع اختبارات القوة الأخرى؟ → معامل ارتباط 0.75 مع اختبار الوثب العمودي.
  • صدق تنبؤي: هل يتنبأ بأداء سباق 100م؟ → r = 0.68 مع الأداء بعد 6 أشهر.

الدرس 12.2 — الثبات Reliability

الثبات هو درجة الاتساق في النتائج. إذا أجرينا القياس مرة أخرى (بنفس الأداة، نفس الأفراد، نفس الظروف)، هل نحصل على نتائج مماثلة؟

نوع الثبات متى يُقاس؟ الطريقة المعامل المقبول
زمني (Test-Retest) نفس الاختبار في وقتين مختلفين معامل ارتباط بين الجلستين r ≥ 0.80
شكلي (Parallel Forms) نسختان متكافئتان من الاختبار معامل ارتباط بين النسختين r ≥ 0.80
داخلي (Internal Consistency) داخل الاختبار الواحد Cronbach's α (ألفا) α ≥ 0.70
بين محكمين (Inter-rater) محكمون مختلفون κ كوهن (Kappa) أو r κ ≥ 0.60 أو r ≥ 0.80
داخل المحكم (Intra-rater) نفس المحكم في وقتين مختلفين κ كوهن (Kappa) أو r κ ≥ 0.60 أو r ≥ 0.80
Cronbach's Alpha (α)

أكثر طريقة شيوعاً لتقدير الثبات الداخلي. تتراوح بين 0 و 1. قيم ≥ 0.70 مقبولة، ≥ 0.80 جيدة، ≥ 0.90 ممتازة. تنطبق على الاختبارات متعددة البنود (مثل الاستبيانات).

معايير تفسير معامل كابا كوهن — Landis & Koch (1977)

يُستخدم κ لتقييم الاتفاق بين المحكمين في المتغيرات الاسمية والرتبية. تعتمد معظم الدراسات الرياضية معيار κ ≥ 0.61 (جيد) حداً أدنى للقبول:

قيمة κ التفسير القبول البحثي
< 0.00 سيء (Poor) غير مقبول
0.00 – 0.20 ضعيف جداً (Slight) غير مقبول
0.21 – 0.40 ضعيف (Fair) يحتاج تحسيناً
0.41 – 0.60 متوسط (Moderate) مقبول بتحفظ
0.61 – 0.80 جيد (Substantial) مقبول
0.81 – 1.00 ممتاز (Almost Perfect) ممتاز

مثال رياضي: محكمان يصنّفان "جودة تقنية الرمي" في 50 محاولة (صحيح/خاطئ). κ = 0.74 → اتفاق جيد، مقبول في البحث.

العلاقة بين الصدق والثبات

• أداة صادقة يجب أن تكون ثابتة.
• لكن أداة ثابتة قد لا تكون صادقة (قد تقيس الشيء الخطأ باستمرار!).
• الصدق محدود بالثبات (الصدق ≤ الثبات).

الدرس 12.3 — معامل الارتباط داخل الفئة ICC

معامل الارتباط داخل الفئة (Intraclass Correlation Coefficient) يُستخدم لتقييم:

  • ثبات القياسات المتكررة (زمنياً أو بين محكمين)
  • الاتفاق بين قيمتين أو أكثر لنفس المتغير
نماذج ICC
النموذج الوصف متى يُستخدم؟
ICC(1,1) أحادي الاتجاه عشوائي — كل فرد يُقاس من محكمين مختلفين منتقَين عشوائياً حكام مسابقات مختلفون يقيّمون أفراداً مختلفين
ICC(2,1) ثنائي عشوائي — نفس المحكمين العشوائيين يقيسون جميع الأفراد (يحتسب التحيز المنهجي) الثبات الزمني والاتفاق المطلق — الأنسب لعلوم الرياضة
ICC(3,1) ثنائي مختلط — نفس المحكمين الثابتين يقيسون جميع الأفراد (لا يحتسب التحيز المنهجي) التناسق الداخلي داخل المختبر (يتجاهل الانحياز المنهجي بين المحكمين)
تفسير قيم ICC
قيمة ICC التفسير
< 0.50 ضعيف — غير مقبول
0.50 – 0.75 متوسط — محدود القبول
0.75 – 0.90 جيد — مقبول
> 0.90 ممتاز — موصى به للقياسات السريرية
مثال رياضي: اتفاق محكمين لتحليل الحركة

محللان حركيان يقيمان "جودة التمرير" في كرة القدم (مقياس 1-10).

ICC(2,1) = 0.85

التفسير: اتفاق جيد بين المحكمين. يمكن الاعتماد على التقييم في البحث.

الدرس 12.4 — الخطأ المعياري للقياس SEM

الخطأ المعياري للقياس (Standard Error of Measurement) يقدم معلومات عن دقة القياس الفردي. يُحسب من الثبات:

صيغة SEM
SEM = SD × √(1 − r)
حيث: SD = الانحراف المعياري للعينة | r = معامل الثبات (ICC أو معامل ارتباط test-retest)
تفسير SEM

إذا كان SEM = 2.5 كجم لقياس القوة، فهذا يعني:

  • النتيجة الحقيقية للفرد تقع ضمن ±2.5 كجم من النتيجة المقاسة (احتمال 68%).
  • ضمن ±5 كجم (2×SEM) احتمال 95%.
  • أي تغيير أقل من 2×SEM قد يكون بسبب خطأ القياس وليس تغييراً حقيقياً!
مثال: تفسير تغير الأداء

لاعب قفز عمودي:

  • قبل التدريب: 60 سم
  • بعد التدريب: 64 سم
  • SEM = 2 سم

السؤال: هل التحسن 4 سم حقيقي أم مجرد خطأ قياس؟

الإجابة: التغيير = 4 سم = 2×SEM. الاحتمال 95% أن التغيير الحقيقي بين 0 و 8 سم. التحسن "ربما" حقيقي لكنه عند حد الأدنى للثقة. لحكم أكثر قوة، نحتاج تغيير ≥ 5 سم (أو عدة قياسات).

التطبيق العملي: قرار التدريب بناءً على SEM
1
احسب SEM لأداة القياس الخاصة بك.
2
اعرف أن أي تغيير أقل من SEM قد يكون عشوائياً.
3
اعتبر التغيير "حقيقياً" فقط إذا تجاوز 2×SEM (أفضل 3×SEM).
4
استخدم متوسط 3-5 قياسات لتقليل تأثير SEM.
الحد الأدنى للتغيير المكتشف MDC₉₅

MDC₉₅ هو أصغر تغيير يمكن اعتباره حقيقياً بثقة 95%، متجاوزاً حدود خطأ القياس:

صيغة MDC₉₅
MDC₉₅ = SEM × 1.96 × √2 ≈ SEM × 2.77
1.96 = قيمة Z عند مستوى ثقة 95% | √2 = عامل التصحيح لقياسَين مستقلَّين
مثال: اختبار الوثب العمودي
1
SD = 8 سم، ICC(2,1) = 0.94
2
SEM = 8 × √(1 − 0.94) = 8 × 0.245 = 1.96 سم
3
MDC₉₅ = 1.96 × 2.77 = 5.4 سم

التفسير: تحسّن ≥ 5.4 سم في الوثب العمودي يُعدّ حقيقياً (بثقة 95%). تحسّن أقل من ذلك قد يكون ناتجاً عن تقلبات القياس.

أسئلة تقويمية — الفصل السادس
مفاهيمي اشرح الفرق بين الصدق والثبات مع مثال من اختبارات اللياقة البدنية.
تطبيقي مقياس جديد للدافعية الرياضية أظهر α = 0.65. هل يصلح للاستخدام؟ لماذا؟
حسابي اختبار قوة له SD = 15 كجم، وثبات test-retest r = 0.91. احسب SEM وMDC₉₅، وحدد ما إذا كان تغيير 5 كجم يُعدّ حقيقياً.
بحثي ناقش: هل يمكن لأداة أن تكون ثابتة جداً (ICC = 0.99) لكنها غير صادقة؟ وكيف يمكن اكتشاف ذلك؟
نقدي محكمان حلّلا أداءين حركيين وأحصيا الأخطاء التقنية. κ = 0.55. هل تقبل هذه البيانات في ورقة بحثية؟ ماذا تقترح؟
حسابي في دراسة مقارنة بين جهازَي قياس ضغط الدم: التحيز المتوسط = 3 ملمزئبق، SD_diff = 5 ملمزئبق. احسب حدود الاتفاق 95% وقرّر إذا كان الجهازان قابلَين للتبادل (MCID = 5 ملمزئبق).

الدرس 12.5 — تحليل بلاند-ألتمان Bland-Altman

تحليل بلاند-ألتمان (Bland-Altman Analysis) هو الأسلوب الإحصائي المعياري لمقارنة طريقتَي قياس لنفس المتغير وتحديد ما إذا كانتا قابلتَين للتبادل. يتجاوز قصور معامل الارتباط في تقييم الاتفاق.

الخطوات الأساسية

  1. احسب الفرق لكل فرد: d = A − B
  2. احسب المتوسط لكل فرد: m = (A+B)/2
  3. ارسم d (محور Y) مقابل m (محور X)
  4. احسب التحيز المتوسط: mean(d)
  5. احسب حدود الاتفاق 95%: LoA

أساس القرار

  • الصفر داخل LoA → لا يوجد تحيز منهجي مهم
  • LoA ضيقة (أقل من MCID) → الطريقتان قابلتان للتبادل
  • تحيز متزايد مع القيم الأعلى → تحيز تناسبي (proportional bias)
صيغ تحليل بلاند-ألتمان
التحيز المتوسط = mean(d) = mean(A − B)
حدود الاتفاق 95% (LoA) = mean(d) ± 1.96 × SD_d
حيث: SD_d = الانحراف المعياري لقيم الفروق d عبر جميع الأفراد
مثال: VO₂max — تحليل غازات مختبري مقابل اختبار كوبر الميداني

20 لاعب خضعوا لقياس الحد الأقصى لاستهلاك الأوكسجين بطريقتين:

  • الطريقة أ: تحليل الغازات في المختبر (Douglas Bag) — المعيار الذهبي
  • الطريقة ب: اختبار كوبر الميداني 12 دقيقة
1
متوسط الفروق: mean(d) = +1.2 مل/كجم/دقيقة (المختبر أعلى بانتظام)
2
انحراف معياري الفروق: SD_d = 2.1 مل/كجم/دقيقة
3
LoA 95% = 1.2 ± (1.96 × 2.1) = 1.2 ± 4.1
4
الحدود: [−2.9 ، +5.3] مل/كجم/دقيقة

التفسير: يوجد تحيز منهجي طفيف (+1.2 مل/كجم/دقيقة)، لكن الفروق الفردية قد تتراوح بين −2.9 و+5.3 مل/كجم/دقيقة.

القرار: إذا كان الفرق المقبول سريرياً (MCID) = 3 مل/كجم/دقيقة، فنطاق LoA = 8.2 أوسع بكثير → الطريقتان ليستا قابلتَين للتبادل الكامل في البيئة السريرية الدقيقة.

الخطأ الشائع: الارتباط ≠ الاتفاق

يُخطئ كثير من الباحثين باستخدام معامل بيرسون r لمقارنة طريقتَي قياس. الارتباط العالي (r = 0.99) لا يعني الاتفاق — يمكن لطريقتَين أن ترتبطا ارتباطاً قوياً مع وجود تحيز منهجي ثابت بينهما. الحل الصحيح هو تحليل بلاند-ألتمان دائماً.

الدرس 12.6 — الخطأ النموذجي Typical Error (TE)

الخطأ النموذجي (Typical Error) هو مقياس في إطار هوبكنز (Hopkins, 2000) يُقدّر تقلبات القياس بوحدة القياس الأصلية. يُكمل ICC بتقديم معلومات مطلقة (لا نسبية) عن دقة الأداة، ويدعم حساب CV% ونسبة الإشارة إلى الضوضاء.

صيغة الخطأ النموذجي (TE)
TE = SD_diff / √2
حيث: SD_diff = الانحراف المعياري لقيم (القياس الأول − القياس الثاني) عبر جميع المشاركين

نسبة الإشارة إلى الضوضاء (Signal:Noise)

Signal:Noise = SD_between / TE

  • > 4: ممتازة — الأداة تُميّز الفروق الدقيقة
  • 2–4: جيدة — مناسبة لأغراض البحث
  • < 2: ضعيفة — الأداة لا تُميّز الفروق الفردية بدقة كافية

معامل التباين للقياس (CV%)

CV% = (TE / Mean) × 100

  • < 2%: ممتاز
  • 2–5%: جيد
  • 5–10%: متوسط
  • > 10%: ضعيف
مثال: ثبات اختبار VO₂max المتكرر

20 رياضياً أجروا اختبار الحد الأقصى لاستهلاك الأوكسجين مرتَين بفاصل أسبوع واحد:

1
حساب الفروق: d = Trial₁ − Trial₂ لكل رياضي | SD_diff = 1.7 مل/كجم/دقيقة
2
TE = 1.7 / √2 = 1.7 / 1.414 = 1.2 مل/كجم/دقيقة
3
المتوسط العام = 55 مل/كجم/دقيقة → CV% = (1.2/55) × 100 = 2.2% (جيد)
4
SD_between = 7.5 مل/كجم/دقيقة → إشارة:ضوضاء = 7.5 / 1.2 = 6.25 (ممتازة)

الاستنتاج: TE = 1.2 مل/كجم/دقيقة يعني أن التغيير ≥ 2.4 مل/كجم/دقيقة أكبر من الضوضاء. نسبة الإشارة:الضوضاء = 6.25 تعني أن الاختبار يُميّز بين مستويات اللياقة المختلفة بدقة ممتازة.

مقارنة: SEM مقابل TE مقابل MDC₉₅
المعيار SEM TE (هوبكنز) MDC₉₅
الصيغة SD × √(1−r) SD_diff / √2 SEM × 2.77
الوحدة وحدة القياس وحدة القياس وحدة القياس
الإطار النظري نظرية الاختبار الكلاسيكية إطار الفروق الصغيرة ذات المعنى مشتق من SEM
الاستخدام الأساسي حدود الثقة للقياس الفردي CV%، نسبة الإشارة:الضوضاء حد القرار السريري (هل التغيير حقيقي؟)

ملاحظة عملية: TE ≈ SEM في معظم الحالات؛ استخدم TE عند التركيز على التطبيق الرياضي العملي، وMDC₉₅ عند اتخاذ قرارات سريرية مبنية على الثقة الإحصائية.