دليل الخطوة باء - الإجراءات لإجراء اختبارات لمجموعات المعالجة المقارنة
فهم كيفية مقارنة مجموعتين للعلاج أمر أساسي في العديد من الميادين، بما في ذلك الطب، وعلم النفس، والعلوم الاجتماعية، والتعليم، والبحث في مجال الأعمال، الاختبار هو طريقة إحصائية قوية تستخدم لتحديد ما إذا كانت هناك اختلافات كبيرة بين وسائل مجموعتين، وسواء كنت تقيم فعالية دواء جديد، أو تقارن أساليب التدريس، أو تحليل رضا العملاء عبر نماذج مختلفة للخدمة، فإن الاختبار يوفر إطارا صارما لاتخاذ قرارات شاملة تستند إلى البيانات.
ما هو الاختبار؟
والاختبار أداة لتقييم وسائل السكان أو السكان الاثنين باستخدام اختبار الفرضية، وهو مصمم تحديدا لتحديد ما إذا كانت الاختلافات الملاحظة بين المجموعات ذات أهمية إحصائية أو لمجرد أنها تعزى إلى فرص عشوائية، وربما يكون الاختبار الثنائي العينة (لمجموعتين مستقلتين) والاختبار الثنائي (للعينات المطابقة) هو أكثر الأساليب استخداما في الإحصاءات من أجل مقارنة الاختلافات بين عينتين عندما توزع البيانات عادة.
والاختبار ذو قيمة خاصة عندما يعمل مع أحجام العينات الصغيرة وعندما يكون الانحراف المعياري للسكان مجهولا، فهو ينتج إحصائيا اختباريا (قيما) يمكن مقارنته بتوزيع نظري لتحديد احتمال حدوث الفرق الملاحظ على سبيل الصدفة وحده.
متى تستخدمين اختباراً
الاختبارات مناسبة عندما تحتاج لمقارنة الوسائل و بياناتك تفي بشروط معينة يجب أن تفكر في استخدام اختبارات عندما تكون لديك بيانات مستمرة مقاسة على نطاق أو معدل
الإختبار مطبق بشكل عام في الأبحاث التجريبية حيث تقارن مجموعة العلاج بفريق التحكم في الدراسات السابقة واللاحقة حيث تقيس نفس الموضوعات في نقطتين زمنيتين مختلفتين أو عندما تريد مقارنة عينة تعني قيمة سكانية معروفة
أنواع التجارب
وهناك ثلاث اختبارات لمقارنة الوسائل: اختبار واحد، ودقيقة من العينتين، وتجربة مدمجة، ودليل مختلط، وفهم نوع الاستخدام أمر حاسم للحصول على نتائج صحيحة.
تجربة عينة واحدة
اختبار العينة الواحدة يقارن معنى المجموعة الواحدة بقيمة أو معيار معروف هذا الاختبار يستخدم عندما تريد تحديد ما إذا كانت عينتك تعني اختلافاً كبيراً عن معنى السكان المفترض أو قيمة مرجعية قياسية
مثلاً، إذا كان مصنّع الشوكولاتة يطالب بوزن 50 غراماً في المتوسط، يمكنك أخذ عينة من القضبان، و وزنها، واستخدام اختبار واحد العينات لتحديد ما إذا كانت العينة تعني اختلافاً كبيراً عن الـ50 غراماً المطالب بها، وهذا النوع من الاختبار مفيد أيضاً في مراقبة الجودة، حيث تقارن إنتاج الإنتاج بالمعايير المعمول بها.
تجربة عينتين مستقلتين
اختبار العينتين المستقلتين: يقارن بين وسائل مجموعتين منفصلتين تماما، مثل مجموعة المعالجة ضد مجموعة مراقبة، ويستخدم اختبار العينتين عندما تكون بيانات العينتين مستقلة إحصائيا، وهذا هو أكثر أنواع الاختبارات شيوعا المستخدمة في دراسات مقارنة العلاج.
الإستقلال يعني أن اختيار الأفراد في مجموعة واحدة لا يؤثر على اختيار الأفراد في المجموعة الأخرى، على سبيل المثال، إذا كنت تقارن فعالية دواءين مختلفين للألم عن طريق تعيين المرضى بشكل عشوائي لتلقي أي من المخدرات ألف أو المخدرات باء، ستستخدم عينات مستقلة، لأن المجموعتين منفصلتان تماما.
Paired Samples T- testing
وتستخدم اختبارات Paired t للاختبار إذا كانت وسائل القياس المزدوج، مثل قياسات ما قبل الاختبار/السجلات المرجعية، مختلفة اختلافا كبيرا، وتستخدم الاختبارات المدمجة عندما تكون البيانات في شكل أزواج متطابقة.
(يُعرف أيضاً بـ (عينة أقل من ذلك) يُطبق على مقارنة وسائل العينة التي يتم جمعها من نفس المجموعة أو السكان ولكن في وقت أو فترة مختلفة (مثل اختبار ما قبل وبعده)، وهذا الاختبار مناسب عندما تقيس نفس المواضيع مرتين، عندما تُطابق المواضيع بأزواج على أساس خصائص مماثلة، أو عندما تجري مقارنات قبل وبعد ذلك.
وتشمل التطبيقات المشتركة قياس ضغط الدم قبل العلاج وبعده في نفس المرضى، ومقارنة درجات الاختبار قبل وبعد تدخل تعليمي، أو تقييم فعالية برنامج التدريب عن طريق قياس الأداء في نقطتين زمنيتين.
فهم الافتراضات المتعلقة باختبارات
قبل إجراء اختبارات، من المهم التحقق من أن بياناتك تفي ببعض الافتراضات، إن انتهاك هذه الافتراضات قد يؤدي إلى نتائج غير دقيقة واستنتاجات غير صحيحة، الشروط المطلوبة لإجراء الاختبار تشمل القيم المقيسة في نطاق النسب أو النطاق المتقاطع، واستخراج عشوائي بسيط، وتوزيع البيانات بشكل طبيعي، وحجم العينة المناسب، وتجانس الفرق.
الاستهلاك 1: جدول القياس
ويحتاج المتغير المعال (متغير الفائدة) إلى نطاق مستمر (أي أن البيانات تحتاج إلى قياس ممتد أو قياس نسبي) مما يعني أن متغير نتائجك ينبغي قياسه على نطاق يكون فيه الفارق بين القيم ذا معنى ومتسقة، وتشمل الأمثلة الوزن والطول وسجلات الاختبار ووقت التفاعل ودرجة الحرارة والدخل.
البيانات القاطعة أو الموحدة (مثل التصنيفات أو الفئات) ليست مناسبة للاختبارات، وإذا كان لديك بيانات عادية، فعليك أن تنظر في البدائل غير المتكافئة بدلاً من ذلك.
الاستهلاك 2: استقلال الملاحظات
ويجب أن تكون الملاحظات داخل كل مجموعة مستقلة عن بعضها البعض، وإذا ما قارنت مجموعتين، يجب أن تكون المجموعات نفسها مستقلة (بالنسبة للاختبارات المستقلة)، ويتم تناول هذا الافتراض أساسا من خلال تصميم البحوث وإجراءات جمع البيانات على النحو المناسب.
الإستقلال يعني أنّه لا ينبغي لنتيجة أحد المشاركين أن تؤثر على سجل مشارك آخر، هذا يتمّ عادةً من خلال أخذ عينات عشوائية أو تكليف جماعي، انتهاكات الاستقلال يمكن أن تحدث عندما تكون قد اتخذت تدابير متكررة من نفس الموضوعات (التي تتطلب اختباراً مُقترناً بدلاً من ذلك)، عندما تكون هناك مجموعات في بياناتك (مثل الطلاب في الصفوف الدراسية)، أو عندما يكون هناك تلوث بين المجموعات.
الاستهلاك 3: التطبيع
وينبغي توزيع البيانات المتعلقة بالمتغير المعال داخل كل مجموعة (للعينات المستقلة التي تجرى اختبارات) أو توزيع الاختلافات بين الملاحظات المقترنة (للعينات المقترنة التي تختبر) توزيعاً عادياً تقريباً، ويعني الافتراض الطبيعي أن البيانات تتبع منحنى على شكل جرس.
ويمكن تقييم التطبيع بصريا باستخدام رسومات الهوتوغرافية أو قطع الأرض ذات التردد العالي، أو استخدام اختبارات من الناحية الإحصائية مثل اختبارات شابيرو - ويلك أو اختبار كولموغوروف - سمرنوف، ويشمل التفتيش البصري وضع خريطة تاريخية لبياناتكم والتحقق مما إذا كان يشبه منحنى الجرس، أو فحص مؤامرة من نوع Q-Q (المربع) حيث تسقط النقاط عادة على خط مستقيم.
ومن المهم ملاحظة أن الاختبارات ذات قوة نسبية للانتهاكات البسيطة للطبيعية، لا سيما مع حجم العينات الأكبر حجما، حيث يبلغ حجم العينة 20 أو أكثر، ثم يكون افتراض التطبيع في توزيع الوسائل آمنا جدا، وهذا الوطأة يرجع إلى نظرية الحدود المركزية، التي تنص على أن توزيع العينة يعني التطبيع مع زيادة حجم العينة، بغض النظر عن التوزيع السكاني الأساسي.
بالنسبة للاختبارات المقترنة، نحن نطالب فقط بأن يكون الفرق بين كل زوج موزعاً عادةً، هذا تمييز هام - لا تحتاج إلى التحقق من طبيعة القياسات الأصلية، فقط الاختلافات بين الملاحظات المقترنة.
الاستهلاك 4: تجانس الفرق
وافتراض وجود تجانس في الفرق هو افتراض أن العينتين المستقلتين T-test و ANOVA اللتين تنصان على أن جميع مجموعات المقارنة لها نفس الفرق، وهذا الافتراض، الذي يسمى أيضا المساواة في الفروق أو التحيز، يتطلب أن يكون توزيع الدرجات مماثلا بين المجموعات.
افتراض تجانس الفرق يمكن اختباره باستخدام اختبار ليفين للمساواة في البدائل، الذي ينتج في إحصاءات SPSS عند إجراء الاختبار المستقل، معظم البرامجيات الإحصائية تؤدي تلقائياً هذا الاختبار عندما تجري فحصاً مستقلاً.
إذا كان هذا الإختبار غير مهم، هذا يعني أن لديك تجانس في الفرق بين المجموعتين على المُعتمد أو المُتغير الناتجي، على العكس من ذلك، إذا كان اختبار (ليفين) كبيراً، فهذا يعني أن المجموعتين لم تظهرا تجانس الفرق على المُعوّل أو المُتغير في النتائج.
عندما تكون نسب حجم العينة بين المجموعات مختلفة، ينبغي إيلاء اهتمام أكبر لتجانس الفرق، أحد الافتراضات الأساسية للاختبار، الفروق غير المتساوية، مع عدم المساواة في أحجام العينة يمكن أن تؤدي إلى معدلات خطأ من النوع الأول، بمعنى أن من الأرجح أن تستنتج بشكل غير صحيح أن هناك فرقا كبيرا عندما لا يكون هناك فرق.
خطوات لإجراء اختبارات للخصائص المستقلة
الآن بعد أن تفهمي أنواع الاختبارات وافتراضاتها لنمشي في العملية التفصيلية لإجراء اختبارات مستقلة، وهذا هو أكثر نوع شائع يستخدم لمقارنة مجموعات العلاج.
الخطوة 1: تكوين نظرياتك
كل اختبار إحصائي يبدأ بفرضيات واضحة الافتراض الباطل يمثل الموقف الافتراضي لعدم وجود تأثير أو عدم وجود فرق
بالنسبة لعينات مستقلة تقارن مجموعتين للعلاج، ستكون نظرياتك:
- Null Hypothesis (H0): ] There is no difference between the mean of treatment group 1 and the mean of treatment group 2. Mathematically: mi1 = mi2
- Alternative Hypothesis (H1): ] There is a significant difference between the means of the two treatment groups. Mathematically: chlor1 ⁇ ⁇ micro2
هذه التركيبة تمثل اختباراً مُطابقاً، و هذا مناسب عندما لا يكون لديك توقع توجيهي محدد، إذا كان لديك توقع محدد حول أي مجموعة ستكون لها لئيمة، يمكنك استخدام اختبار مُطلّقة، لكن الاختبارات ذات الميزانين عموماً أكثر تحفظاً ومقبولة على نطاق واسع في البحث.
الخطوة 2: تحديد مستوى إشارتك
أفترض أنك وضعت ألفا = 0.05 عند مقارنة مجموعتين مستقلتين، وهنا قررتم أن نسبة 5 في المائة من خطر إبرام وسائل السكان غير المعروفة مختلفة عندما لا تكون مختلفة، ويمثل مستوى الأهمية (ألفا) عتبة تحديد الأهمية الإحصائية.
مستوى الأهمية الأكثر شيوعاً هو 0.05 مما يعني أنك على استعداد لقبول 5٪ فرصة لإحداث خطأ من النوع الأول (يرفض الفرضية الباطلة عندما تكون صحيحة)
الخطوة 3: جمع وتنظيم بياناتك
جمع البيانات من مجموعتي العلاج تأكدي من أن طرق جمع البيانات دقيقة وأنك تتبعت إجراءات عشوائية مناسبة إذا كان ذلك ممكناً
على سبيل المثال، إذا كنت تقارن دواءين للألم، ربما لديك:
- المجموعة 1 (الدراج ألف): معدلات الألم من 30 مريضا
- المجموعة 2 (الدراج باء): معدلات الألم من 30 مريضا
سجل حجم العينة لكل مجموعة (إن 1 و ن2) كما ستحتاج هذه القيم لحساباتك، ومن الممارسات الجيدة أيضاً حساب الإحصاءات الوصفية الأساسية في هذه المرحلة، بما في ذلك الانحراف الحاد والمعيار لكل مجموعة.
الخطوة 4: التحقق من الافتراضات
قبل المضي قدماً في الاختبار، التحقق من أن بياناتكم تفي بالافتراضات الضرورية، وهذه خطوة حاسمة كثيراً ما تغفل، ولكنها يمكن أن تؤثر تأثيراً كبيراً على صحة نتائجكم.
Check for normality:] Create histograms or Q-Q plots for each group. If your sample size is small (less than 30 per group), consider running a Shapiro-Wilk test. remember that the t-test is fairly robust to violations of normality, especially with larger samples.
معظم البرامج الإحصائية ستؤدي تلقائياً اختبار (ليفين) عندما تجري عينات مستقلة يمكنك أيضاً أن تقارن بصرياً انتشار البيانات في كل مجموعة باستخدام أقراص
Check for outliers:] Examine your data for extreme values that might unduly influence your results. Boxplots are useful for identifying outliers. If you find outliers, investigate whether they represent data entry errors, measurement errors, or legitimate extreme values.
Verify independence:] Review your research design and data collection procedures to ensure observations are independent. This is typically a design issue rather than something you can test statistically.
الخطوة 5: حساب الإحصاءات الوصفية
قبل حساب الإحصاءات الإحصائية، تُحسب الإحصاءات الوصفية التالية لكل مجموعة:
- حجم العينات (ن 1 و ن2)
- العينة (XI و X 02)
- الانحراف المعياري العيني (المادة 1 والمادة 2)
- الفرق العيني (12 و 22)
هذه القيم ستستخدم في حساباتك الخاصة بالاختبار وينبغي أيضاً الإبلاغ عنها في نتائجك لإعطاء القراء صورة كاملة لبياناتك
الخطوة 6: حساب التطور
التدابير الإحصائية التي تُحدّد كمّ من الأخطاء القياسية التي يُحدّد الفرق بين العينة يعنيها الصفر (قيمة افتراضية باطلة) والصيغة التي تُستشف منها العينات المستقلة هي:
t = (XF1 - X]2) / SE]
أين:
- X 01 = متوسط المجموعة 1
- X 2 = متوسط المجموعة 2
- SE = الخطأ المعياري للفرق بين الوسائل
الخطأ المعياري يحسب بشكل مختلف حسب ما إذا كنت تفترض الفروق المتساوية
SE = √ [s2pooled × (1/n1 + 1/n2)] ]
حيث يكون الفرق المجمّع:
s2pooled = [(n1-1)s12 + (n2-1)s22]/(n1 + n2-2)
ويجمع هذا النهج المجمّع للفروق بين المعلومات الواردة من كلتا المجموعتين لوضع تقدير وحيد للفروق، يستخدم بعد ذلك لحساب الخطأ المعياري.
الخطوة 7: تحديد درجات الحرية
تمثل درجات الحرية (د) عدد المعلومات المستقلة المتاحة لتقدير البارامترات، وبالنسبة لعينات مستقلة من الاختبارات التي تنطوي على اختلافات متساوية، تُحسب درجات الحرية على النحو التالي:
df = n1 + n2 - 2]
على سبيل المثال، إذا كان لديك 30 مشاركاً في المجموعة 1 و30 في المجموعة 2، درجات حريتك ستكون 30 + 30 - 2 = 58.
درجات الحرية حاسمة لأنها تحدد أي نوع من التوزيع ستستخدمه لإيجاد قيمتك و قيمتك الحيوية
الخطوة 8: العثور على القيمة الحرجة والصورة
وباستخدام جدول توزيع مقطعي أو برامج إحصائية، تجد قيمة حرفية حاسمة تتناسب مع مستوى مغزى اختيارك (نحو 0.05) ودرجات حريتك، وبالنسبة لتجربة ذات شقين تبلغ صفر و5 سنتات و5 سنتات = 58، ستكون القيمة الحرجة زهاء 2.00.
القيمة تمثل احتمال الحصول على إحصاء تقريبي (أو أكثر تطرفاً من) الذي حسبته، على افتراض أن الفرضية الباطلة صحيحة، فالقيمة تعطي احتمالية مراقبة نتائج الاختبار تحت فرضية لاغية.
وكلما انخفض سعر الفائدة، انخفض احتمال الحصول على نتيجة مثل النتيجة التي لوحظت إذا كانت الفرضية الباطلة صحيحة، وبالتالي، فإن انخفاض القيمة يدل على انخفاض الدعم للفرضية الباطلة.
الخطوة 9: اتخاذ قرارك
مقارنة مع القيمة الحاسمة لإحصاءاتك المحسوبة أو مقارنة قيمة قيمتك بمستوى أهميتك:
- If ⁇ t-calculated ⁇ > t-critical] (أو إذا كان الافتراض باطل < Á): Reject the null hypothesis. This indicates a statistically significant difference between the treatment groups.
- If ⁇ t-calculated ⁇ ” ' ritical (أو إذا كان تقدير مقياس مقياس ألفا): عدم رفض الفرضية الباطلة، وهذا يدل على عدم كفاية الأدلة لإبرام فرق كبير.
من المهم ملاحظة أن "الفشل في رفض فرضية الإلغاء" ليس نفس "إقرار الفرضية الباطلة" أو "عدم وجود فرق" بل يعني ببساطة أنه ليس لديك دليل كاف لإبرام فرق قائم على بياناتك و مستوى الأهمية المختار
"عندما تكون "التغيرات غير متساوية
إذا لم يتم الوفاء بافتراض الفرق من أجل اختبار 2 ملم ولكن البيانات عادة ما توزع، هناك اختبار (ويلتش) تقريباً يمكن تطبيقه، اختبار (ويلش) هو تعديل العينات المستقلة القياسية التي لا تنطوي على فرق متساوية بين المجموعات
عندما يشير اختبار (ليفين) إلى أن الفروق تختلف اختلافاً كبيراً بين مجموعاتك، يجب أن تستخدم اختبار (ويلتش) بدلاً من الاختبار القياسي، معظم البرامج الإحصائية توفر تلقائياً نسختين من الاختبار، مما يسمح لك باختيار الشخص المناسب بناءً على نتائج اختبار التجانس.
اختبار (ويلش) يستخدم صيغة مختلفة لحساب الخطأ ودرجات الحرية القياسية درجات الحرارة أكثر تعقيداً وعادة ما تسفر عن قيمة غير متفجرة
إجراء تجربة عينات من طراز Paired T
عندما تتكون بياناتك من زوجين متطابقين أو تدابير متكررة من نفس المواضيع ستستخدم عينات مدمجة بدلاً من عينات مستقلة
الكشافة المحسوبة
الخطوة الأولى التي تنفرد بها الاختبارات المدمجة هي حساب قيمة الفرق لكل زوج من الزوجين، لكل موضوع أو زوج مطابق،
d = X1 - X2]
هذه الأرقام أصبحت بياناتك للتحليل، الاختبارات المُزجّة هي بالضبط اختبار العينة الواحدة استناداً إلى الفرق بين كل زوج
حساب T-Statistic for Paired Data
ويحسب الإحصاء الخاص باختبارات مقترنة على النحو التالي:
t = (dn- 0)/(sd/ √)]
أين:
- / = يعني الفرق
- (د) = الانحراف المعياري لسجلات الفرق
- n = عدد الأزواج
- صفر = الفرق الافتراضي المتوسط (عادة صفر)
درجات الحرية للاختبارات المُزدحمة هي ببساطة نون - 1 حيث عدد الأزواج
الافتراضات المتعلقة باختبارات Paired T
ولتطبيق الاختبار المختلط لاختبار الفروق بين القياسات المقترنة، يتعين أن تكون الافتراضات التالية قائمة: يجب أن تكون المواضيع مستقلة، ولا تؤثر القياسات الخاصة بموضوع واحد على القياسات لأي موضوع آخر، ويجب الحصول على كل قياس من القياسات المقترنة من نفس الموضوع.
بالإضافة إلى أن الاختلافات المقاسية توزع عادةً ملاحظة أنك تفحص درجات الاختلاف وليس القياسات الأصلية
تفسير نتائج التجارب
التفسير السليم للنتائج التي ستتعرض لها تتجاوز مجرد القول إن النتيجة هي "كبيرة" أو "غير مهمة"
الأثر الإحصائي
إذا كانت قيمتك أقل من مستوى مغزى محدد مسبقاً (نحو 0.05)، فإنكم ترفضون فرضية لاغية وتستنتجون أن هناك فرقاً كبيراً من الناحية الإحصائية بين المجموعات، وهذا يعني أن الفرق الملحوظ لا يحتمل أن يحدث إلا بالصدفة.
إذا كانت قيمتك أكبر من مستوى مغزى أو مساوياً لمستوى مغزى الخاص بك، فإنك لا ترفض فرضية باطلة، وهذا يعني أنه ليس لديك دليل كاف لإبرام فرق كبير، ولكن هذا لا يثبت أن المجموعات متطابقة، بل يعني ببساطة أن أي فرق قد يكون من المعقول أن يكون نتيجة تغيير عشوائي.
الأثر العملي والحجم الأثري
الأهمية الإحصائية لا تعني بالضرورة أهمية عملية أو سريرية، فربما يكون الفرق الصغير بين المجموعات كبيراً من الناحية الإحصائية إذا كان لديك عينة كبيرة، لكن هذا الفرق قد لا يكون ذا معنى من الناحية العملية.
قياس حجم التأثيرات يقدم معلومات عن حجم الفرق بين المجموعات، بغض النظر عن حجم العينة، (كوهين) هو أكثر مقياس للأثر المستخدم في الاختبارات، وهو يمثل الفرق بين الوسائل في وحدات الانحراف القياسية:
Cohen's d = (XI - X 02) / spooled ]
المبادئ التوجيهية العامة لتفسير (كوهين) هي:
- الأثر الصغير: (د) = 0.2
- متوسط الأثر: (د) = 0.5
- الأثر الكبير: (د) = 0.8
إن النتيجة ذات الأهمية الإحصائية التي لها حجم ضئيل من الأثر قد لا تكون مهمة عمليا، في حين أن حجم التأثير الكبير الذي لا يصل إلى الأهمية الإحصائية (من حيث حجم العينات الصغيرة) قد لا يزال يستحق الاهتمام ويستدعي مزيدا من التحقيق.
فترات الثقة
بالإضافة إلى القيمة، يجب أن تبلغوا عن فترات الثقة للفرق بين الوسائل، حيث أن نسبة 95 في المائة من الثقة توفر مجموعة من القيم التي يمكن أن تكونوا فيها 95 في المائة واثقين من الفرق الحقيقي للسكان.
إذا كان فارق الثقة بين الوسائل يشمل صفراً، فإن هذا يطابق نتيجة غير مهمة (على مستوى 0.05) وإذا لم يشمل الفارق صفراً، فإن النتيجة كبيرة، ففترات الثقة توفر معلومات أكثر من قيمة فقط لأنها تبين اتجاه وحجم الأثر.
الإبلاغ عن نتائج التجارب
وعند الإبلاغ عن نتيجة الاختبار المستقل، يجب أن تشمل القيمة الإحصائية، ودرجات الحرية (د) وقيمة الاختبار (بقيمة القيمة)، وشكل نتيجة الاختبار هو: t(df) = t-statistic, p = القيمة الدالة.
وينبغي أن يتضمن التقرير الكامل عن النتائج التي ستتحقق:
- إحصاءات وصفية لكل مجموعة (عنصران، انحرافات معيارية، أحجام عينات)
- نتائج اختبار الافتراض (اختبارات الشذوذ، اختبار (ليفين
- درجة حريّة، وقيمة
- حجم التأثير (كوهين د)
- الفارق بين الوسائل
- بيان واضح لاستنتاجكم في سياق سؤالكم البحثي
على سبيل المثال: "أجريت عينات مستقلة لمقارنة درجات الألم بين المرضى الذين يتلقون المخدرات ألف والمخدرات باء. وبيفين، أظهرت الفروق المتساوية (F = 1.23، ص = 27) وقد أفادت المرضى الذين يتلقون المخدرات ألف (م = 4.2، و SD = 1.5، و n = 30) عن انخفاض كبير في معدلات الألم مقارنة بالمرضى الذين يتلقون المخدرات باء (م = 5.8, SD = 1.6, n)
حالات سوء السلوك المشتركة إلى أفويد
فهم المجازفة المشتركة يمكن أن يساعدك على إجراء اختبارات أكثر صرامة وتجنب الأخطاء التي يمكن أن تبطل نتائجك
الاستهلاك المشتعل
ومن بين أكثر الأخطاء شيوعا عدم التحقق مما إذا كانت بياناتكم تفي بافتراضات الاختبارات، فبينما تكون الاختبارات قوية نسبيا إزاء الانتهاكات الطفيفة، فإن الانتهاكات الخطيرة يمكن أن تؤدي إلى استنتاجات غير صحيحة، وتتحقق دائما من التطبيع، وتجانس الفرق، والاستقلال قبل تفسير نتائجكم.
استخدام النوع الخاطئ من التجارب
والاختيار بين الاختبارات المستقلة والاختبارات المدمجة أمر حاسم، إذ أن استخدام عينات مستقلة تختبرها عندما تكون لديك بيانات مقترنة (أو العكس) ستعطيك نتائج غير صحيحة، والسؤال الرئيسي هو ما إذا كانت ملاحظاتك مستقلة أو ذات صلة، وإذا قيست نفس المواضيع مرتين، أو إذا كانت المواضيع مطابقة في أزواج، استخدم اختباراً مقترناً.
بثقة إحصائية وعملية
النتيجة المهمة إحصائياً لا تعني تلقائياً أن النتيجة مهمة أو مجدية دائماً ما تعتبر حجم التأثيرات والآثار العملية لنتائجك
اختبارات متعددة بدون تصحيح
إذا أجريت اختبارات متعددة على نفس مجموعة البيانات، ستزيد من مخاطرة الأخطاء من النوع الأول (الإيجابيات) كل اختبار على مستوى 0.05 لديه فرصة 5٪ لإنتاج نتيجة كبيرة بالصدفة، إذا أجريت 20 اختباراً، ستتوقع نتيجة مهمة فقط، عندما تجري مقارنات متعددة،
الإبلاغ غير الكامل
الإبلاغ عن الـ "p < 05 " غير كاف، يحتاج القراء إلى معرفة القيمة الفعلية (أو على الأقل ما إذا كانت تبلغ 039؛ أقل من 0,1 أو 001)، ودرجة حريّة، وإحصاءات وصفية، وأحجام التأثير لفهم نتائجك فهماً كاملاً.
استخدام برامجيات إحصائية للتجارب
وفي حين أن فهم الأسس الرياضية للاختبارات من المهم، فإن معظم الباحثين يستخدمون البرمجيات الإحصائية لإجراء الحسابات الفعلية، مما يقلل من الأخطاء الحسابية ويوفر نواتج شاملة تشمل اختبارات الافتراض، وحجم التأثير، وفترات الثقة.
SPSS
وتستخدم الشبكة (الحزمة الإحصائية للعلوم الاجتماعية) على نطاق واسع في العلوم الاجتماعية وعلم النفس والبحوث الصحية، ولإجراء اختبار مستقل لعينات في SPSS، وبحرية لتحليل > < > اختبارات > العينات المستقلة > ، واختيار متغيراتكم المعالة والمتغيرات الجماعية، ثم تحديد الفئات التي ترغب في المقارنة.
(الجهاز الآلي (يُقدم فحص (ليفين من أجل المساواة في الفروق ويعطيك نتائج لكل من الفرق المتساوي المفترض والفروق المتساوية التي لم تُفترض (اختبار (ويلش
البرمجة
R هو لغة برمجة إحصائية حرة ومفتوحة المصدر، التي تزداد شعبيتها في البحث، المهمة الأساسية لإجراء اختبار في R هي T.test for an independent samples t-test, you would use:
t.test(outcome: group, data = mydata, var.equal = TRUE)]
(الإستعراض المتساوي (فالسي) سيُجري اختبار (ويلك
وتوفر R مرونة واسعة النطاق في التلاعب بالبيانات، والتصوير البصري، والتحليلات الإحصائية المتقدمة، ويمكنك بسهولة أن تخلق رسوماً بيانية ذات جودة النشر، وأن تجري اختباراً للافتراض باستخدام مجموعات مثل الكمبيدروك والسيارات.
Excel
بينما لا تكون متطورة كبرمجيات إحصائية مكرسه، يمكن لـ(مايكروسوفت إكسل) أن يقوم باختبارات أساسية، وظيفة (تي تيس) يمكن أن تجري اختبارات مستقلة ومزوجة على حد سواء، لكن (إكسيل) لا يفحص تلقائياً الافتراضات أو يقدم ناتجاً شاملاً، لذا فهو أفضل مناسب لإجراء تحليلات بسيطة أو استكشافات أولية.
ومن أجل إجراء بحوث أكثر صرامة، يوصى ببرمجيات إحصائية مكرسة لأن هذه البرامج توفر نواتج أكثر اكتمالا، وتعالج بشكل أفضل البيانات المفقودة، وتشمل اختبار الافتراض المبني.
Python
ويتزايد استخدام بيتسون، الذي يضم مكتبات مثل SciPy و statsmodels، في التحليل الإحصائي، ولا سيما في سياقات علوم البيانات، وتشمل نماذج الإحصاءات المتعلقة بالبصيرة، مهام إجراء الاختبارات التالية:
from scipy import stats
]stats.ttest ind(group1, group2) for independent samples
]stats.ttest rel(for, after)
ويقدم بيتسون تكاملا ممتازا مع التلاعب بالبيانات (باندا) والمكتبات المرئية (العمومات، والمولود البحري)، مما يجعله خيارا قويا لتدفقات العمل الشاملة لتحليل البيانات.
بدائل التجارب
وفي حين أن الاختبارات التجارية قوية وقابلة للتطبيق على نطاق واسع، هناك حالات تكون فيها الأساليب الإحصائية البديلة أكثر ملاءمة.
الاختبارات غير المعيارية
وإذا لم توزع البيانات عادة، ولا يمكن تحويلها للوفاء بافتراض التطبيع، فإننا سنضطر إلى استخدام اختبار غير قياسي، يستخدم عادة الرتب بدلا من البيانات الأولية، ويقل قوة الاختبارات شبه المتماثلة، ولكنها لا تتطلب نفس الافتراضات التي تتطلبها اختبارات البارامترات.
المكافئ غير المتماثل لتجربة 2 ملمع هو اختبار مانين - وهيتيني المعروف أيضاً باختبار مانين - وهيتيني أو اختبار ويلكسون للدرجة القصوى، هذا الاختبار يقارن توزيع مجموعتين مستقلتين دون افتراض طبيعتهما، ويستند إلى جميع الملاحظات من كلا المجموعتين ويقارن مجموعتين.
ويمكن استخدام اختبار ويلكوكسون الموقع (للعينات المدمجة) في البيانات المقترنة، وهذا الاختبار هو المكافئ غير المتماثل للاختبار الثنائي، وهو مناسب عندما لا توزع الاختلافات بين الزوجين عادة.
ANOVA for Multiple Groups
إذا كنت بحاجة إلى مقارنة أكثر من مجموعتين، ينبغي أن تستخدم تحليل الفرق بدلا من إجراء اختبارات متعددة، وتختبر الأنوفا ما إذا كانت هناك أي اختلافات كبيرة بين ثلاث أو أكثر من الوسائل الجماعية بينما تتحكم في معدل الخطأ من النوع الأول.
فإجراء اختبارات متعددة على أساس ثنائي يُنمّ من مخاطرة حدوث إيجابيات كاذبة، فعلى سبيل المثال، يتطلب مقارنة ثلاث مجموعات ثلاث اختبارات (مجموعة 1 ضد 2، المجموعة 1 ضد 3، المجموعة 2 ضد 3)، وكلها مع معدل خطأ بنسبة 5 في المائة، مما يؤدي إلى ارتفاع كبير في معدل الخطأ العام.
تحليل التراجع
عندما تكون لديك متغيرات إضافية تريد التحكم بها أو عندما تريد فحص العلاقة بين التنبؤ المستمر والناتج ربما يكون تحليل التراجع أكثر ملاءمة من الاختبارات
عينات الحجم
وحجم العينة في دراستكم له آثار هامة على صحة وقوة اختباركم، وعادة ما تكون الدراسات السريرية ذات أحجام صغيرة من العينات، وحجم العينة الأصغر، وزاد تأثير قيم فرادى العينات على الفروق.
تحليل الطاقة
قبل إجراء دراستك، يجب أن تقوم بتحليل الطاقة لتحديد حجم العينة المطلوبة لكشف تأثير حجم معين مع قوة إحصائية كافية، السلطة تشير إلى احتمال رفض الفرضية الباطلة بشكل صحيح عندما تكون كاذبة (أي كشف الأثر الحقيقي).
وتشير المعايير التقليدية إلى أن نسبة القوة 80 في المائة، مما يعني أن لديك نسبة 80 في المائة من فرص الكشف عن أثر حقيقي إذا كان هناك أحد، وتعتمد السلطة على أربعة عوامل مترابطة: حجم العينة، وحجم الأثر، ومستوى الأهمية (ألفا)، والاختبار الإحصائي الذي يجري استخدامه.
إذا كنت تتوقع حجم تأثير كبير، ربما تحتاج عينة أصغر إذا كنت تبحث عن آثار صغيرة، ستحتاج عينات أكبر لتحقيق الطاقة الكافية، العديد من أجهزة الكمبيوتر المحمولة على الإنترنت وحزم البرامجيات (مثل G*Power) يمكن أن تساعدك في إجراء تحليلات الطاقة للاختبارات
التوصيات المتعلقة بحجم العينات الدنيا
واستنادا إلى المبادئ التوجيهية للتوزيع الطبيعي، حيث يكون 30 مشاركا لكل مجموعة مثالية للحصول على نتيجة مستقرة، فقد قررت دراسات المحاكاة أنه عندما يكون حجم العينة صفرا > 20 < لكل مجموعة، وإذا كانت المجموعتان متساويتان في الحجم، فإن الاختبارات ينبغي أن تسفر عن نتائج إحصائية قوية ومستقرة.
غير أن هذه المبادئ التوجيهية عامة، حيث أن حجم العينة الفعلي الذي تحتاجه يتوقف على سياق البحث المحدد، وحجم الأثر المتوقع، ومستوى الطاقة المرغوب فيه، وقد تكون العينات الأصغر مقبولة لكشف الآثار الكبيرة، بينما يتطلب الكشف عن الآثار الصغيرة عينات أكبر.
الاعتبارات المسبقة
1 - 3 ضد 2 - 3
معظم الاختبارات ذات شقين، يعني أنك تختبر أي فرق بين المجموعات دون تحديد اتجاه، لكن إذا كان لديك سبب نظري قوي للتنبؤ باتجاه الفرق قبل جمع البيانات، قد تستخدم اختباراً واحداً.
اختبارات ذات مقاس واحد أقوى لكشف الآثار في الاتجاه المتوقع ولكن لا يمكن كشف الآثار في الاتجاه المعاكس، ولا ينبغي استخدامها إلا عندما يكون لديك فرضية واضحة بشأن اتجاه الأثر وعندما يكون العثور على أثر في الاتجاه المعاكس أمراً نظرياً لا معنى له أو مستحيلاً.
اختبارات مطابقين مفضّلة عموماً في البحث لأنها أكثر تحفظاً ولا تطلب منك تحديد اتجاه مقدماً معظم المجلات والمستعرضين يتوقعون اختبارات ذات شقين ما لم يكن هناك مبرر مقنع لنهج واحد
معالجة البيانات المفقودة
إن البيانات المفقودة تحد مشترك في البحث، وأبسط نهج هو تحليل الحالات (حذف الأسماء من القائمة)، حيث تستبعد أي مشارك من البيانات المفقودة، غير أن هذا يمكن أن يقلل من حجم العينة وقوتك الإحصائية، وقد يؤدي إلى تحيز إذا لم تكن البيانات غير مفقودة تماماً عشوائياً.
ومن بين النهج الأكثر تطوراً التلاعب المتعدد، حيث تقدر القيم المفقودة استناداً إلى متغيرات أخرى في مجموعة بياناتكم، أو تقدير أقصى الاحتمالات، ويتوقف الأسلوب المناسب على نمط وآلية الفقد في بياناتكم.
التعامل مع المتفوقين
يمكن للمتفرجين أن يكون لديهم تأثير كبير على نتائج الاختبارات خاصة مع حجم العينات الصغيرة عندما تحدد المخارج، أولاً تحقق من أنها ليست أخطاء في إدخال البيانات أو القياس
- يُسفر التقرير عن تقييم أثره سواء مع جهات خارجية أو بدونها
- استخدام أساليب إحصائية قوية أقل حساسية من الخارج
- تحويل بياناتك لتقليل تأثير القيم القصوى
- استخدام الاختبارات غير المتكافئة التي تتأثر بدرجة أقل بالأطراف النائية
لا تزيلوا التجاوزات ببساطة لأنهم لا يدعمون فرضيتك أي قرار باستبعاد نقاط البيانات يجب أن يتم بناء على معايير موضوعية تم تحديدها قبل تحليل البيانات
التطبيقات العالمية الحقيقية
المحاكمات السريرية
اختبارات الأشعة هي أساسية في البحوث السريرية لمقارنة نتائج العلاج، مثلاً، شركة صيدلانية قد تستخدم عينات مستقلة لمقارنة خفض ضغط الدم بين المرضى الذين يتلقون علاجاً جديداً مقابل متشرد، وقد تستخدم اختبارات البيرد لمقارنة أعراض المرضى قبل العلاج وبعده.
في السياقات السريرية، كل من الأهمية الإحصائية والعيادية مهمة، العلاج قد ينتج تحسيناً كبيراً إحصائياً، لكن إذا كان حجم التحسن ضئيلاً جداً ليُهم نوعية حياة المرضى، قد لا يكون مفيداً من الناحية السريرية.
البحوث التعليمية
المعلمون يستخدمون الاختبارات كثيراً لتقييم التدخلات التعليمية، على سبيل المثال، قد يقارن الباحث بين درجات الاختبار بين الطلاب المتعلمين بطريقة تعليمية جديدة وطريقة تقليدية (عينات مستقلة) أو يقارن بين درجات الطلاب السابقة للتجربة و بعد الاختبار بعد تدخل (عينات مُعدّلة).
وفي الأوساط التعليمية، تتسم أحجام الأثر بأهمية خاصة لأنها تساعد المعلمين على فهم ما إذا كان التدخل يعمل فحسب، ولكن كم يُحدث من التحسن مقارنة بالجهد والموارد المطلوبة.
علم النفس والعلوم الاجتماعية
وكثيرا ما تستخدم البحوث النفسية اختبارات لمقارنة المجموعات بشأن مختلف التدابير، ومن الأمثلة على ذلك مقارنة مستويات القلق بين مجموعات العلاج والمراقبة، ومقارنة أوقات التفاعل بين مختلف الظروف التجريبية، أو دراسة الفوارق بين الجنسين في المواقف أو السلوكيات.
في هذه المجالات، يجب أن يكون الباحثون حذرين بشكل خاص بشأن الافتراضات، حيث أن المتغيرات النفسية لا تفي تماماً بافتراضات التطبيع، وفحص الافتراضات والنظر في البدائل غير المتكافئة عند الضرورة أمر حاسم.
الأعمال التجارية والتسويق
وتستخدم الشركات الاختبارات التي تستخدمها لاتخاذ قرارات تستند إلى البيانات، وقد تقارن الشركة بين درجات رضا العملاء وبين نموذجين للخدمات، أو مقارنة أداء المبيعات بين منطقتين، أو تقييم فعالية مختلف حملات التسويق باستخدام اختبارات A/B.
وفي سياقات الأعمال، كثيرا ما تكون الأهمية العملية أكثر من الأهمية الإحصائية، وقد لا تكون هناك زيادة كبيرة من الناحية الإحصائية في المبيعات تستحق السعي إذا كانت الزيادة الفعلية ضئيلة جدا لتعويض تكاليف التنفيذ.
أفضل الممارسات والتوصيات
لضمان تحليلك للاختبارات دقيقة ونتائجك صحيحة، اتبع هذه الممارسات الفضلى:
- Plan your analysis before collecting data:] Determine your hypotheses, significance level, and required sample size through power analysis before beginning data collection.
- لا تفوت اختبار الافتراضات، استخدمي كلا المنهجين البصري (التاريخ، قطع الأرض، الكم) والاختبارات الإحصائية (Shapiro-Wilk، اختبار ليفين) للتحقق من بياناتك
- Usese appropriate software:] While manual calculations help you understand the process, use statistical software for actual analyses to reduce errors and obtain comprehensive output.
- Report completely:] Include descriptive statistics, assuming test results, the t-statistic, degrees of freedom, exact p-values, effect sizes, and confidence intervals in your reports.
- لا تعتمد على القيم فقط، دائماً ما تفسر نتائجك في سياق أحجام التأثير والأهمية العملية
- Be transparent about violations: ] If your data violates assumptions, acknowledge this and explain how you addressed it (e.g., using Welch's t-test for unequal variations or non-parametric alternatives for non-normal data).
- لا تجري تحليلات متعددة ولا تبلغ عن أهميتها فقط إذا أجريت اختبارات متعددة، أو استخدمت التصويبات المناسبة أو أبلغت عن جميع النتائج.
- Visualize بياناتك: ] Create graphs (such as boxplots, violin plots, or error bar charts) to help readers understand your results visually.
- Provide context:] Interpret your statistical results in the context of your research question and existing literature. What do your findings mean for theory or practice?
- Consider consulting a statistician: ] For complex designs or when you're unsure about the appropriate analysis, consulting with a statistical expert can help ensure your analysis is sound.
الموارد الإضافية
ولتعميق فهمكم للاختبارات والتحليل الإحصائي، النظر في استكشاف هذه الموارد القيمة:
- Online tutorials and courses:] websites like ]Khan Academy]] offer free statistics courses covering t-tests and other fundamental concepts.
- Statistical software documentation:] Most statistical packages provide comprehensive documentation and tutorials. The ]R Project website offers extensive resources for learning R.
- Academic textbooks:] Classic statistics textbooks provide in-depth coverage of t-tests, their mathematical foundations, and applications across different fields.
- Professional organizations:] Groups like the American Statistical Association offer resources, webinars, and publications to help researchers improve their statistical knowledge.
- Online calculators:] While not a substitute for understanding the concepts, online t-test calculators can be useful for rapid checks or learning purposes.
خاتمة
والاختبار أداة إحصائية أساسية لمقارنة مجموعات العلاج واتخاذ قرارات قائمة على الأدلة في مختلف الميادين، وباتباع عملية الخطوة الموضحة في هذا الدليل، من وضع افتراضات واضحة وفحص افتراضات لحساب الإحصاءات الاختبارية وتفسير النتائج، يمكن أن تجري اختبارات دقيقة تسفر عن نتائج صحيحة وهادفة.
تذكر أن التحليل الإحصائي ليس فقط حول حساب الأرقام والحصول على قيم، بل هو عن طرح أسئلة ذات معنى، وجمع بيانات جيدة، واستخدام الأساليب المناسبة، وتفسير النتائج في السياق، وفهم دقيق لمتى تستخدم مختلف أنواع الاختبارات، وكيفية التحقق من الافتراضات، وكيفية تفسير الأهمية الإحصائية والعملية معا، سوف تخدمك جيدا في مساعيك البحثية.
سواء كنت تقيم علاجا طبيا جديدا، مقارنة التدخلات التعليمية أو اتخاذ قرارات تجارية، الاختبار يوفر إطارا قويا لتحديد ما إذا كانت الاختلافات الملاحظة بين المجموعات من المرجح أن تعكس آثارا حقيقية أو مجرد تغير عشوائي، عن طريق اتباع هذه التقنية الإحصائية الأساسية، واتباع أفضل الممارسات في تطبيقها، ستكون مجهزة تجهيزا جيدا للإسهام في تحقيق رؤية قيمة تستند إلى الأدلة في مجالك.
وإذ تواصل تطوير مهاراتك الإحصائية، تذكر أن التعلم عملية مستمرة، وتظل على حالها مع التطورات في الأساليب الإحصائية، وتلتمس ردود الفعل بشأن تحليلاتك، ولا تتردد في التشاور مع الخبراء الإحصائيين عند مواجهة التحديات التحليلية المعقدة، ومع الممارسة والاهتمام بالتفاصيل، فإن إجراء الاختبارات وتفسيرها سيشكل جزءا لا يقدر بثمن من مجموعة أدوات البحث الخاصة بك.