Xobinتبحث عن برامج تقييم المواهب والتوظيف بالذكاء الاصطناعي؟تحقق من Xobin
← مقالات§ الوثائق الفنية

اختبار القياس النفسي من Xobin: أدلة الموثوقية والتحقق

الوثائق الفنية الكاملة وراء اختبار الحكم الظرفي لـ Xobin (SJT): النموذج السلوكي، كيفية بناء الاختبار، والدراسات المتعلقة بالموثوقية والصلاحية والعدالة التي أجريت بين 2021 و2024.

Xobin Research/2025/التوثيق الفني/الإصدار 2.9.1

المؤلف

Guruprakash Sivabalan

المؤسس، Xobin. يقود برنامج أبحاث Xobin في علم التقييم، والتحقق النفسي، وXobin Capability Graph.

LinkedIn →

تلخص هذه المقالة تقرير الوثائق الفنية لاختبار Xobin النفسي (SJT) ، الإصدار 2.9.1 ، الذي يغطي دراسات الموثوقية والصلاحية التي أجريت بين عامي 2021 و 2024. تظل محتويات العناصر، ومفاتيح التسجيل، ومجموعات البيانات على مستوى المرشحين ملكية خاصة وسرية؛ الإحصائيات المبلغ عنها هنا مستمدة من الدليل الفني.

01 ·

الملخص التنفيذي

صمم فريق Xobin من علماء النفس الصناعي والتنظيمي (I/O) وعلماء النفس القياسيين تقييمًا نفسيًا واسع النطاق للاستخدام على مستوى المؤسسات في التوظيف بكميات كبيرة، والتقييم المهني، وتطوير القيادة.

تبع التطوير مسارين. الأول بنى نموذج سلوكي متكامل يستند إلى الأبحاث الحالية في علم نفس الشخصية، علم القيادة، الذكاء العاطفي، والتفكير النقدي. الثاني صمم وصادق على اختبار الحكم الظرفي (SJT) الذي يقيس تلك الكفاءات السلوكية بدقة وكفاءة، مع الصلة، والعدالة، والدقة التنبؤية عبر الأدوار الوظيفية العالمية.

يوفر الاختبار لفرق الموارد البشرية في الشركات تقييمًا موثوقًا وشاملاً لسلوك المرشحين في سياقات التوظيف والتطوير. تظهر الأبحاث المنشورة أن المنظمات التي تستخدم الاختبارات النفسية يمكن أن تحسن من نجاح التوظيف بنسبة تصل إلى 40% وتزيد من احتفاظ الموظفين بنسبة 24%. هذه المكاسب تترجم إلى تقليل تكاليف الدوران، وفرق أكثر فعالية، وأداء أفضل.

تتواجد نزاهة التقييم في جوهر التصميم. يدمج الاختبار الأطر المعتمدة في الشخصية، ومرونة التعلم، والقيادة، والذكاء العاطفي (EQ)، والتفكير النقدي، ويقدم سيناريوهات عمل واقعية حيث تكشف أحكام المرشح عن السمات الأساسية وأسلوب اتخاذ القرار. تتراوح الاتساق الداخلي لمقاييس الكفاءة من جيد إلى ممتاز (α لـ Cronbach ≈ 0.6–0.8)، وتظهر دراسات إعادة الاختبار نتائج مستقرة على مر الزمن، ويكون تنسيق SJT ذو الخيار القسري أقل عرضة للتزييف بشكل ملحوظ من الاستبيانات التقليدية ذات التقرير الذاتي.

02 ·

التطبيق العالمي والمرونة القطاعية

تم تصميم الاختبار والتحقق من صحته ليكون قابلاً للتطبيق عالميًا وذو صلة عبر الصناعات. لقد تم توطينه وتوحيده عبر الولايات المتحدة وأوروبا والشرق الأوسط وجنوب آسيا وآسيا والمحيط الهادئ. يغطي التوطين ليس فقط الترجمة إلى أكثر من 15 لغة ولكن أيضًا التكيف الثقافي للسيناريوهات للحفاظ على الملاءمة السياقية والتكافؤ التفسيري عبر السكان.

أظهر التقييم فعالية تشغيلية عبر:

  • ·تكنولوجيا المعلومات وتطوير البرمجيات
  • ·الصناعات الدوائية وعلوم الحياة
  • ·الخدمات المصرفية، والخدمات المالية والتأمين (BFSI)
  • ·السلع الاستهلاكية سريعة الحركة (FMCG)
  • ·التجزئة
  • ·الهندسة، التصنيع والقطاعات الصناعية الأساسية
  • ·الطاقة والمرافق
  • ·الخدمات المهنية والاستشارية
  • ·الرعاية الصحية وإدارة المستشفيات

داخل هذه المجالات، يتم استخدامه لفحص عالي الحجم للأدوار المبدئية، وتوصيف سلوكي للمناصب المهنية والمتوسطة، وتقييم إمكانيات القيادة لمسارات التطوير الإداري والتنفيذي. تسمح المعايير المحددة للصناعة وبيانات المعايير بتفسير الدرجات الفردية مقابل المعيار القطاعي ذي الصلة بدلاً من متوسط عالمي واحد.

03 ·

التوافق مع المعايير النفسية

تلتزم منهجية تطوير Xobin بمعايير الجمعية النفسية البريطانية (BPS) واللجنة الدولية للاختبارات (ITC) للتقييم المهني. تتضمن دورة حياة تطوير العناصر:

  • ·نموذج الكفاءة الشامل وتحليل الوظائف
  • ·تطوير أكثر من 2,000 عنصر تجريبي، مصنف عبر مستويات الوظائف
  • ·تجريب متعدد المراحل، بما في ذلك تحليل العناصر الكلاسيكي ومعايرة نظرية استجابة العنصر (IRT)
  • ·فحص التحيز على مستوى العناصر، مؤشرات الصعوبة ومعلمات التمييز
  • ·محاكاة مونت كارلو لتحسين طول الاختبار وكفاءة القياس النفسي
  • ·التحقق من عدالة المجموعات الفرعية، الحيادية اللغوية وقابلية تعميم الدرجات عبر الفئات السكانية

تضمن هذه الطريقة أن كل تنبيه سياقي وخيار استجابة يعكس بناء سلوكي ذي صلة بالوظيفة، ويعمل بشكل متسق عبر السكان، ويساهم بشكل ذي مغزى في تقدير السمات. خضعت عناصر الحكم السياقي لتجريب دقيق وتحليلات لتأكيد أنها تعمل كما هو مقصود من حيث الصعوبة، والتمييز، وغياب التحيز، مما ينتج أداة قوية إحصائيًا وصحيحة من حيث البناء تتماشى مع أفضل الممارسات الدولية في اختيار الموظفين.

04 ·

نموذج وسياق سلوكي

النموذج مستند إلى هيكل الخمسة الكبار (OCEAN) للشخصية: الانفتاح، الضمير، الانبساط، التوافق، والاستقرار العاطفي (القلق المعكوس). وهو غني بالمفاهيم المستمدة من القيادة، والذكاء العاطفي، وأبحاث التفكير النقدي بحيث يلتقط سلوكيات العمل بشكل أكثر اكتمالاً من اختبار الشخصية التقليدي.

المرونة في التعلم (لومباردو وإيشينجر)

المرونة في التعلم هي الاستعداد والقدرة على تعلم مهارات جديدة من أجل الأداء في ظروف جديدة وصعبة أو مختلفة. في الممارسة العملية، تصبح هذه المرونة، والانفتاح على التغذية الراجعة، والابتكار، والتعلم السريع، صفات تشير إلى ما إذا كان الشخص سينجح في بيئات ديناميكية، وهي مؤشر رئيسي على القدرة القيادية في السياقات المتقلبة.

القيادة (المستويات الثلاثة لسكولر)

يعتقد سكولر (2011) أن القيادة تعمل على مستويات شخصية وخاصة وعامة: الوعي الذاتي وإتقان الذات، المهارات الشخصية من شخص لآخر، وقيادة الفريق أو المنظمة. تتوافق سمات مثل الثقة بالنفس، والنزاهة، وقدرة التدريب، والتأثير والرؤية مع هذه المستويات، لذا فإن الاختبار يغطي الكفاءات المطلوبة من المساهمين الأفراد والقادة المستقبليين على حد سواء.

الذكاء العاطفي (غولمان)

إطار عمل الذكاء العاطفي لجولمان، الذي يغطي الوعي الذاتي، التنظيم الذاتي، الدافع، التعاطف والمهارات الاجتماعية، يتم استغلاله من خلال سيناريوهات حول إدارة العواطف تحت الضغط، وإظهار التعاطف مع الزملاء أو العملاء، والتنقل في الصراع. هذه السلوكيات مهمة للعمل الجماعي، والعمل الذي يتعامل مع العملاء، والقيادة، وتمتد القياسات إلى ما هو أبعد من التفكير البحت إلى الفعالية بين الأشخاص وإدارة الذات العاطفية.

ميول التفكير النقدي (فاسيوني)

يصف Facione وآخرون (1995) الميل إلى التفكير النقدي بأنه فضول فكري، وانفتاح ذهني، وعادة التفكير في المشكلات بشكل عقلاني. يظهر هذا في التفكير التحليلي، وجودة القرار، وحل المشكلات وإدارة المخاطر: تكشف السيناريوهات عما إذا كان المرشح يتخذ قرارات بناءً على الأدلة والمنطق أو بناءً على الاندفاع والتحيز، مما يقيس كيفية تفكير الناس في المعضلات، وليس فقط كيف يتصرفون مع الآخرين.

كفاءات إضافية في مكان العمل

استعراض الأدبيات ومدخلات الصناعة حددت الصفات التي لا تغطيها الخمسة الكبار بالكامل. التواضع والنزاهة، بمعنى الصدق، والتواضع، والاعتراف بالأخطاء بدلاً من إلقاء اللوم، تتماشى مع عامل الصدق-التواضع في HEXACO (أشتون ولي، 2007). المرونة والعزيمة، المستمدة من داكويرث وآخرين (2007)، تكمل الاستقرار العاطفي من خلال التركيز على الجهد المستمر والتعافي من الانتكاسات. في المجموع، يمتد النموذج ليشمل أكثر من 50 كفاءة محددة، من بناء الثقة والتعاون إلى الابتكار والتفكير الاستراتيجي، كل منها مرتبط مفاهيمياً بإطار واحد أو أكثر من الإطارات المذكورة أعلاه.

05 ·

المجالات الستة للكفاءات

تم تنظيم أكثر من 50 كفاءة في ستة مجالات واسعة للتقييم والتفسير. يتم الإبلاغ عن الدرجات على مستوى الجوانب وتجميعها على مستوى المجالات.

الدافع والتنفيذ

الموثوقية · المبادرة · المثابرة · التركيز على الجودة · الطموح

السمات الموجهة نحو الإنجاز مرتبطة إلى حد كبير بالضمير، بالإضافة إلى جوانب الطموح والسلطة في دافع القيادة. الأشخاص الذين يحصلون على درجات عالية يعتمد عليهم، يركزون على النتائج ومثابرون؛ بينما الأشخاص الذين يحصلون على درجات منخفضة يكونون أكثر استرخاءً أو مرونة بشأن الأهداف. هذا يتماشى مع ما تسميه نماذج أخرى أسلوب المهمة: أن تكون مدبرًا ومنضبطًا.

القدرة على التكيف والتعلم

المرونة · التفكير الإبداعي · الانفتاح على التجارب · التعلم المستمر

السمات المتعلقة بالانفتاح ومرونة التعلم. أصحاب الدرجات العالية منفتحون وسريعون في اكتساب مهارات جديدة أو التكيف مع التغيير؛ يفضل أصحاب الدرجات المنخفضة الأساليب المألوفة ولكنهم يقدمون اتساقًا وتركيزًا عمليًا. يجمع المجال بين فضول Facione التحليلي ومرونة التعلم لدى Lombardo وEichinger.

التأثير والقيادة

الجرأة · الإقناع · التفويض · الرؤية الاستراتيجية · الطموح

الجوانب المتعلقة بالانفتاح والدافع للقيادة. يظهر أصحاب الدرجات العالية كقادة، مرتاحين في اتخاذ القرارات وتوجيه اتجاه الفريق. يميل أصحاب الدرجات المنخفضة إلى أن يكونوا لاعبي فريق أو مساهمين فرديين يتجنبون الأضواء. تشير هذه المجال إلى إمكانيات القيادة الإدارية وقيادة المبيعات، مما يتوافق مع مستوى القيادة العامة لScouller.

العلاقات الشخصية والعمل الجماعي

التعاطف · بناء الثقة · حل النزاعات · التواصل · التواضع · الدبلوماسية · التنوع والشمول

مركز على التوافق والذكاء الاجتماعي والعاطفي. أصحاب الدرجات العالية متعاونون، متعاطفون وموجهون نحو الفريق، يبنون علاقات إيجابية ويضعون أهداف المجموعة قبل الأنا. أصحاب الدرجات المنخفضة قد يكونون أكثر تركيزًا على المهام أو مستقلين، أحيانًا على حساب اللباقة. يشير ذلك إلى الملاءمة للتعاون، خدمة العملاء، والقيادة على المستوى الخاص، بين الأشخاص.

المرونة العاطفية وإدارة الذات

تحمل الضغوط · الإيجابية والتفاؤل · الوعي الذاتي · التحكم في الاندفاع

يتوافق مع الاستقرار العاطفي وجانب التنظيم الذاتي من الذكاء العاطفي. الأفراد ذوو الدرجات العالية يبقون هادئين تحت الضغط، ويتعافون من النكسات ويظلون متفائلين. الأفراد ذوو الدرجات المنخفضة قد يشعرون بالقلق تحت الضغط ولكن يمكن أن يكونوا أكثر شفافية مع عواطفهم. هذا مهم بشكل خاص للأدوار ذات الضغط العالي وللقيادة على المستوى الشخصي.

التفكير النقدي وصنع القرار

جودة القرار · الحكم · الانفتاح على الأدلة · إدارة المخاطر · التفكير الأخلاقي

غير معتاد بين تقييمات الشخصية، يقيم هذا المجال الاتجاهات المعرفية والسلوكية في حل المشكلات دون أن يكون اختبار قدرة خالص. يزن أصحاب الدرجات العالية التبادلات، ويأخذون في الاعتبار العواقب طويلة الأجل ويتخذون قرارات بناءً على الأدلة؛ بينما يتخذ أصحاب الدرجات المنخفضة قرارات بشكل حدسي أو سريع، وهو ما يكون فعالًا في المهام البسيطة وخطرًا في المهام المعقدة.

تم بناء النموذج بشكل تكراري: بدأ علماء النفس في Xobin من هيكل الخمسة الكبار، ثم قاموا بتخطيط أو تجميع المفاهيم من الذكاء العاطفي، ومرونة التعلم، والقيادة الأصيلة عليه بحيث لا يفوت أي شيء مهم: تم تجميع التواضع والتعاطف في العلاقات الشخصية، والطموح والسلطة في التأثير والقيادة. أنتج الحكم الخبير بالإضافة إلى البحث التحليلي للعوامل نموذجًا يغطي المجالات المعرفية، والعلاقات الشخصية، والقيادة، والقدرة على التكيف، والدافع الشخصي التي تتنبأ بأداء العمل وإمكاناته.

06 ·

منهجية التقييم

يستخدم الاختبار تنسيق حكم سياقي مع تصميم استجابة اختياري قسري، تم اختياره لتعظيم الدقة، والمقاومة للتزييف، والملاءمة للاستخدام العالمي في المواقف عالية المخاطر.

تنسيق الحكم الظرفي. يقدم كل عنصر سيناريو قصير وواقعي في مكان العمل يصف تحديًا أو صراعًا أو مهمة، مبنيًا على حوادث حرجة ومدخلات خبراء الموضوع عبر الصناعات. تتبع مجموعة من الإجراءات الممكنة. على سبيل المثال، تأخير في المشروع حيث تتراوح الخيارات من تولي المسؤولية وإعادة تخصيص العمل، إلى حل المشكلات بهدوء، إلى استطلاع رأي الفريق. لا توجد إجابات صحيحة أو خاطئة بشكل قاطع؛ كل خيار يعبر عن كفاءة مختلفة. يقوم المرشحون بترتيب الخيارات من الأكثر احتمالًا إلى الأقل احتمالًا، أو اختيار عملهم المفضل والأقل تفضيلًا. يوفر التنسيق صلاحية وجه عالية ومشاركة، وصلاحية معيارية قوية: وضعت عقود من البحث متوسط صلاحيات SJT حول 0.20–0.30. من الضروري أن ترتبط SJTs التي تقيس الشخصية بالصفات ونتائج الوظائف بينما تكون أقل عرضة للتزييف المتعمد، لأنها تثبت الصفات في السياق بدلاً من السؤال عنها مباشرة.

الطول والتنسيق. الاختبار القياسي يتكون من حوالي 40 عنصرًا قائمًا على السيناريو تغطي أكثر من 50 كفاءة. كل سيناريو يقدم ثلاث إلى أربع خيارات ويستغرق من دقيقة إلى دقيقتين، مما يعطي وقت اختبار إجمالي يتراوح تقريبًا بين 45-50 دقيقة. تم تحديد الطول بواسطة محاكاة مونت كارلو: تتجاوز الاتساق الداخلي للمقاييس الواسعة المستويات المقبولة (α > 0.70) عند حوالي 20 سيناريو وتقترب من أقصى حد لها عند 40.

الشكل 1. محاكاة مونت كارلو: طول الاختبار مقابل الموثوقية
عدد عناصر SJTموثوقية محاكاة (α)
50.28
100.46
150.59
200.68
250.73
300.77
350.80
400.82
450.83
500.84

تزداد الموثوقية مع المزيد من السيناريوهات وتستقر بالقرب من 0.82–0.85 بحوالي 40 عنصرًا. اختارت Xobin ~40 عنصرًا لضمان موثوقية عالية مع الحفاظ على كفاءة الاختبار.

الإدارة والأمن. يتم إجراء الاختبار عبر الإنترنت وبدون إشراف، اعترافًا بالتوظيف عن بُعد الحديث. يتم عشوائية ترتيب الأسئلة والخيارات لكل مرشح؛ تمنع مجموعة العناصر الكبيرة مشاركة الإجابات؛ ويتم تحليل الطوابع الزمنية والبيانات بواسطة الذكاء الاصطناعي لاكتشاف الأنماط الشاذة مثل الغش أو المعرفة المسبقة بالعناصر. يعني اختيار العناصر التكيفي أن مرشحين نادرًا ما يرون نفس مجموعة السيناريوهات. المنصة متوافقة مع الهواتف المحمولة وسهلة الوصول، مع فحوصات تمنع التخمين السريع.

تقرير الدرجات. تقوم التقارير بتوصيف المرشح في كل مجال واسع وتبرز نقاط القوة والمخاوف المحتملة بين الـ 50 جانبًا، في تنسيق موجه للأعمال يجمع بين الرسوم البيانية والسرد. قد يظهر المرشح بمستوى عالٍ في التكيف والتعلم والتفاعل، ومتوسط في التفكير النقدي وأقل في الدافع والتنفيذ، مع نص تفسيري يشرح كيف يظهر هذا الملف في العمل. يمكن مقارنة الدرجات بالمعايير ذات الصلة (عالمية، صناعية، أو مستوى الوظيفة)، ويشير النظام إلى الدرجات المعرضة للخطر حيث تشير فحوصات التناسق إلى انخفاض الموثوقية لاستجابات ذلك المرشح.

تخدم كل قرار تصميم، من سيناريوهات العمل إلى الاختيار القسري إلى تقييم الذكاء الاصطناعي، أربعة مبادئ توجيهية تم تحديدها في بداية المشروع: يجب أن يكون التقييم موثوقًا وصحيحًا، مقاومًا للتزييف وإدارة الانطباعات، قابلًا للتطبيق عالميًا، وفعالًا وآمنًا عبر الإنترنت.

07 ·

عملية تطوير الاختبار

تطور من تعريف الكفاءة إلى كتابة العناصر، التجريب وتحليل العناصر، مسترشدًا بإرشادات BPS/ITC ومعايير APA.

  1. الخطوة 01تحديد نموذج الكفاءة. An extensive literature review of personality and competency models, covering Big Five taxonomies, emotional intelligence models and others, was combined with interviews of corporate HR partners, leadership coaches and hiring managers across industries. Hundreds of candidate behavioural descriptors were distilled, using theory (mapping to models such as DeYoung's ten aspects of the Five Factor Model) and expert sorting, into the final six domains and roughly 50 competencies. Each was defined with behavioural examples for item writers: "Builds Trust", for instance, was defined as being honest, keeping commitments and fostering psychological safety.
  2. الخطوة 02كتابة العناصر. استخدم علماء النفس الصناعيون والخبراء في الموضوع تقنية الحادثة الحرجة، وجمعوا حكايات حقيقية عن السلوك الفعال وغير الفعال لكل كفاءة. بالنسبة لجودة القرار، قد تتضمن الحادثة فريقًا يختار بين استراتيجيتين بناءً على بيانات محدودة، مع أربعة خيارات محتملة تعكس كل منها سمة مختلفة: التفكير التحليلي، الاندفاع، الت defer إلى الآخرين، وهكذا. تمت مراجعة الخيارات بحيث يتم تحقيق التوازن في الرغبة الاجتماعية، حيث أن لكل منها مزايا وعيوب قد يفضلها شخص عاقل، وتم كتابة العناصر عند الدخول عبر مستويات صعوبة القيادة. تم إنشاء أكثر من 2,000 عنصر أولي، مع ثلاثة إلى خمسة سيناريوهات على الأقل لكل كفاءة في كل مستوى. تم فحص المحتوى بحثًا عن التحيز، باستخدام لغة شاملة وسياقات عامة (شركة خيالية "ACME Corp." بدلاً من أسماء ثقافية محددة)، ثم تمت ترجمته بواسطة خبراء ثنائيي اللغة مع ترجمة للأمام والخلف لتأكيد معادلة المعنى.
  3. الخطوة 03اختبار تجريبي. تم إجراء تجربة مع N = 400 مشارك، 100 في كل من أربعة مستويات وظيفية: مستوى الدخول، مبتدئ (من سنة إلى ثلاث سنوات)، متوسط، وكبير. كانت العينة متنوعة، مستمدة من المتقدمين المتطوعين والموظفين عبر الصناعات. أخذ المشاركون شكلًا أطول من SJT، حوالي 1.5 ساعة، جنبًا إلى جنب مع مقاييس خارجية تشمل جرد Big Five واختبار إدراكي للتحقق من الصلاحية التوافقية لاحقًا. ثم قام علماء النفس بتحليل صعوبة العناصر، تمييز العناصر، ووظائف العناصر المختلفة (DIF) حسب الجنس والثقافة باستخدام نظرية الاختبار الكلاسيكية وIRT. تم تعديل أو إزالة العناصر التي كانت سهلة جدًا، أو فشلت في التمييز، أو أظهرت اختلافات ديموغرافية غير مفسرة. كانت إحدى العناصر حول اجتماع العمل بعد ساعات العمل، والتي أجاب عليها العمال الأكبر سناً والأصغر سناً بشكل مختلف لأسباب تتعلق بمرحلة الحياة بدلاً من الصفات، هي نوع العنصر الذي تم قطعه لتجنب التحيز العمري. تم الاحتفاظ أو تعديل حوالي 50% من العناصر، مما ترك بنكًا مصفّى من حوالي 1,000 سيناريو عالي الجودة، مستهدفًا من ثمانية إلى عشرة عناصر قوية لكل كفاءة لكل مستوى.
  4. الخطوة 04معايرة نموذج التسجيل. تم ترميز كل خيار للصفات التي يشير إليها: اختيار خيار يعكس مستوى عالٍ من التكيف كـ "الأكثر احتمالًا" يزيد من تلك الدرجة، بينما اختيار خيار منخفض التكيف يقلل منها. تطلب الهيكل القسري نموذج IRT متعدد الأبعاد حيث يحمل كل خيار معلمات صعوبة وتمييز على الأبعاد ذات الصلة، تم تقديرها بأساليب ثورستون وبرادلي-تيري للبيانات المقارنة. يحول الخوارزمية الناتجة نمط الاختيارات إلى تقديرات الصفات، وتم التحقق منها مقابل الدرجات الخمس الكبرى التي تم جمعها خارجيًا: ارتبطت درجة SJT للعلاقات الشخصية بحوالي r = 0.5 مع استبيان القابلية للاتفاق في التجربة، مع إجراء تعديلات طفيفة على وزن العناصر لتعظيم الصلاحية المتقاربة.
  5. الخطوة 05تحليل الموثوقية. تم حساب الاتساق الداخلي لكل مقياس، باستخدام ألفا كرونباخ المماثل المجمعة على الاستجابات الثنائية كما تتطلب تنسيقات الاختيار الإجباري. أظهر الاختبار التجريبي وسطي α حوالي 0.78، مع وجود معظم المقاييس فوق 0.75. تم تقوية بعض المقاييس الأضعف، مثل جانب الإبداع الذي كان في البداية قريبًا من 0.65، بعناصر إضافية أو مصقولة. كان الهدف هو α ≥ 0.70 لجميع المجالات الواسعة ومعظم الجوانب الضيقة.
  6. الخطوة 06التجميع النهائي والتوحيد. Operational forms were assembled from the refined bank, with multiple forms allowing rotation and job-level tailoring. Each form covers all six domains and their facets across several items, balancing shorter and longer scenarios and mixing cognitively heavy items with straightforward ones to limit fatigue. Parallel forms were equated through common items so scoring is consistent regardless of the form received; adaptive selection effectively chooses among these equated forms based on inputs such as job level. A normative sample of more than 5,000 test takers, collected across regions and industries during the first year of operation, supports percentile ranks, stanines and stens for global and industry-specific interpretation. An independent panel of psychometric experts audited content for bias and reviewed the validity evidence for sufficiency; their feedback was incorporated into the final technical manual.
الجدول 1. الاتساق الداخلي (ألفا كرونباخ) حسب المجال، عينة تجريبية، N = 400
مجال الكفاءةألفا كرونباخ
الدافع والتنفيذ0.84
القدرة على التكيف والتعلم0.80
التأثير والقيادة0.78
العلاقات الشخصية والعمل الجماعي0.81
المرونة العاطفية0.76
التفكير النقدي0.75

تتجاوز جميع المجالات العتبة الشائعة 0.70. الألفا على مستوى الجوانب أقل قليلاً (0.6–0.7 للسمات الأضيق مع أقل عدد من العناصر)، وهو ما هو متوقع ومقبول لأن الجوانب تتجمع في المجالات الأوسع للاستخدام الأساسي.

كان الاستخدام الأخلاقي والعادل التزامًا طوال الوقت: تم إحاطة المرشحين التجريبيين علمًا، يحمل الاختبار المباشر موافقة مستنيرة وإشعارات خصوصية البيانات، وتتلقى فرق الموارد البشرية لدى العملاء تدريبًا على التفسير الصحيح حتى لا يتم وزن أي درجة واحدة بشكل مفرط في القرار.

08 ·

أدلة الموثوقية

تستند الأدلة أدناه إلى عينة التحقق الأولية (تجريبية ومتابعة، N ≈ 400)، بيانات تشغيلية مجمعة (N ≈ 5,000+)، ودراسات صلاحية مستهدفة مع منظمات العملاء.

الاتساق الداخلي. عبر عينة من 5,000 شخص خضعوا للاختبار، يتراوح معامل ألفا للستة مجالات واسعة من 0.75 إلى 0.88 مع وسطي قريب من 0.82، مما يؤكد أن العناصر داخل كل مجال متجانسة. المرشحون الذين يظهرون دافعًا عاليًا في سيناريو واحد يميلون إلى القيام بذلك عبر الآخرين. تتطابق هذه الألفا أو تتجاوز تلك التي يتم الإبلاغ عنها عادةً لمقاييس الشخصية من نوع ليكرت (~0.75–0.85)، وهو أمر ملحوظ نظرًا لأن SJT متعدد الأبعاد.

الجدول 2. الخطأ المعياري للقياس (SEM) حسب المجال، مقياس الدرجات 0–100
مجال الكفاءةSEM (نقاط)
الدافع والتنفيذ6.0
القدرة على التكيف والتعلم6.7
التأثير والقيادة7.0
العلاقات الشخصية والعمل الجماعي6.5
المرونة العاطفية7.3
التفكير النقدي7.5

تتوافق SEMs مع حوالي ثلث إلى نصف انحراف معياري للدرجة. درجة المرونة العاطفية 70 لديها فرصة 68% لدرجة حقيقية تتراوح بين حوالي 63 و 77. تعكس SEM الأعلى قليلاً في التفكير النقدي عددًا أقل من العناصر ومحتوى أكثر تنوعًا؛ تحمل التقارير نطاقات ثقة للاستخدام في الحالات الحرجة.

موثوقية إعادة الاختبار. أخذت عينة من 120 موظفًا في منظمة عميل الاختبار مرتين، بفارق ستة أشهر. كانت علاقة إعادة الاختبار للتركيب العام r = 0.81؛ تراوحت موثوقيات إعادة الاختبار على مستوى المجال من 0.72 إلى 0.79. أعطى إعادة اختبار بفترة قصيرة من أسبوعين إلى ثلاثة أسابيع مع 50 مشاركًا r ≈ 0.85، مما يشير إلى وجود خطأ عابر ضئيل جدًا. لذلك يبقى ترتيب الأفراد ثابتًا، والتغييرات في الدرجات من المرجح أن تعكس تطورًا حقيقيًا بدلاً من الضوضاء، وهو ما يهم عندما يتم استخدام الاختبار قبل وبعد التطوير.

اتساق الدرجات. تتم عملية التسجيل بشكل آلي بالكامل، لذا فإن عدم توافق المقيمين ليس عاملاً. كتحقق، قام طبيبان نفسيان بتقييم مستويات السمات الضمنية لـ 50 بروتوكول استجابة بشكل مستقل؛ كانت أحكامهم مرتبطة بأكثر من 0.9 مع الدرجات الآلية، مما يؤكد أن قواعد التسجيل سليمة من الناحية المفاهيمية وقابلة للتكرار من خلال التفكير البشري.

المركب مقابل الملف. درجة "التوافق السلوكي العام" التراكمية، متوسط المجالات أو المكون الرئيسي الأول، موثوقة للغاية عند α ≈ 0.90 وتلتقط عاملاً عامًا من الفعالية السلوكية. ومع ذلك، تشجع Xobin المستخدمين على قراءة ملف درجات المجالات بدلاً من رقم مبسط واحد؛ كل مجال موثوق بما يكفي للتفسير بمفرده.

بنك العناصر والأشكال الموازية. تؤكد وظائف المعلومات في IRT أن طول 40 عنصرًا يوفر دقة كافية عبر نطاق السمة. يمكن استخدام نسخة من 20 عنصرًا للفحص السريع عند موثوقية أقل (≈ 0.65–0.70)؛ بينما ترفع نسخة من 60 عنصرًا الموثوقية بشكل طفيف فقط (≈ 0.87) قبل أن تتناقص العوائد. تتوافق الدرجات على نصفين تم تعيينهما عشوائيًا من بنك العناصر بحوالي 0.9 بعد التصحيح، لذا فإن أي نموذج معين يمثل البنك الكامل.

عند جمعها، يتوافق الاتساق الداخلي واستقرار إعادة الاختبار مع معايير الصناعة أو يتجاوزها. تشير الأبحاث حول SJTs المعتمدة على الشخصية إلى معاملات إعادة اختبار تتراوح بين أسبوعين إلى ثلاثة أسابيع في نطاق 0.6–0.7؛ أرقام Xobin لمدة ستة أشهر حوالي 0.75 قوية. نظرًا لأن التنسيق يقلل من الاستجابة الاجتماعية المرغوبة، فإن هذه التقديرات تعتبر محافظة.

09 ·

دليل الصلاحية

صلاحية المحتوى. تم تحديد الكفاءات من الأدبيات ومدخلات أصحاب العمل باعتبارها حاسمة لنجاح الوظيفة عبر العديد من الأدوار، وكل سيناريو مستند إلى موقف واقعي مع صلاحية وجهية للمرشحين وSMEs. قام علماء النفس الصناعي والتنظيمي ومديرو التوظيف بمراجعة كل عنصر للتأكد من أن السيناريوهات معقولة ومهمة، وأن خيارات الاستجابة تغطي مجموعة من الإجراءات الفعالة وغير الفعالة المرتبطة بالكفاءات المستهدفة. نظرًا لأن النموذج يدمج Big Five، EQ والتفكير النقدي، لا يتم استبعاد أي مجال رئيسي (المهمة، الأشخاص، الإدراك، التكيف): كل عامل من Big Five يتوافق مع عناصر متعددة، وكل مكون من مكونات EQ لجولمان لديه سيناريوهات تستدعيه. تدعم ملاحظات العملاء التي تفيد بأن السيناريوهات "تعكس الحقائق اليومية" وأن التقارير "تستخدم لغة تتناسب مع نماذج القيادة لدينا" نفس الاستنتاج.

صلاحية البناء: هيكل العوامل. Exploratory factor analysis on a large sample extracted six factors explaining a substantial share of variance, with loadings matching the intended design.

الجدول 3. أمثلة على تحميل العوامل، تحليل العوامل الدورانية (N = 2,000)
الكفاءة (الجانب)الدافعتكيّف.التأثيرالعلاقات الشخصية.المرونةالتفكير النقدي.
المبادرة (الدافع)0.790.100.150.050.020.08
تركيز الجودة (الدافع)0.750.080.050.100.090.12
المرونة (التكيف)0.050.770.100.060.040.20
التفكير الإبداعي0.040.730.080.000.050.25
الإقناع (التأثير)0.100.060.760.120.000.05
قيادة الآخرين (القيادة)0.180.050.820.090.030.02
التعاطف (العلاقات الشخصية)0.000.020.100.740.150.05
يبني الثقة (بين الأشخاص)0.110.000.050.720.100.03
تحمل الضغوط (المرونة)0.090.050.000.100.690.20
التفاؤل (المرونة)0.060.100.000.080.710.00
التفكير التحليلي (التفكير النقدي.)0.050.220.000.000.100.80
جودة القرار (التفكير النقدي.)0.100.180.050.000.050.78

كل كفاءة تحمل أعلى وزن على عاملها النظري، مع تحميلات عرضية منخفضة بشكل عام؛ يظهر التفكير التحليلي تحميلًا ثانويًا متوقعًا على التكيف، حيث يتداخل الانفتاح على الأفكار الجديدة مع العقلية التحليلية. أظهر تحليل العوامل التأكيدي توافقًا جيدًا لنموذج العوامل الستة، ويظهر عامل عام أعلى مع تحميلات المجال حول 0.6–0.7، متسقًا مع عامل ملاءمة سلوكية عام بينما تظل العوامل المتميزة قوية.

الصلاحية المتقاربة. ضد جرد Big Five القياسي الذي تم إدارته في مجموعة تجريبية: كانت العلاقات بين العلاقات الشخصية والعمل الجماعي r = 0.65 مع القابلية للتوافق؛ المرونة العاطفية r = 0.70 مع العصابية المعكوسة؛ الدافع والتنفيذ r = 0.55 مع الضمير؛ القدرة على التكيف والتعلم r = 0.60 مع الانفتاح؛ التأثير والقيادة r = 0.50 مع الانبساط، جميعها ذات دلالة عند p < .001. التفكير النقدي ارتبط بشكل معتدل (r ≈ 0.30) مع اختبار القدرة المعرفية: ذو دلالة، ولكن ليس مرتفعًا بما يكفي ليقترح أن الاختبار يقيس القدرة النقية بدلاً من الميل. في عينات تنظيمية، ارتبطت درجات تأثير SJT بحوالي 0.4 مع تقييمات المشرفين لإمكانات القيادة، وارتبطت قدرة SJT على التكيف بحوالي 0.45 مع تقييمات الأقران للانفتاح على التغيير.

صلاحية تمييزية. المجالات التي ينبغي أن تختلف تفعل: العلاقات الشخصية مقابل التفكير النقدي مرتبط بحوالي 0.2، الدافع مقابل العلاقات الشخصية حوالي 0.1. الاختبار يميز الصفات بدلاً من إنتاج مقياس جيد/سيء غير مميز. ارتبطت الدرجات بالقرب من الصفر (r ≈ 0.05) بمقياس الرغبة الاجتماعية، دليل مباشر على أن تصميم الاختيار القسري يقاوم إدارة الانطباعات، على عكس التقارير الذاتية النموذجية.

صلاحية المعيار ذات الصلة. قامت Xobin بتجميع دراسات تحقق مع أكثر من عشرة منظمات عميلة تربط بين درجات SJT قبل التوظيف وأداء العمل لاحقًا، ونجاح التدريب، ونتائج أخرى. تم تلخيص عشرة أدناه.

الجدول 4. صلاحية المعيار: ارتباط درجة SJT مع أداء العمل (N ≈ 100 لكل دور)
الدورمعامل الصلاحية (r)
مهندس برمجيات (تكنولوجيا المعلومات)0.23
قائد الفريق (تكنولوجيا المعلومات)0.30
صراف بنك (BFSI)0.20
مستشار مالي (BFSI)0.28
مندوب مبيعات (FMCG)0.25
مدير المبيعات (FMCG)0.35
فني مختبر (صناعات دوائية)0.22
مدير المنتج (الأدوية)0.31
مشرف المصنع (الطاقة)0.27
ممرض (الرعاية الصحية)0.24

تتراوح المعاملات من حوالي 0.20 إلى 0.35، وهو أمر نموذجي بالنسبة للمؤشرات المتعلقة بالشخصية وجميعها ذات دلالة عند p < .05 أو أفضل، عبر تكنولوجيا المعلومات، BFSI، FMCG، الأدوية، الطاقة والرعاية الصحية.

تعني هذه المعاملات أن الاختبار وحده يفسر تقريبًا 6-12% من التباين في أداء الوظيفة، وهو مساهمة ذات مغزى لتقييم سلوكي واحد. وصل مدير المبيعات (FMCG) إلى r = 0.35 مقابل تحقيق الهدف ربع السنوي، مع توقع درجات تأثير ودافع أعلى لنتائج مبيعات أفضل. وصل قائد الفريق (IT) إلى r = 0.30 مقابل تقييم الأداء الإشرافي. حتى أدنى معامل، 0.20 لصراف البنك، يحمل قيمة: تم قياس أداء هذا الدور بشكل كبير على معدلات الأخطاء والالتزام، والتي يتنبأ بها الضمير داخل SJT جزئيًا. يجمع دمج SJT مع الاختبارات المعرفية أو المقابلات المنظمة القوة التنبؤية العامة بشكل أكبر، وظلت الصلاحيات دون دليل على التحيز عبر المجموعات السكانية.

روابط الكفاءة إلى النتائج. في مركز اتصال دولي، تنبأت درجات العلاقات الشخصية والعمل الجماعي برضا العملاء لممثلي الخدمة عند r ≈ 0.30. في شركة استشارية، تنبأ كل من التفكير النقدي والقدرة على التكيف بجودة إكمال المشروع المُقيم من قبل الأقران عند r ≈ 0.25. في برنامج تدريب الإدارة، كان أولئك الذين تمت ترقيتهم في النهاية لديهم درجات أعلى بكثير في الدافع والتنفيذ والقيادة (d ≈ 0.5)، مما يدل على أن الاختبار يمكن أن يحدد القادة المستقبليين مبكرًا.

الصلاحية المتزامنة. مع فريق مبيعات الأدوية (N = 80)، كانت درجة SJT الإجمالية مرتبطة r = 0.29 بتقييم أداء المشرف العام، وكانت التأثير والقيادة مرتبطة r = 0.40 بالتقييم المحدد للوظيفة لإقناع الأطباء وتحقيق الحصة. في مصنع تصنيع (N = 60 مشرفين)، كانت المرونة العاطفية مرتبطة عكسياً بأيام الإجازة المتعلقة بالتوتر (r = −0.25).

الصلاحية التزايدية. في عينة من موظفي التجزئة، تنبأ اختبار إدراكي بأداء المبيعات عند r ≈ 0.20 و SJT عند r ≈ 0.22؛ وعند دمجهما في الانحدار، وصلوا إلى R ≈ 0.30، مع إضافة SJT حوالي 0.10 من الزيادة الفريدة. كما يضيف SJT إلى جرد الشخصية العام، حيث يمكن أن يختلف شخصان لهما درجات سمات مشابهة في مدى فعالية تطبيقهما لتلك السمات في المواقف، وهو ما يعرف بمعرفة الحكم السياقي. يُبلغ العملاء أن دمج SJT مع تقييمات أخرى يحسن جودة التوظيف بشكل ملحوظ مقارنةً بالاختبارات الإدراكية وحدها.

10 ·

تحليل العدالة والتحيز

اختلافات المجموعات الفرعية. تمت مقارنة توزيعات الدرجات حسب الجنس والمجموعة العرقية الرئيسية في العينة الكبيرة. كانت الفروقات ضئيلة: كان لدى المرشحين الذكور والإناث تقريبًا متوسطات متساوية في الدرجة الإجمالية (أقل من 0.1 SD). أظهرت بعض الجوانب اختلافات صغيرة، حيث كانت النساء أعلى قليلاً في المهارات الشخصية والرجال أعلى قليلاً في التفكير النقدي، لكن التأثيرات كانت d ≈ 0.2 أو أقل وغير متسقة عبر العينات، لذا فهي لا تشير إلى تحيز في الاختبار. لم تجد تحليل DIF على مستوى العناصر أي عنصر تم الإجابة عليه بشكل مختلف من قبل مجموعة ديموغرافية بمجرد التحكم في مستوى السمة. كانت الفروقات بين البلدان أيضًا صغيرة وموضحة إلى حد كبير بفروق السمات المعروفة على مستوى الثقافة، وتم التحقق من كل نسخة لغة محلية من حيث المعادلة الدلالية.

الامتثال للمعايير. تم تطوير الاختبار وفقًا لمبادئ تكافؤ الفرص في العمل ومعيار ISO 10667. يتم مراقبة نسب التأثير السلبي؛ في النشر الكبير، ظلت معدلات الاختيار حسب الجنس والعرق عندما يتم استخدام SJT كعائق ضمن قاعدة الأربعة أخماس في كل حالة حتى الآن. استبدل أحد العملاء مقابلة غير منظمة بـ SJT ووجد أنها قللت من التحيز الذاتي وحسنت تنوع المرشحين المتقدمين.

ردود فعل المرشحين. تقرير استبيانات المشاركين في الاختبار ردود فعل إيجابية: وجد معظمهم أن السيناريوهات ذات صلة بالعمل وشعروا أنهم قادرون على إظهار نقاط قوتهم. يميل المرشحون الذين يجدون استبيانات الاختيار القسري غريبة إلى العثور عليها مثيرة للاهتمام داخل سيناريو. تتجاوز معدلات الإكمال 95%، مما يشير إلى أن الطول والمحتوى مقبولان في بيئة غير مراقبة.

11 ·

النتائج والفائدة

وثقت المنظمات العميلة انخفاضًا في معدل الدوران، حيث شهدت واحدة انخفاضًا بنسبة 30% في معدل دوران الموظفين الجدد بعد إضافة SJT إلى التوظيف، بالإضافة إلى أداء أعلى بين المختارين وتوفير وقت مادي في الفرز. استخدمت إحدى الشركات SJT لتقليص مجموعة المتقدمين إلى النصف في وقت مبكر من العملية، ومع ذلك تم تصنيف 95% من المدعوين للمقابلة النهائية على أنهم مناسبون أو مناسبون جدًا من قبل مديري التوظيف، مما يشير إلى أن الاختبار قام بتصفية المرشحين الأضعف بشكل فعال بدلاً من عشوائي.

12 ·

الخاتمة

يقيس اختبار Xobin النفسي ما ينوي قياسه، حيث يمثل محتواه بدقة سلوكيات العمل المطلوبة، ويتنبأ بمعايير الأداء المعنوية عبر الأدوار والصناعات. الاتساق الداخلي جيد إلى ممتاز، وثبات إعادة الاختبار مرتفع، وهيكل العوامل الستة يحتفظ به تحت كل من التحليل الاستكشافي والتأكيد، وتصميم الاختيار القسري يحافظ على الدرجات غير مرتبطة أساسًا بالرغبة الاجتماعية. تظهر تحليلات العدالة عدم وجود تأثير سلبي وعدم وجود تحيز في العناصر المعلنة.

This is the evidence base behind every behavioural score Xobin reports, the same standard of validation Xobin Research applies to the Xobin Capability Graph and to the wider skills work. Teams that want the same rigour in their own hiring can use it directly through Xobin.

13 ·

المراجع

  • ·Ashton, M. C., & Lee, K. (2007). Empirical, theoretical, and practical advantages of the HEXACO model of personality structure.
  • ·Duckworth, A. L., Peterson, C., Matthews, M. D., & Kelly, D. R. (2007). Grit: Perseverance and passion for long-term goals.
  • ·Facione, P. A., Sánchez, C. A., Facione, N. C., & Gainen, J. (1995). The disposition toward critical thinking.
  • ·Goleman, D. (1998). Working with Emotional Intelligence.
  • ·Lombardo, M. M., & Eichinger, R. W. (2000). High potentials as high learners.
  • ·Scouller, J. (2011). The Three Levels of Leadership: How to Develop Your Leadership Presence, Knowhow and Skill.
  • ·DeYoung, C. G., Quilty, L. C., & Peterson, J. B. (2007). Between facets and domains: Ten aspects of the Big Five.
  • ·Situational judgment test literature on criterion validity and resistance to faking, which informed the design of Xobin's SJT format.
  • ·British Psychological Society (BPS) and International Test Commission (ITC) guidelines for occupational test development; APA Standards for Educational and Psychological Testing; ISO 10667.

هل تريد الدليل الفني الكامل، المعايير، أو دراسة تحقق محددة للدور؟

تشارك Xobin Research الوثائق التفصيلية مع فرق الموارد البشرية، والقانونية، والمشتريات التي تقيم التقييم.

تواصل معنا →
§ الأسئلة الشائعة

الأسئلة المتكررة

What kind of test is the Xobin psychometric assessment?

It is a situational judgment test (SJT). Each item presents a realistic workplace scenario with several plausible actions, and candidates rank those actions, which lets the test infer behavioural traits in context rather than asking about them directly.

How reliable is the test?

Internal consistency for the six broad domains runs from 0.75 to 0.88 with a median near 0.82, and the overall composite shows a six-month test-retest correlation of r = 0.81. Full figures, including standard errors of measurement, are documented in this article.

Is the test checked for bias?

Yes. Items are screened for differential item functioning by gender and culture during piloting and in production, and subgroup score differences are monitored. Items that show consistent bias are revised or retired.
§ من المختبر

تواصل مع فريق البحث.

المنهجية الموصوفة هنا هي ما يعمل داخل كل تقييم من Xobin ومقابلة الذكاء الاصطناعي، بحيث يمكن لفرق التوظيف اتخاذ قرارات المواهب بناءً على الأدلة، وليس الحدس. انظر Xobin.