Психометрический тест Xobin: доказательства надёжности и валидации
Полная техническая документация по ситуационному тесту на суждение Xobin (SJT): поведенческая модель, как был построен тест, а также исследования надежности, валидности и справедливости, проведенные с 2021 по 2024 год.
Автор
Guruprakash Sivabalan
Основатель, Xobin. Руководит программой Xobin Research по науке об оценке, психометрической валидации и Xobin Capability Graph.
Эта статья подводит итоги Техническому отчету о психометрическом тесте Xobin (SJT), версия 2.9.1, охватывающему исследования надежности и валидности, проведенные в период с 2021 по 2024 год. Содержимое элементов, ключи оценивания и базовые наборы данных на уровне кандидатов остаются собственностью и конфиденциальными; статистика, представленная здесь, взята из технического руководства.
Исполнительное резюме
Команда Xobin из психологов в области труда и организации (I/O) и психометристов разработала широкомасштабную психометрическую оценку для использования на уровне предприятия в высокомасштабном наборе, профессиональной оценке и развитии лидерства.
Разработка шла по двум направлениям. Первое создало интегрированную модель поведения, основываясь на современных исследованиях в области психологии личности, науки о лидерстве, эмоционального интеллекта и критического мышления. Второе разработало и валидировало тест на ситуационное суждение (SJT), который точно и эффективно измеряет эти поведенческие компетенции, с учетом актуальности, справедливости и предсказательной точности для глобальных должностей.
Тест предоставляет командам HR предприятий надежную, всестороннюю оценку поведения кандидатов в контексте найма и развития. Опубликованные исследования показывают, что организации, использующие психометрическое тестирование, могут повысить успех найма до 40% и увеличить удержание сотрудников на 24%. Эти достижения приводят к снижению затрат на текучесть кадров, более эффективным командам и лучшим результатам.
Целостность оценки находится в центре дизайна. Тест интегрирует устоявшиеся рамки в области личности, обучаемости, лидерства, эмоционального интеллекта (EQ) и критического мышления и представляет реалистичные рабочие сценарии, в которых суждения кандидата раскрывают основные черты и стиль принятия решений. Внутренняя согласованность шкал компетенций варьируется от хорошей до отличной (α Кронбаха ≈ 0.6–0.8), исследования повторного тестирования показывают стабильные результаты с течением времени, а формат принудительного выбора SJT значительно менее подвержен фальсификации, чем традиционные анкеты самозаполнения.
Глобальная применимость и секторная универсальность
Тест был разработан и валидирован для глобального применения и межотраслевой актуальности. Он был локализован и стандартизирован в Соединенных Штатах, Европе, на Ближнем Востоке, в Южной Азии и Азиатско-Тихоокеанском регионе. Локализация охватывает не только перевод на более чем 15 языков, но и культурную адаптацию сценариев для сохранения контекстной уместности и интерпретационной эквивалентности среди различных популяций.
Оценка продемонстрировала операционную эффективность в следующих областях:
- ·Информационные технологии и разработка программного обеспечения
- ·Фармацевтические и жизненные науки
- ·Банковские услуги, финансовые услуги и страхование (BFSI)
- ·Товары народного потребления (FMCG)
- ·Розничная торговля
- ·Инженерия, Производство и основные промышленные сектора
- ·Энергетика и коммунальные услуги
- ·Профессиональные и консалтинговые услуги
- ·Здравоохранение и управление больницами
В этих вертикалях он используется для массового скрининга начальных ролей, поведенческого профилирования для профессиональных и средних позиций, а также для оценки лидерского потенциала для управленческих и исполнительных программ развития. Отраслевые бенчмарки и нормативные данные позволяют интерпретировать индивидуальные оценки в соответствии с соответствующим секторным стандартом, а не с единственным глобальным средним.
Соответствие психометрическим стандартам
Методология разработки Xobin соответствует стандартам Британского психологического общества (BPS) и Международной тестовой комиссии (ITC) для профессиональной оценки. Жизненный цикл разработки элементов включает:
- ·Комплексное моделирование компетенций и анализ должностей
- ·Разработка более 2,000 пилотных элементов, стратифицированных по уровням должностей
- ·Многофазное пилотирование, включая классический анализ элементов и калибровку теории отклика элементов (IRT)
- ·Изучение смещения на уровне элементов, индексов сложности и параметров дискриминации
- ·Симуляция Монте-Карло для оптимизации длины теста и психометрической эффективности
- ·Валидация справедливости подгрупп, языковой нейтральности и обобщаемости оценок по демографическим группам
Этот подход гарантирует, что каждый ситуационный запрос и вариант ответа отражают поведенческую конструкцию, относящуюся к работе, функционируют последовательно среди различных популяций и вносят значимый вклад в оценку черт. Элементы ситуационного суждения прошли тщательное пилотирование и аналитику, чтобы подтвердить, что они функционируют так, как задумано, по сложности, дискриминации и отсутствию предвзятости, создавая статистически надежный, конструктивно валидный инструмент, соответствующий международным лучшим практикам в отборе персонала.
Поведенческая модель и структура
Модель основана на структуре Большой пятерки (OCEAN) личности: Открытость, Добросовестность, Экстраверсия, Согласие и Эмоциональная стабильность (инверсированный невроз). Она обогащена конструкциями из исследований лидерства, эмоционального интеллекта и критического мышления, чтобы более полно отражать поведение на рабочем месте, чем традиционный тест на личность.
Гибкость в обучении (Ломбардо и Эйхингер)
Гибкость в обучении это готовность и способность осваивать новые компетенции для выполнения задач в условиях неопределенности, сложности или новизны. На практике это становится Адаптивностью, Открытостью к обратной связи, Инновациями и Быстрым обучением, качествами, которые указывают на то, сможет ли человек преуспеть в динамичных условиях, и ключевым предиктором лидерского потенциала в нестабильных контекстах.
Лидерство (Три уровня Скауллера)
Скауллер (2011) утверждает, что лидерство функционирует на личном, частном и публичном уровнях: самосознание и самовладание, межличностные навыки один на один и командное или организационное лидерство. Такие черты, как Самоуверенность, Целостность, Способность к обучению, Влияние и Видение соответствуют этим уровням, поэтому тест охватывает компетенции, необходимые как индивидуальным участникам, так и будущим лидерам.
Эмоциональный интеллект (Гоулман)
Модель EQ Гоулмана, охватывающая самосознание, саморегуляцию, мотивацию, эмпатию и социальные навыки, используется через сценарии управления эмоциями в стрессовых ситуациях, проявления эмпатии к коллегам или клиентам и разрешения конфликтов. Эти поведения важны для командной работы, работы с клиентами и лидерства, и расширяют измерение за пределы чистого рассуждения в сторону межличностной эффективности и эмоционального самоуправления.
Предрасположенности к критическому мышлению (Facione)
Facione и др. (1995) описывают предрасположенность к критическому мышлению как интеллектуальное любопытство, открытость и привычку рационально размышлять о проблемах. Это проявляется как Аналитическое Мышление, Качество Решений, Решение Проблем и Управление Рисками: сценарии показывают, принимает ли кандидат решения на основе доказательств и логики или на основе импульса и предвзятости, измеряя, как люди размышляют над дилеммами, а не только как они ведут себя с другими.
Дополнительные компетенции на рабочем месте
Обзор литературы и мнения отрасли выявили черты, которые Большая пятерка не охватывает полностью. Скромность и целостность, означающие честность, скромность и признание ошибок вместо перекладывания вины, соответствуют фактору Честности-Скромности HEXACO (Аштон и Ли, 2007). Устойчивость и упорство, заимствованные из работ Дакворта и др. (2007), дополняют Эмоциональную стабильность, сосредотачиваясь на постоянных усилиях и восстановлении после неудач. В общей сложности модель охватывает более 50 конкретных компетенций, от Построения доверия и Сотрудничества до Инноваций и Стратегического мышления, каждая из которых концептуально связана с одной или несколькими из вышеупомянутых рамок.
Шесть областей компетенций
Более 50 компетенций организованы в шесть широких областей для оценки и интерпретации. Оценки сообщаются на уровне аспектов и агрегируются на уровне областей.
Стремление и Исполнение
Надежность · Инициатива · Упорство · Ориентированность на качество · Амбиции
Ориентированные на достижения черты, в значительной степени связанные с добросовестностью, плюс амбиция и аспекты власти в мотивации лидерства. Высокие оценки характеризуются надежностью, ориентированностью на результаты и настойчивостью; низкие оценки более расслаблены или гибки в отношении целей. Это соответствует тому, что другие модели называют стилем выполнения задач: быть планомерным и дисциплинированным.
Адаптивность и обучение
Гибкость · Креативное мышление · Открытость к опыту · Непрерывное обучение
Черты, связанные с открытостью и обучаемостью. Высокие баллы характеризуются открытостью и быстротой в приобретении новых навыков или адаптации к изменениям; низкие баллы предпочитают знакомые подходы, но предлагают последовательность и практическую направленность. Домен сочетает аналитическую любознательность Фачиона с обучаемостью Ломбарда и Эйхингера.
Влияние и Лидерство
Уверенность · Убедительность · Делегирование · Стратегическое видение · Амбиции
Аспекты, связанные с экстраверсией, и стремление к лидерству. Высокие баллы указывают на лидеров, уверенно принимающих решения и направляющих команду. Низкие баллы, как правило, указывают на командных игроков или индивидуальных участников, которые избегают внимания. Эта область сигнализирует о потенциальных управленческих и продажных лидерских качествах, соответствующих уровню публичного лидерства Скауллера.
Межличностное взаимодействие и командная работа
Эмпатия · Построение доверия · Разрешение конфликтов · Коммуникация · Скромность · Дипломатия · Разнообразие и инклюзия
Сосредоточен на согласии и социально-эмоциональном интеллекте. Высокие баллы указывают на сотрудничество, эмпатию и командную ориентацию, создание положительных отношений и приоритет групповых целей над эго. Низкие баллы могут указывать на более целеустремленный или независимый подход, иногда в ущерб такту. Это указывает на соответствие для сотрудничества, обслуживания клиентов и лидерства на частном, межличностном уровне.
Эмоциональная устойчивость и Самоуправление
Стрессоустойчивость · Позитивность и оптимизм · Самосознание · Контроль импульсов
Соответствует Эмоциональной Стабильности и стороне саморегуляции эмоционального интеллекта. Люди с высокими баллами остаются спокойными под давлением, восстанавливаются после неудач и остаются оптимистичными. Люди с низкими баллами могут испытывать тревогу под стрессом, но могут быть более открытыми в выражении эмоций. Особенно важно для ролей с высоким давлением и для лидерства на личном уровне.
Критическое Мышление и Принятие Решений
Качество Решений · Суждение · Открытость к Доказательствам · Управление Рисками · Этическое Мышление
Необычно для оценок личности, этот домен оценивает когнитивно-поведенческие тенденции в решении проблем, не будучи чисто тестом на способности. Высокие баллы взвешивают компромиссы, учитывают долгосрочные последствия и принимают решения на основе доказательств; низкие баллы принимают решения интуитивно или быстро, что эффективно для простых задач и рискованно для сложных.
Модель была построена итеративно: психологи Xobin в области I/O начали с структуры Большой пятерки, затем сопоставили или сгруппировали конструкции из эмоционального интеллекта, обучаемости и подлинного лидерства, чтобы ничего важного не было упущено: скромность и эмпатия сгруппированы в Межличностные, амбиции и власть в Влияние и Лидерство. Экспертное суждение плюс факторный анализ привели к созданию модели, охватывающей когнитивные, межличностные, лидерские, адаптивные и личные драйвовые области, которые предсказывают производительность и потенциал на рабочем месте.
Методология оценки
Тест использует формат ситуационного суждения с ипсативным, принудительным выбором ответов, выбранным для максимизации точности, устойчивости к фальсификации и пригодности для глобального, высокоответственного использования.
Формат ситуационного суждения. Каждый элемент представляет собой короткий, реалистичный сценарий рабочего места, описывающий проблему, конфликт или задачу, основанный на критических инцидентах и мнении экспертов в данной области из разных отраслей. Следует набор возможных действий. Например, задержка проекта, где варианты варьируются от принятия на себя ответственности и перераспределения работы до тихого устранения неполадок и опроса команды. Нет однозначно правильных или неправильных ответов; каждый вариант выражает разную компетенцию. Кандидаты ранжируют варианты от наиболее вероятных до наименее вероятных или выбирают свои самые и наименее предпочтительные действия. Формат обеспечивает высокую лицевую валидность и вовлеченность, а также сильную критериальную валидность: десятилетия исследований показывают средние валидности SJT около 0.20–0.30. Критически важно, что SJTs, измеряющие личностные качества, коррелируют с чертами и результатами работы, оставаясь при этом гораздо менее подверженными преднамеренному фальсификаторству, поскольку они привязывают черты к контексту, а не спрашивают о них напрямую.
Длина и формат. Стандартный тест состоит примерно из 40 ситуационных заданий, охватывающих более 50 компетенций. Каждое задание предлагает три-четыре варианта ответов и занимает от одной до двух минут, что дает общее время тестирования примерно 45–50 минут. Длина была установлена с помощью моделирования Монте-Карло: внутренняя согласованность широких шкал пересекает допустимые уровни (α > 0.70) примерно на 20 сценариях и приближается к своему максимуму на 40.
| Количество элементов SJT | Симулированная надежность (α) |
|---|---|
| 5 | 0.28 |
| 10 | 0.46 |
| 15 | 0.59 |
| 20 | 0.68 |
| 25 | 0.73 |
| 30 | 0.77 |
| 35 | 0.80 |
| 40 | 0.82 |
| 45 | 0.83 |
| 50 | 0.84 |
Надежность возрастает с увеличением числа сценариев и стабилизируется около 0.82–0.85 при примерно 40 элементах. Xobin выбрал ~40 элементов для обеспечения высокой надежности при сохранении эффективности теста.
Администрирование и безопасность. Тест проводится онлайн и без наблюдения, в соответствии с современными требованиями удаленного найма. Порядок вопросов и вариантов ответов рандомизирован для каждого кандидата; большой пул заданий предотвращает обмен ответами; а временные метки и телеметрия анализируются ИИ для выявления аномальных паттернов, таких как мошенничество или предварительное знание заданий. Адаптивный выбор заданий означает, что два кандидата редко видят один и тот же набор сценариев. Платформа удобна для мобильных устройств и доступна, с проверками, которые препятствуют быстрому угадыванию.
Отчетность по баллам. Отчеты профилируют кандидата по каждой широкой области и подчеркивают сильные стороны и потенциальные проблемы среди 50 аспектов, в бизнес-ориентированном формате, сочетающем графики с нарративом. Кандидат может быть оценен высоко по Адаптивности & Обучению и Межличностным навыкам, умеренно по Критическому Мышлению и ниже по Стремлению & Исполнению, с интерпретирующим текстом, объясняющим, как этот профиль проявляется на работе. Оценки могут быть сопоставлены с соответствующими нормами (глобальными, отраслевыми или по уровню работы), и система отмечает рисковые оценки, где проверки согласованности указывают на низкую надежность ответов этого кандидата.
Каждое проектное решение, от рабочих сценариев до принудительного выбора и оценки AI, служит четырем руководящим принципам, установленным на этапе начала проекта: оценка должна быть надежной и действительной, устойчива к фальсификации и управлению впечатлениями, применима глобально и эффективна и безопасна в интернете.
Процесс разработки тестов
Разработка проходила от определения компетенций через написание элементов, пилотирование и анализ элементов, руководствуясь рекомендациями BPS/ITC и стандартами APA.
- Шаг 01Определение модели компетенций. An extensive literature review of personality and competency models, covering Big Five taxonomies, emotional intelligence models and others, was combined with interviews of corporate HR partners, leadership coaches and hiring managers across industries. Hundreds of candidate behavioural descriptors were distilled, using theory (mapping to models such as DeYoung's ten aspects of the Five Factor Model) and expert sorting, into the final six domains and roughly 50 competencies. Each was defined with behavioural examples for item writers: "Builds Trust", for instance, was defined as being honest, keeping commitments and fostering psychological safety.
- Шаг 02Написание элементов. Психологи I/O и эксперты в предметной области использовали технику критических инцидентов, собирая реальные анекдоты эффективного и неэффективного поведения для каждой компетенции. Для качества принятия решений инцидент может включать команду, выбирающую между двумя стратегиями на основе ограниченных данных, с четырьмя правдоподобными действиями, каждое из которых отражает различную черту: аналитическое обдумывание, импульсивность, отложение на других и так далее. Опции были рассмотрены так, чтобы социальная желательность была сбалансирована, поскольку у каждой есть свои плюсы и минусы, которые разумный человек мог бы предпочесть, и элементы были написаны на уровнях сложности от начального до лидерского. Было сгенерировано более 2,000 начальных элементов, с как минимум тремя-пятью сценариями для каждой компетенции на каждом уровне. Содержание было тщательно проверено на наличие предвзятости, с использованием инклюзивного языка и общих контекстов (вымышленная "ACME Corp.", а не культурно специфические имена), затем переведено двуязычными экспертами с прямым и обратным переводом для подтверждения эквивалентности значений.
- Шаг 03Пилотное тестирование. Пилотный проект проводился с N = 400 участниками, по 100 на каждом из четырех уровней работы: начальный уровень, младший (от одного до трех лет), средний уровень и старший. Выборка была разнообразной, составленной из добровольных заявителей и сотрудников из разных отраслей. Участники прошли более длинную форму SJT, около 1,5 часов, наряду с внешними мерами, включая инвентаризацию Большой пятерки и когнитивный тест для последующих проверок конвергентной валидности. Психометрики затем анализировали сложность элементов, дискриминацию элементов и дифференциальное функционирование элементов (DIF) по полу и культуре, используя классическую теорию тестирования и IRT. Элементы, которые были слишком легкими, не смогли дискриминировать или показали необъяснимые демографические различия, были пересмотрены или удалены. Элемент о социальной жизни после работы, на который по-разному отвечали старшие и младшие работники по причинам жизненного этапа, а не черты, является тем элементом, который был вырезан, чтобы избежать возрастной предвзятости. Около 50% элементов были сохранены или изменены, оставив уточненный банк примерно из 1,000 высококачественных сценариев, нацеленных на восемь-десять надежных элементов на каждую компетенцию на каждом уровне.
- Шаг 04Калибровка модели оценивания. Каждый вариант был закодирован по чертам, которые он указывает: выбор варианта, который отражает высокую Адаптивность как "наиболее вероятный", повышает этот балл, в то время как выбор варианта с низкой Адаптивностью снижает его. Структура принудительного выбора требовала многомерной модели IRT, в которой каждый вариант имеет параметры сложности и дискриминации по соответствующим измерениям, оцененным с помощью подходов в стиле Турстона и Брэдли-Терри для сравнительных данных. В результате алгоритм преобразует шаблон выборов в оценки черт и был валидирован по внешне собранным оценкам Большой пятерки: оценка межличностных навыков SJT коррелировала около r = 0.5 с опросником Доброжелательности в пилотном исследовании, с небольшими корректировками веса элементов, сделанными для максимизации конвергентной валидности.
- Шаг 05Анализ надежности. Внутренняя согласованность вычислялась для каждой шкалы, используя аналогичный альфа Кронбаха, агрегированный по парным ответам, как требуют форматы с принудительным выбором. Пилотный проект показал медиану α около 0.78, при этом большинство шкал выше 0.75. Несколько более слабых шкал, таких как аспект Творчества, который изначально находился около 0.65, были усилены дополнительными или уточненными элементами. Целью было α ≥ 0.70 для всех широких областей и большинства узких аспектов.
- Шаг 06Финальная сборка и стандартизация. Operational forms were assembled from the refined bank, with multiple forms allowing rotation and job-level tailoring. Each form covers all six domains and their facets across several items, balancing shorter and longer scenarios and mixing cognitively heavy items with straightforward ones to limit fatigue. Parallel forms were equated through common items so scoring is consistent regardless of the form received; adaptive selection effectively chooses among these equated forms based on inputs such as job level. A normative sample of more than 5,000 test takers, collected across regions and industries during the first year of operation, supports percentile ranks, stanines and stens for global and industry-specific interpretation. An independent panel of psychometric experts audited content for bias and reviewed the validity evidence for sufficiency; their feedback was incorporated into the final technical manual.
| Область компетенции | α Кронбаха |
|---|---|
| Стремление и Исполнение | 0.84 |
| Адаптивность и обучение | 0.80 |
| Влияние и Лидерство | 0.78 |
| Межличностное взаимодействие и командная работа | 0.81 |
| Эмоциональная устойчивость | 0.76 |
| Критическое Мышление | 0.75 |
Все области превышают общий порог 0.70. Альфа на уровне аспектов несколько ниже (0.6–0.7 для самых узких черт с наименьшим количеством элементов), что ожидаемо и приемлемо, поскольку аспекты агрегируются в более широкие области для основного использования.
Этическое и справедливое использование было обязательством на протяжении всего процесса: пилотные кандидаты проходили дебрифинг, живое тестирование включает информированное согласие и уведомления о конфиденциальности данных, а команды HR клиентов получают обучение по правильной интерпретации, чтобы ни один отдельный балл не имел чрезмерного веса в решении.
Доказательства надежности
Доказательства ниже основаны на первоначальной выборке валидации (пилотной и последующей, N ≈ 400), агрегированных операционных данных (N ≈ 5,000+) и целевых исследованиях валидности с клиентскими организациями.
Внутренняя согласованность. В выборке из 5,000 участников тестирования коэффициент альфа для шести широких областей варьируется от 0.75 до 0.88 с медианой около 0.82, что подтверждает однородность элементов в каждой области. Кандидаты, которые демонстрируют высокий уровень Драйва в одном сценарии, как правило, делают это и в других. Эти альфа совпадают или превышают те, которые обычно сообщаются для мер личности по шкале Лайкерта (~0.75–0.85), что примечательно, учитывая, что SJT является многомерным.
| Область компетенции | SEM (баллы) |
|---|---|
| Стремление и Исполнение | 6.0 |
| Адаптивность и обучение | 6.7 |
| Влияние и Лидерство | 7.0 |
| Межличностное взаимодействие и командная работа | 6.5 |
| Эмоциональная устойчивость | 7.3 |
| Критическое Мышление | 7.5 |
SEM соответствуют примерно одной трети до половины стандартного отклонения балла. Балл по Эмоциональной Устойчивости 70 имеет 68% вероятность истинного балла между примерно 63 и 77. Немного более высокий SEM по Критическому Мышлению отражает меньшее количество элементов и более разнообразное содержание; отчеты содержат доверительные интервалы для использования в условиях высокого риска.
Надежность повторного тестирования. Выборка из 120 сотрудников в клиентской организации прошла тест дважды, с интервалом в шесть месяцев. Корреляция повторного тестирования для общего композита составила r = 0.81; надежность повторного тестирования на уровне домена варьировала от 0.72 до 0.79. Повторное тестирование с коротким интервалом в две-три недели с 50 участниками дало r ≈ 0.85, что указывает на очень небольшую временную ошибку. Таким образом, порядок рангов индивидуумов остается последовательным, а изменения в оценке скорее отражают подлинное развитие, чем шум, что имеет значение, когда тест используется до и после развития.
Согласованность оценивания. Оценивание полностью автоматизировано, поэтому разногласия между оценщиками не являются фактором. В качестве проверки два психолога независимо оценили подразумеваемые уровни черт для 50 протоколов ответов; их суждения коррелировали выше 0.9 с автоматизированными баллами, подтверждая, что правила оценивания концептуально обоснованы и воспроизводимы человеческим мышлением.
Композит против профиля. Суммарная оценка "Общая поведенческая соответствие", среднее значение доменов или первый главный компонент, имеет высокую надежность при α ≈ 0.90 и захватывает общий фактор поведенческой эффективности. Тем не менее, Xobin призывает пользователей читать профиль оценок доменов, а не упрощенное одно число; каждый домен достаточно надежен для самостоятельной интерпретации.
Банк элементов и параллельные формы. Функции информации IRT подтверждают, что длина в 40 элементов обеспечивает достаточную точность по всему диапазону признаков. Версия на 20 элементов может использоваться для быстрого скрининга с более низкой надежностью (≈ 0.65–0.70); версия на 60 элементов повышает надежность лишь незначительно (≈ 0.87) перед уменьшением отдачи. Оценки двух случайно назначенных половин банка элементов коррелируют примерно на уровне 0.9 после коррекции, поэтому любая данная форма является представительной для полного банка.
В совокупности внутренняя согласованность и стабильность повторного тестирования соответствуют или превышают отраслевые эталоны. Исследования по SJTs на основе личности сообщают о коэффициентах повторного тестирования от двух до трех недель в диапазоне 0.6–0.7; шестимесячные показатели Xobin около 0.75 являются сильными. Поскольку формат минимизирует социально желательные ответы, эти оценки можно считать консервативными.
Доказательства валидности
Содержательная валидность. Компетенции были определены на основе литературы и мнений работодателей как критически важные для успеха на работе в различных ролях, и каждый сценарий основан на реалистичной ситуации с лицевой валидностью для кандидатов и SMEs. Психологи I/O и менеджеры по найму рассмотрели каждый элемент, чтобы подтвердить, что сценарии правдоподобны и важны, и что варианты ответов охватывают диапазон эффективных и неэффективных действий, связанных с целевыми компетенциями. Поскольку модель интегрирует Большую пятерку, EQ и критическое мышление, ни одна важная область (задача, люди, когнитивные способности, адаптивность) не упущена: каждый фактор Большой пятерки соответствует нескольким элементам, и каждый компонент EQ Гоулмана имеет сценарии, которые его вызывают. Отзывы клиентов о том, что сценарии "отражают повседневную реальность" и что отчеты "используют язык, соответствующий нашим моделям лидерства", подтверждают тот же вывод.
Конструктная валидность: факторная структура. Exploratory factor analysis on a large sample extracted six factors explaining a substantial share of variance, with loadings matching the intended design.
| Компетенция (аспект) | Стремление | Адаптироваться. | Влияние | Межлич. | Устойчивость | Крит. мышл. |
|---|---|---|---|---|---|---|
| Инициатива (Драйв) | 0.79 | 0.10 | 0.15 | 0.05 | 0.02 | 0.08 |
| Ориентированность на качество (Стремление) | 0.75 | 0.08 | 0.05 | 0.10 | 0.09 | 0.12 |
| Гибкость (Адаптивность) | 0.05 | 0.77 | 0.10 | 0.06 | 0.04 | 0.20 |
| Креативное Мышление | 0.04 | 0.73 | 0.08 | 0.00 | 0.05 | 0.25 |
| Убедительность (Влияние) | 0.10 | 0.06 | 0.76 | 0.12 | 0.00 | 0.05 |
| Ведение других (Лидерство) | 0.18 | 0.05 | 0.82 | 0.09 | 0.03 | 0.02 |
| Эмпатия (Межличностная) | 0.00 | 0.02 | 0.10 | 0.74 | 0.15 | 0.05 |
| Создает доверие (межличностное) | 0.11 | 0.00 | 0.05 | 0.72 | 0.10 | 0.03 |
| Стрессоустойчивость (Резилиентность) | 0.09 | 0.05 | 0.00 | 0.10 | 0.69 | 0.20 |
| Оптимизм (Устойчивость) | 0.06 | 0.10 | 0.00 | 0.08 | 0.71 | 0.00 |
| Аналитическое мышление (Крит. мышл.) | 0.05 | 0.22 | 0.00 | 0.00 | 0.10 | 0.80 |
| Качество Решений (Крит. мышл.) | 0.10 | 0.18 | 0.05 | 0.00 | 0.05 | 0.78 |
Каждая компетенция имеет наивысшую нагрузку на свой теоретический фактор, с общими низкими перекрестными нагрузками; Аналитическое мышление показывает ожидаемую вторичную нагрузку на Адаптивность, поскольку открытость новым идеям пересекается с аналитическим мышлением. Подтверждающий факторный анализ показал хорошую подгонку для модели с шестью факторами, и появляется фактор высшего порядка с нагрузками по областям около 0.6–0.7, что соответствует общему фактору поведенческой пригодности, в то время как отдельные факторы остаются устойчивыми.
Сходственная валидность. По сравнению со стандартным инвентарем Большой пятерки, проведенным в пилотной выборке: Межличностные отношения и командная работа коррелировали r = 0.65 с Доброжелательностью; Эмоциональная устойчивость r = 0.70 с инверсированным Невротизмом; Драйв и Исполнение r = 0.55 с Добросовестностью; Адаптивность и Обучение r = 0.60 с Открытостью; Влияние и Лидерство r = 0.50 с Экстраверсией, все значимо при p < .001. Критическое мышление коррелировало умеренно (r ≈ 0.30) с тестом когнитивных способностей: значимо, но не настолько высоко, чтобы предполагать, что тест измеряет чистую способность, а не предрасположенность. В организационных выборках баллы SJT Influence коррелировали примерно 0.4 с оценками руководителей по потенциалу лидерства, а SJT Adaptability около 0.45 с оценками сверстников по открытости к изменениям.
Дискриминантная валидность. Области, которые должны различаться, действительно различаются: Межличностные навыки против Критического мышления коррелируют около 0.2, Стремление против Межличностных навыков около 0.1. Тест различает черты, а не создает одну недифференцированную хорошую/плохую меру. Оценки коррелировали близко к нулю (r ≈ 0.05) с шкалой социальной желательности, что является прямым доказательством того, что дизайн с принудительным выбором сопротивляется управлению впечатлениями, в отличие от типичных самоотчетов.
Критериально-связанная валидность. Xobin собрала исследования валидации с более чем дюжиной клиентских организаций, связывая оценки SJT до найма с последующей производительностью на работе, успехом в обучении и другими результатами. Десять из них кратко изложены ниже.
| Роль | Коэффициент валидности (r) |
|---|---|
| Инженер-программист (ИТ) | 0.23 |
| Руководитель команды (ИТ) | 0.30 |
| Кассир (BFSI) | 0.20 |
| Финансовый консультант (BFSI) | 0.28 |
| Торговый представитель (FMCG) | 0.25 |
| Менеджер по продажам (FMCG) | 0.35 |
| Лабораторный техник (фармацевтика) | 0.22 |
| Менеджер продукта (Фарма) | 0.31 |
| Супервайзер завода (Энергетика) | 0.27 |
| Медсестра (Здравоохранение) | 0.24 |
Коэффициенты варьируются от 0.20 до 0.35, что типично для предсказателей, связанных с личностью, и все значимы при p < .05 или лучше, в IT, BFSI, FMCG, фармацевтике, энергетике и здравоохранении.
Эти коэффициенты означают, что тест сам по себе объясняет примерно 6–12% вариации в рабочей производительности, что является значительным вкладом для одной поведенческой оценки. Менеджер по продажам (FMCG) достиг r = 0.35 по сравнению с достижением квартальных целей, при этом более высокие баллы по Влиянию и Драйву предсказывают лучшие результаты продаж. Руководитель команды (IT) достиг r = 0.30 по сравнению с оценкой производительности супервизора. Даже самый низкий коэффициент, 0.20 для Кассир банка, имеет значение: производительность этой роли в значительной степени измерялась по уровням ошибок и соблюдению, что добросовестность в рамках SJT частично предсказывает. Сочетание SJT с когнитивными тестами или структурированными интервью еще больше повышает общую предсказательную силу, и валидности сохранялись без доказательств предвзятости среди демографических групп.
Связи компетенций с результатами. В международном колл-центре оценки Межличностного взаимодействия и Командной работы предсказали удовлетворенность клиентов для представителей службы поддержки на уровне r ≈ 0.30. В консалтинговой компании Критическое мышление и Адаптивность предсказали качество завершения проектов, оцененное коллегами, на уровне r ≈ 0.25. В программе подготовки менеджеров те, кто в конечном итоге был повышен, имели значительно более высокие начальные оценки Драйва и Исполнения и Лидерства (d ≈ 0.5), что свидетельствует о том, что тест может рано выявлять будущих лидеров.
Совпадающая валидность. С командой по продажам фармацевтических препаратов (N = 80) общий балл SJT коррелировал r = 0.29 с общей оценкой производительности супервайзера, а Влияние и Лидерство коррелировали r = 0.40 с оценкой, специфичной для работы, по убеждению врачей и достижению квоты. На производственном заводе (N = 60 супервайзеров) Эмоциональная Устойчивость коррелировала обратно с днями отпуска по причине стресса (r = −0.25).
Инкрементальная валидность. В выборке розничных сотрудников когнитивный тест предсказал производительность продаж на уровне r ≈ 0.20, а SJT на уровне r ≈ 0.22; в совокупности в регрессии они достигли R ≈ 0.30, при этом SJT добавил около 0.10 уникального прироста. SJT также добавляет к общему инвентарю личности, поскольку два человека с похожими оценками признаков могут различаться в том, насколько эффективно они применяют эти признаки в ситуациях, что является знанием ситуационного суждения. Клиенты сообщают, что сочетание SJT с другими оценками значительно улучшает качество найма по сравнению с когнитивным тестированием в одиночку.
Анализ справедливости и предвзятости
Различия между подгруппами. Распределения баллов сравнивались по полу и по основным этническим группам в большой выборке. Различия были незначительными: мужчины и женщины-кандидаты имели практически равные средние значения по общему баллу (разница менее 0.1 SD). Несколько аспектов показали небольшие различия, при этом женщины немного выше по Межличностным навыкам, а мужчины немного выше по Критическому Мышлению, но эффекты были d ≈ 0.2 или меньше и непоследовательны в разных выборках, поэтому они не указывают на предвзятость теста. Анализ DIF на уровне элементов не выявил ни одного элемента, на который по-разному отвечала бы демографическая группа после контроля уровня черты. Различия между странами также были небольшими и в значительной степени объяснялись известными различиями на уровне культуры, и каждая локализованная языковая версия была проверена на семантическое соответствие.
Соблюдение стандартов. Тест был разработан в соответствии с принципами EEO и ISO 10667. Соотношения негативного воздействия контролируются; в крупных развертываниях, уровни отбора по полу и расе, когда SJT используется в качестве барьера, оставались в пределах правила четырех пятых в каждом случае на сегодняшний день. Один клиент заменил неструктурированное интервью на SJT и обнаружил, что это снизило субъективную предвзятость и улучшило разнообразие кандидатов, проходящих дальше.
Реакции кандидатов. Опросы участников тестирования сообщают о положительных реакциях: большинство нашли сценарии актуальными для работы и чувствовали, что могут продемонстрировать свои сильные стороны. Кандидаты, которые считают простые анкеты с принудительным выбором странными, как правило, находят их увлекательными в рамках сценария. Уровень завершения превышает 95%, что указывает на то, что длина и содержание приемлемы в условиях без наблюдения.
Результаты и полезность
Клиентские организации зафиксировали снижение текучести кадров, одна из них увидела снижение текучести новых сотрудников на 30% после добавления SJT к процессу найма, а также более высокую производительность среди отобранных и значительную экономию времени на отборе. Одна компания использовала SJT, чтобы сократить пул кандидатов вдвое на ранних этапах, однако 95% из тех, кто был приглашен на финальное собеседование, были оценены как подходящие или очень подходящие менеджерами по найму, что указывает на то, что тест эффективно отсеивал слабых кандидатов, а не произвольно.
Заключение
Психометрический тест Xobin измеряет то, что он намерен измерять, его содержание верно отражает необходимые рабочие поведения и предсказывает значимые критерии производительности для различных ролей и отраслей. Внутренняя согласованность хорошая до отличной, стабильность повторного тестирования высокая, шестифакторная структура сохраняется как при исследовательском, так и при подтверждающем анализе, а дизайн с принудительным выбором сохраняет оценки в основном некоррелированными с социальной желательностью. Анализ справедливости не показывает негативного воздействия и предвзятости по отмеченным элементам.
This is the evidence base behind every behavioural score Xobin reports, the same standard of validation Xobin Research applies to the Xobin Capability Graph and to the wider skills work. Teams that want the same rigour in their own hiring can use it directly through Xobin.
Ссылки
- ·Ashton, M. C., & Lee, K. (2007). Empirical, theoretical, and practical advantages of the HEXACO model of personality structure.
- ·Duckworth, A. L., Peterson, C., Matthews, M. D., & Kelly, D. R. (2007). Grit: Perseverance and passion for long-term goals.
- ·Facione, P. A., Sánchez, C. A., Facione, N. C., & Gainen, J. (1995). The disposition toward critical thinking.
- ·Goleman, D. (1998). Working with Emotional Intelligence.
- ·Lombardo, M. M., & Eichinger, R. W. (2000). High potentials as high learners.
- ·Scouller, J. (2011). The Three Levels of Leadership: How to Develop Your Leadership Presence, Knowhow and Skill.
- ·DeYoung, C. G., Quilty, L. C., & Peterson, J. B. (2007). Between facets and domains: Ten aspects of the Big Five.
- ·Situational judgment test literature on criterion validity and resistance to faking, which informed the design of Xobin's SJT format.
- ·British Psychological Society (BPS) and International Test Commission (ITC) guidelines for occupational test development; APA Standards for Educational and Psychological Testing; ISO 10667.
Хотите полный технический мануал, нормы или исследование валидации, специфичное для роли?
Xobin Research делится подробной документацией с командами HR, юридическими и закупочными службами, оценивающими оценку.
Связаться →