Xobin 心理测量学测试:信度和有效性证据
Xobin情境判断测试(SJT)背后的完整技术文档:行为模型、测试构建方式,以及在2021年至2024年间进行的可靠性、有效性和公平性研究。
作者
Guruprakash Sivabalan
创始人,Xobin。领导 Xobin Research 在评估科学、心理测量验证和 Xobin Capability Graph 方面的项目。
本文总结了Xobin心理测评测试(SJT)技术文档报告,版本2.9.1,涵盖了2021年至2024年间进行的可靠性和有效性研究。项目内容、评分标准和基础候选人级别的数据集仍然是专有和保密的;此处报告的统计数据来自技术手册。
执行摘要
Xobin 的工业–组织 (I/O) 心理学家和心理测量学家的团队为企业规模的高容量招聘、专业评估和领导力发展设计了一种广泛的心理测量评估。
开发分为两个轨道。第一个建立了一个综合行为模型,借鉴了当前在个性心理学、领导科学、情商和批判性思维方面的研究。第二个设计并验证了一种情境判断测试(SJT),该测试准确有效地测量这些行为能力,具有相关性、公平性和跨全球职位的预测准确性。
该测试为企业人力资源团队提供了一个可靠、全面的候选人行为评估,适用于招聘和发展背景。已发布的研究表明,使用心理测评的组织可以将招聘成功率提高多达40%,并将员工留存率提高24%。这些收益转化为降低员工流失成本、更有效的团队和更好的绩效。
评估的完整性是设计的核心。该测试整合了在个性、学习敏捷性、领导力、情商(EQ)和批判性思维方面的既定框架,并呈现出候选人的判断揭示潜在特征和决策风格的现实工作场景。能力量表的内部一致性从良好到优秀(Cronbach's α ≈ 0.6–0.8),重测研究显示结果随时间稳定,强制选择的 SJT 格式明显不易伪造,优于传统的自我报告问卷。
全球适用性和行业多样性
该测试已设计并验证为全球适用和跨行业相关。它已在美国、欧洲、中东、南亚和亚太地区进行了本地化和标准化。本地化不仅包括翻译成15种以上语言,还包括对情境的文化适应,以保持上下文的适当性和跨人群的解释等价性。
该评估在以下方面展示了操作有效性:
- ·信息技术与软件开发
- ·制药和生命科学
- ·银行、金融服务和保险 (BFSI)
- ·快速消费品(FMCG)
- ·零售
- ·工程、制造和核心工业部门
- ·能源与公用事业
- ·专业和咨询服务
- ·医疗保健与医院管理
在这些垂直领域中,它被用于高容量的入门级角色筛选、专业和中级职位的行为分析,以及管理和高管发展轨道的领导潜力评估。行业特定的基准和规范数据使得个别分数可以与相关行业标准进行解释,而不是单一的全球平均值。
与心理测量标准的一致性
Xobin 的开发方法遵循英国心理学会 (BPS) 和国际测试委员会 (ITC) 对职业评估的标准。项目开发生命周期包括:
- ·综合能力建模和职位分析
- ·开发了超过2,000个试点项目,按职位级别进行分层
- ·多阶段试点,包括经典项目分析和项目反应理论(IRT)校准
- ·对项目级偏差、难度指数和区分参数的检查
- ·蒙特卡罗模拟以优化测试长度和心理测量效率
- ·子组公平性、语言中立性和分数在不同人群中的普遍性验证
这种方法确保每个情境提示和响应选项反映与工作相关的行为构造,在各个人群中一致运行,并对特质估计做出有意义的贡献。情境判断项目经过细致的试点和分析,以确认它们在难度、区分度和无偏见方面按预期功能,产生了一个统计上稳健、构造有效的工具,与国际最佳人事选拔实践相一致。
行为模型和框架
该模型基于五大人格(OCEAN)结构:开放性、责任心、外向性、宜人性和情绪稳定性(神经质反转)。它融合了来自领导力、情绪智力和批判性思维研究的构念,以便比传统的人格测试更全面地捕捉工作场所行为。
学习敏捷性(隆巴多与艾辛格)
学习敏捷性是指在首次、困难或不同条件下执行任务的意愿和能力。实际上,这变成了适应性、开放反馈、创新和快速学习,这些品质表明一个人是否能够在动态环境中茁壮成长,并且是动荡环境中领导潜力的关键预测指标。
领导力(斯考勒的三个层次)
Scouller(2011)认为,领导力在个人、私人和公共层面上运作:自我意识和自我掌控、一对一的人际交往技能以及团队或组织领导力。自信、诚信、辅导能力、影响力和愿景等特质映射到这些层面,因此该测试涵盖了个人贡献者和未来领导者所需的能力。
情商(Goleman)
戈尔曼的情商框架涵盖自我意识、自我调节、动机、同理心和社交技能,通过管理压力下的情绪、对同事或客户表现同理心以及处理冲突的场景来进行评估。这些行为对团队合作、客户服务工作和领导力至关重要,并将测量扩展到超越纯粹推理的领域,包括人际有效性和情绪自我管理。
批判性思维倾向(Facione)
Facione等(1995)将批判性思维倾向描述为智力好奇心、开放心态和理性反思问题的习惯。这表现为分析思维、决策质量、问题解决和风险管理:场景揭示候选人是基于证据和逻辑还是冲动和偏见做出决定,衡量人们如何思考困境,而不仅仅是他们与他人互动时的行为。
额外的工作场所能力
文献综述和行业输入识别了大五人格未完全覆盖的特质。谦逊和诚信,意味着诚实、谦虚以及承认错误而不是推卸责任,与HEXACO的诚实-谦逊因素相一致(阿什顿与李,2007)。韧性和毅力,源自达克沃斯等(2007),通过关注持续努力和从挫折中恢复来补充情绪稳定性。总体而言,该模型涵盖了50多个具体能力,从建立信任和合作到创新和战略思维,每个能力在概念上都与上述一个或多个框架相关联。
六个能力领域
50多个能力被组织成六个广泛的领域用于评分和解释。分数在面向层面报告,并汇总到领域层面。
驱动力与执行
可靠性 · 主动性 · 坚持 · 质量关注 · 雄心
以成就为导向的特质主要与责任心相关,以及领导动机的雄心和权力方面。高分者可靠、注重结果且持久;低分者对目标更放松或灵活。这与其他模型所称的任务风格一致:有计划和自律。
适应能力与学习
灵活性 · 创造性思维 · 对经验的开放 · 持续学习
与开放性和学习敏捷性相关的特质。高分者思想开放,快速掌握新技能或适应变化;低分者更喜欢熟悉的方法,但提供一致性和实用的关注。该领域结合了Facione的分析好奇心与Lombardo和Eichinger的学习敏捷性。
影响与领导力
自信 · 说服力 · 委托 · 战略愿景 · 雄心
外向性相关的方面和领导的驱动力。高分者表现为领导者,能够舒适地做出决策并引导团队方向。低分者往往是团队合作者或避免聚光灯的个人贡献者。该领域表明管理和销售领导潜力,对应于Scouller的公共领导水平。
人际关系与团队合作
同理心 · 建立信任 · 冲突解决 · 沟通 · 谦逊 · 外交 · 多样性与包容性
以宜人性和社会情感智力为中心。高分者合作、富有同情心且以团队为导向,建立积极的关系,将团队目标置于自我之上。低分者可能更专注于任务或独立,有时以牺牲机智为代价。这表明适合于合作、客户服务和私密人际层面的领导。
情感韧性与自我管理
压力耐受力 · 积极性和乐观主义 · 自我意识 · 冲动控制
对应于情绪稳定性和情绪智力的自我调节方面。高分者在压力下保持冷静,从挫折中恢复并保持乐观。低分者在压力下可能感到焦虑,但在情感上可能更透明。对于高压角色和个人层面的领导力尤为重要。
批判性思维与决策
决策质量 · 判断 · 对证据的开放 · 风险管理 · 伦理推理
在个性评估中不寻常的是,该领域评估解决问题的认知行为倾向,而不是纯粹的能力测试。高分者权衡权衡,考虑长期后果并根据证据做出决定;低分者直觉或快速决策,这在简单任务中是有效的,但在复杂任务中则存在风险。
该模型是迭代构建的:Xobin的I/O心理学家从五大人格结构开始,然后将情绪智力、学习敏捷性和真实领导力的构念映射或分组到其上,以确保没有重要内容缺失:谦逊和同理心分组为人际关系,雄心和权力分组为影响力与领导力。专家判断加上因子分析研究产生了一个涵盖认知、人际关系、领导力、适应能力和个人驱动力领域的模型,能够预测工作表现和潜力。
评估方法
该测试采用情境判断格式,具有自我比较的强制选择响应设计,旨在最大化准确性、抵制伪造,并适合全球高风险使用。
情境判断格式。 每个项目呈现一个简短、现实的工作场景,描述一个挑战、冲突或任务,基于关键事件和跨行业的主题专家输入构建。接下来是一组可能的行动。例如,一个项目的挫折,选项包括主动承担责任和重新分配工作、安静地排除故障、征询团队意见。没有绝对的对或错答案;每个选项表达不同的能力。候选人将选项从最可能到最不可能进行排名,或选择他们最喜欢和最不喜欢的行动。该格式提供了高的表面效度和参与度,以及强的标准效度:数十年的研究使得平均SJT效度在0.20–0.30之间。关键是,测量个性的SJT与特质和工作结果相关,而不容易受到故意伪造的影响,因为它们将特质锚定在上下文中,而不是直接询问。
长度和格式。 标准测试大约包含40个基于情境的项目,涵盖50多个能力。每个情境提供三到四个选项,耗时一到两分钟,总测试时间大约为45-50分钟。长度由蒙特卡罗模拟设定:广泛量表的内部一致性在大约20个情境时达到可接受水平(α > 0.70),并在40个情境时接近其最大值。
| SJT项目数量 | 模拟可靠性 (α) |
|---|---|
| 5 | 0.28 |
| 10 | 0.46 |
| 15 | 0.59 |
| 20 | 0.68 |
| 25 | 0.73 |
| 30 | 0.77 |
| 35 | 0.80 |
| 40 | 0.82 |
| 45 | 0.83 |
| 50 | 0.84 |
随着场景的增加,可靠性上升,并在约40个项目时接近平稳在0.82–0.85。Xobin选择了~40个项目以确保高可靠性,同时保持测试的高效性。
管理和安全。 该测试在线进行且不需要监考,以适应现代远程招聘。每位候选人的问题和选项顺序都是随机的;大量项目池防止答案共享;时间戳和遥测数据由人工智能分析,以检测异常模式,如作弊或项目预知。自适应项目选择意味着两个候选人很少看到相同的情境集。该平台支持移动设备且易于访问,并有检查措施以防止快速猜测。
得分报告。 报告在每个广泛领域中描绘候选人的特征,并在50个方面中突出优势和潜在问题,以结合图表和叙述的商业导向格式。候选人在适应性与学习和人际交往方面可能得分较高,在批判性思维方面得分适中,而在驱动与执行方面得分较低,并附有解释性文本说明该特征在工作中的表现。分数可以与相关标准(全球、行业或职位级别)进行基准比较,系统会标记风险分数,其中一致性检查表明该候选人的响应可靠性较低。
每一个设计决策,从工作场景到强制选择再到AI评分,都遵循项目开始时设定的四个指导原则:评估必须可靠和有效,抵抗伪造和印象管理,全球适用,并且在线高效和安全。
测试开发过程
开发从能力定义到题目编写、试点和题目分析,遵循BPS/ITC指南和APA标准。
- 步骤 01定义能力模型。 An extensive literature review of personality and competency models, covering Big Five taxonomies, emotional intelligence models and others, was combined with interviews of corporate HR partners, leadership coaches and hiring managers across industries. Hundreds of candidate behavioural descriptors were distilled, using theory (mapping to models such as DeYoung's ten aspects of the Five Factor Model) and expert sorting, into the final six domains and roughly 50 competencies. Each was defined with behavioural examples for item writers: "Builds Trust", for instance, was defined as being honest, keeping commitments and fostering psychological safety.
- 步骤 02项目编写。 I/O心理学家和主题专家使用关键事件技术,收集每项能力的有效和无效行为的真实轶事。对于决策质量,一个事件可能涉及一个团队在有限数据上选择两种策略,四个合理的行动各自反映不同的特质:分析性思考、冲动、推迟他人等。选项经过审查,以确保社会期望的平衡,因为每个选项都有合理的人可能偏好的优缺点,条目在领导难度级别上编写。生成了超过2,000个初始条目,每个能力在每个级别至少有三个到五个场景。内容经过审查以消除偏见,使用包容性语言和通用背景(一个虚构的“ACME Corp.”而不是文化特定的名称),然后由双语专家进行翻译,并进行前后翻译以确认意义的等效性。
- 步骤 03试点测试。 一项试点研究共招募了400名参与者,四个职位级别各100名:入门级、初级(1到3年)、中级和高级。样本多样,来自各行业的志愿申请者和员工。参与者参加了更长形式的SJT,约1.5小时,同时进行外部测量,包括五大人格评估和认知测试,以便后续的收敛效度检查。心理测量学家随后分析了项目难度、项目区分度和按性别和文化的差异项目功能(DIF),使用经典测试理论和IRT。那些过于简单、未能区分或显示无法解释的人口差异的项目被修订或删除。关于加班社交活动的项目,由于生活阶段而非特质原因,老年和年轻工人的回答不同,这类项目被删除以避免年龄偏见。大约50%的项目被保留或修改,留下大约1,000个高质量场景的精炼库,每个能力每个级别针对8到10个可靠项目。
- 步骤 04评分模型校准。 每个选项都被编码以指示其特质:选择一个反映高适应性的选项作为“最可能”会提高该分数,而选择一个低适应性的选项则会降低它。强制选择结构需要一个多维IRT模型,其中每个选项在相关维度上具有难度和区分参数,使用Thurstone和Bradley-Terry风格的方法估算比较数据。生成的算法将选择模式转换为特质估计,并与外部收集的五大性格分数进行了验证:SJT人际交往分数与试点中的宜人性问卷相关性约为r = 0.5,并进行了小的项目加权调整以最大化收敛效度。
- 步骤 05可靠性分析。 每个量表的内部一致性是通过类似的 Cronbach's alpha 计算的,聚合成对响应,因为强制选择格式的要求。试点显示中位数 α 约为 0.78,大多数量表在 0.75 以上。一些较弱的量表,例如最初接近 0.65 的创造力方面,通过额外或精炼的项目得到了加强。目标是所有广泛领域和大多数狭窄方面的 α ≥ 0.70。
- 步骤 06最终组装和标准化。 Operational forms were assembled from the refined bank, with multiple forms allowing rotation and job-level tailoring. Each form covers all six domains and their facets across several items, balancing shorter and longer scenarios and mixing cognitively heavy items with straightforward ones to limit fatigue. Parallel forms were equated through common items so scoring is consistent regardless of the form received; adaptive selection effectively chooses among these equated forms based on inputs such as job level. A normative sample of more than 5,000 test takers, collected across regions and industries during the first year of operation, supports percentile ranks, stanines and stens for global and industry-specific interpretation. An independent panel of psychometric experts audited content for bias and reviewed the validity evidence for sufficiency; their feedback was incorporated into the final technical manual.
| 能力领域 | 克朗巴赫α |
|---|---|
| 驱动力与执行 | 0.84 |
| 适应能力与学习 | 0.80 |
| 影响与领导力 | 0.78 |
| 人际关系与团队合作 | 0.81 |
| 情感韧性 | 0.76 |
| 批判性思维 | 0.75 |
所有领域都超过了常见的0.70阈值。特征级α值略低(对于项目最少的最狭窄特质为0.6-0.7),这是预期和可接受的,因为特征聚合到更广泛的领域以供主要使用。
在整个过程中,伦理和公平使用是一项承诺:试点候选人进行了反馈,现场测试包含知情同意和数据隐私通知,客户人力资源团队接受正确解读的培训,以确保在决策中没有单一分数被过度加权。
可靠性证据
以下证据来自初始验证样本(试点和后续,N ≈ 400)、汇总的操作数据(N ≈ 5,000+)以及与客户组织的针对性有效性研究。
内部一致性。 在5000名测试者的样本中,六个广泛领域的系数α范围从0.75到0.88,中位数接近0.82,确认每个领域内的项目是同质的。在一个场景中表现出高驱动力的候选人在其他场景中也往往如此。这些α值与通常报告的李克特量表人格测量值(约0.75-0.85)相匹配或超过,考虑到SJT是多维的,值得注意。
| 能力领域 | SEM(分数) |
|---|---|
| 驱动力与执行 | 6.0 |
| 适应能力与学习 | 6.7 |
| 影响与领导力 | 7.0 |
| 人际关系与团队合作 | 6.5 |
| 情感韧性 | 7.3 |
| 批判性思维 | 7.5 |
SEM大约对应于分数标准差的三分之一到一半。情感韧性得分为70时,真实得分在63到77之间的概率为68%。批判性思维的SEM略高反映了项目较少和内容更为多样化;报告中包含高风险使用的置信区间。
测试-重测可靠性。 一项客户组织中的120名员工在六个月内参加了两次测试。整体综合的重测相关性为r = 0.81;领域级重测可靠性范围为0.72到0.79。50名参与者在两到三周内进行的短间隔重测得到了r ≈ 0.85,表明几乎没有瞬时误差。因此,个人的排名顺序保持一致,分数的变化更可能反映真实的发展而非噪声,这在测试用于发展前后时尤为重要。
评分一致性。 评分是完全自动化的,因此评分者之间的分歧不是一个因素。作为检查,两位心理学家独立评估了50个响应协议的隐含特质水平;他们的判断与自动评分的相关性超过0.9,确认评分规则在概念上是合理的,并且可以通过人类推理再现。
综合与档案。 一个汇总的“整体行为适应性”分数,领域的平均值或第一个主成分,在α ≈ 0.90时具有很高的可靠性,并捕捉到行为有效性的一个一般因素。尽管如此,Xobin仍然鼓励用户阅读领域分数的概况,而不是一个过于简化的单一数字;每个领域都足够可靠,可以单独解释。
项目库和平行形式。 IRT 信息函数确认 40 项长度在特质范围内提供了充足的精度。20 项版本可用于低可靠性(≈ 0.65–0.70)的快速筛查;60 项版本仅略微提高可靠性(≈ 0.87),然后收益递减。经过修正后,项目库的两个随机分配的部分的得分相关性约为 0.9,因此任何给定的形式都是完整库的代表。
综合来看,内部一致性和重测稳定性达到或超过行业基准。关于基于人格的 SJT 的研究报告称,重测系数在 0.6–0.7 范围内,持续两到三周;Xobin 的六个月数据约为 0.75,表现强劲。由于该格式最小化了社会期望反应,这些估计可以说是保守的。
有效性证据
内容效度。 能力是从文献和雇主输入中确定的,被认为是许多角色工作成功的关键,每个场景都基于现实情况,具有候选人和 SME 的表面效度。I/O 心理学家和招聘经理审查了每个项目,以确认场景是合理和重要的,且响应选项涵盖了一系列与目标能力相关的有效和无效行为。由于该模型整合了五大人格、情商和批判性思维,因此没有遗漏任何主要领域(任务、人员、认知、适应性):每个五大人格因素映射到多个项目,每个 Goleman 情商组件都有引发它的场景。客户反馈表明场景“反映日常现实”,报告“使用与我们的领导模型相匹配的语言”,支持了相同的结论。
构建效度:因子结构。 Exploratory factor analysis on a large sample extracted six factors explaining a substantial share of variance, with loadings matching the intended design.
| 能力(方面) | 驱动力 | 适应。 | 影响 | 人际关系。 | 韧性 | 批判性思维。 |
|---|---|---|---|---|---|---|
| 主动性(驱动) | 0.79 | 0.10 | 0.15 | 0.05 | 0.02 | 0.08 |
| 质量关注(驱动) | 0.75 | 0.08 | 0.05 | 0.10 | 0.09 | 0.12 |
| 灵活性 (适应性) | 0.05 | 0.77 | 0.10 | 0.06 | 0.04 | 0.20 |
| 创造性思维 | 0.04 | 0.73 | 0.08 | 0.00 | 0.05 | 0.25 |
| 说服力(影响) | 0.10 | 0.06 | 0.76 | 0.12 | 0.00 | 0.05 |
| 领导他人(领导力) | 0.18 | 0.05 | 0.82 | 0.09 | 0.03 | 0.02 |
| 同理心(人际交往) | 0.00 | 0.02 | 0.10 | 0.74 | 0.15 | 0.05 |
| 建立信任(人际关系) | 0.11 | 0.00 | 0.05 | 0.72 | 0.10 | 0.03 |
| 压力耐受力(韧性) | 0.09 | 0.05 | 0.00 | 0.10 | 0.69 | 0.20 |
| 乐观(韧性) | 0.06 | 0.10 | 0.00 | 0.08 | 0.71 | 0.00 |
| 分析性思维(批判性思维) | 0.05 | 0.22 | 0.00 | 0.00 | 0.10 | 0.80 |
| 决策质量(批判性思维) | 0.10 | 0.18 | 0.05 | 0.00 | 0.05 | 0.78 |
每个能力在其理论因素上加载最高,通常交叉加载较低;分析思维在适应性上显示出预期的次级加载,因为对新想法的开放性与分析思维重叠。确认性因素分析显示六因素模型的良好拟合,且出现了一个高阶一般因素,其领域加载约为0.6–0.7,与一般行为适应性因素一致,而独特因素仍然稳健。
趋同效度。 在对一个试点子集进行的标准大五量表中:人际关系与团队合作的相关性r = 0.65与宜人性;情绪韧性r = 0.70与反向神经质;驱动力与执行r = 0.55与责任心;适应能力与学习r = 0.60与开放性;影响力与领导力r = 0.50与外向性,所有结果在p < .001时显著。批判性思维与认知能力测试的相关性适中(r ≈ 0.30):显著,但并不高到表明该测试测量的是纯能力而非倾向。在组织样本中,SJT影响力得分与主管对领导潜力的评分相关约0.4,SJT适应能力与同事对变革开放性的评分相关约0.45。
区分效度。 应该有所不同的领域确实不同:人际交往与批判性思维的相关性约为0.2,人际交往与驱动力的相关性约为0.1。该测试区分特质,而不是产生一个未区分的好/坏测量。分数与社会期望量表的相关性接近零(r ≈ 0.05),直接证明强制选择设计抵制印象管理,这与典型的自我报告不同。
标准相关效度。 Xobin 已经与十多家客户组织编制了验证研究,将预聘 SJT 分数与后来的工作表现、培训成功和其他结果相关联。下面总结了十个。
| 角色 | 有效性系数 (r) |
|---|---|
| 软件工程师 (IT) | 0.23 |
| 团队负责人(IT) | 0.30 |
| 银行出纳员 (BFSI) | 0.20 |
| 金融顾问 (BFSI) | 0.28 |
| 销售代表(快速消费品) | 0.25 |
| 销售经理(快速消费品) | 0.35 |
| 实验室技术员(制药) | 0.22 |
| 产品经理(制药) | 0.31 |
| 工厂主管(能源) | 0.27 |
| 护士(医疗) | 0.24 |
系数范围约为 0.20 到 0.35,典型于与个性相关的预测因子,且在 IT、BFSI、快速消费品、制药、能源和医疗保健领域均显著,p < .05 或更好。
这些系数意味着该测试单独解释了大约6-12%的工作表现差异,这是单一行为评估的有意义贡献。销售经理(快速消费品)在季度目标达成率上达到了r = 0.35,较高的影响力和驱动力得分预测了更好的销售结果。团队负责人(IT)在监督绩效评分上达到了r = 0.30。即使是最低的系数,0.20对于银行出纳,也具有价值:该角色的表现主要是根据错误率和遵守情况来衡量的,而SJT中的尽责性部分预测了这一点。将SJT与认知测试或结构化面试结合使用进一步提高了整体预测能力,并且在各个群体中没有证据表明存在偏见。
能力与结果的关联。 在一个国际呼叫中心,人际关系与团队合作得分预测服务代表的客户满意度为 r ≈ 0.30。在一家咨询公司,批判性思维和适应能力各自预测同事评定的项目完成质量为 r ≈ 0.25。在一个管理培训项目中,最终晋升的人初始的驱动与执行和领导力得分显著更高(d ≈ 0.5),这证明该测试可以早期识别未来的领导者。
同时效度。 在一个制药销售团队(N = 80)中,SJT总分与主管的整体绩效评分相关系数r = 0.29,影响力与领导力与说服医生和达成配额的工作特定评分相关系数r = 0.40。在一个制造工厂(N = 60名主管)中,情绪韧性与与压力相关的请假天数呈负相关(r = −0.25)。
增量效度。 在零售助理样本中,认知测试预测销售表现的相关性为 r ≈ 0.20,SJT 的相关性为 r ≈ 0.22;在回归中结合后,它们达到了 R ≈ 0.30,SJT 贡献了约 0.10 的独特增量。SJT 还增加了通用人格评估,因为两个具有相似特质得分的人在如何有效地应用这些特质于情境中可能会有所不同,这就是情境判断知识。客户报告称,将 SJT 与其他评估结合使用显著提高了招聘质量,超过了单独的认知测试。
公平与偏见分析
子组差异。 在大样本中,按性别和主要族群比较了得分分布。差异微不足道:男性和女性候选人在整体得分上的均值几乎相等(相差不到0.1 SD)。一些方面显示出小差异,女性在交际能力上略高,男性在批判性思维上略高,但效果约为d ≈ 0.2或更小,并且在样本间不一致,因此不表明测试偏见。项目级的DIF分析发现,在控制特质水平后,没有项目在不同人口群体中回答不同。国家间的差异同样较小,主要由已知的文化层面特质差异解释,每个本地化语言版本都经过语义等效性检查。
符合标准。 该测试是根据平等就业机会(EEO)原则和ISO 10667开发的。监测不利影响比率;在大规模部署中,当SJT作为门槛使用时,按性别和种族的选择率在每个案例中都保持在四分之五规则之内。一位客户用SJT替代了非结构化面试,发现它减少了主观偏见,提高了候选人进展的多样性。
候选人反应。 测试者调查报告积极反应:大多数人认为这些情境与工作相关,并感到能够展示自己的优势。觉得裸露的强制选择问卷奇怪的候选人往往在情境中觉得它们引人入胜。完成率超过 95%,表明在无监考环境下,长度和内容是可以接受的。
结果和效用
客户组织记录了员工流失率的降低,其中一家在招聘中添加 SJT 后,新员工流失率减少了 30%,同时被选中的员工表现更高,筛选过程节省了大量时间。一家公司使用 SJT 在招聘初期将申请者池减少了一半,但被邀请参加最终面试的 95% 的人被招聘经理评为合适或高度合适,这表明该测试有效地筛选出了较弱的候选人,而不是随意的。
结论
Xobin心理测评测试测量其意图测量的内容,其内容忠实地代表所需的工作行为,并且它预测跨角色和行业的有意义的绩效标准。内部一致性良好到优秀,重测稳定性高,六因素结构在探索性和确认性分析中保持一致,强制选择设计使得分数基本上与社会期望无关。公平性分析显示没有不利影响和没有标记项目偏见。
This is the evidence base behind every behavioural score Xobin reports, the same standard of validation Xobin Research applies to the Xobin Capability Graph and to the wider skills work. Teams that want the same rigour in their own hiring can use it directly through Xobin.
参考文献
- ·Ashton, M. C., & Lee, K. (2007). Empirical, theoretical, and practical advantages of the HEXACO model of personality structure.
- ·Duckworth, A. L., Peterson, C., Matthews, M. D., & Kelly, D. R. (2007). Grit: Perseverance and passion for long-term goals.
- ·Facione, P. A., Sánchez, C. A., Facione, N. C., & Gainen, J. (1995). The disposition toward critical thinking.
- ·Goleman, D. (1998). Working with Emotional Intelligence.
- ·Lombardo, M. M., & Eichinger, R. W. (2000). High potentials as high learners.
- ·Scouller, J. (2011). The Three Levels of Leadership: How to Develop Your Leadership Presence, Knowhow and Skill.
- ·DeYoung, C. G., Quilty, L. C., & Peterson, J. B. (2007). Between facets and domains: Ten aspects of the Big Five.
- ·Situational judgment test literature on criterion validity and resistance to faking, which informed the design of Xobin's SJT format.
- ·British Psychological Society (BPS) and International Test Commission (ITC) guidelines for occupational test development; APA Standards for Educational and Psychological Testing; ISO 10667.
想要完整的技术手册、规范或特定角色的验证研究吗?
Xobin Research 与评估的 HR、法律和采购团队分享详细文档。
联系 →