人类与人工智能技能报告 2026
Xobin Research 正在完成大规模的比较,将大约 20,000 种工作技能与前沿 AI 模型进行比较。请在下面注册,以接收完整报告、早期发现和新闻发布会,随着工作的发布。
作者
Guruprakash Sivabalan
创始人,Xobin。领导 Xobin Research 在评估科学和人类与 AI 技能经济学方面的项目。
Xobin Research 在过去四年中一直在绘制人类能力、职位要求和现在的人工智能之间的关系。
人类与AI技能报告2026是该工作的首次公开发布。它比较了大约20,000项工作技能,这些技能来自Xobin能力图(XCG)的技能层,与七到八个前沿AI模型的小组进行比较。这些技能涵盖技术、专业、认知、人际和操作能力,提炼自自2022年1月以来收集的超过五百万个评估记录和超过30,000个职位描述。
我们正在测量什么
大多数公共AI基准测试将模型相互比较,基于经过筛选的学术任务。我们提出了一个不同的问题:对于雇主目前测试、面试和奖励的特定技能,是否仍然有人的价值是最佳可用AI所无法提供的?回答这个问题需要将模型输出与现实世界的工作要求、职业分类法以及Xobin在其评估语料库中收集的验证结果联系起来。
AI小组包括来自OpenAI、Anthropic、Google、Meta和Mistral的领先模型。每个模型都根据Xobin用于人类候选人的相同任务电池和评分标准进行评估。技能通过三个问题进行审查:人类是否仍然表现出明显的差异,AI是否表现达到或超过中位数人类水平,以及当AI被视为默认工作工具时,该技能在招聘决策中是否仍然作为信号有用。
单一技能可以出现在十到十五种不同的角色背景中。其测量值取决于资历、行业以及任务是在监督下还是在模糊情况下执行。因此,我们通过多个视角对每项技能进行评分,并将结果与Xobin的人类验证层进行交叉检查,在那里经过培训的评审员评估模型的表面能力是否转化为实际工作构造。
基准是如何建立的
The research is built on three principles that guide all Xobin Research work.透明度: every scoring decision is documented, and the methodology will be published alongside the results. 构建效度: we only compare AI and humans on skills defined in ways that are meaningful to employers, not on abstract capabilities. 可重复性: the model versions and scoring protocols are fixed to a reference period, so future editions can show exactly how the landscape changes.
由于 AI 领域发展迅速,我们不期望单一出版物能解决这个问题。2026 版是持续基准的首次发布。结果正在最终确定,并将首先与注册读者、媒体合作伙伴和学术合作者分享。我们现在开放注册,以便提前访问、简报和方法讨论。
The human-capability half of this benchmark comes from the same measurement stack that hiring teams already use to make talent decisions on Xobin.
注册以获取报告
成为第一个获得完整结果的人。
留下您的信息,我们将通过电子邮件向您发送报告、早期摘录以及在结果发布时的新闻发布会和方法论电话的邀请。
如何引用此公告
Guruprakash Sivabalan (2026). 人类与AI技能报告2026。 Xobin Research. xobin.com/research/articles/human-vs-ai-skills-2026
