一个看起来诱人的方案
每个招聘经理都梦想一个解决方案:候选人来之前,先填一份测评,系统自动告诉你"这个人适不适合做销售/工程师/管理"。
事实上,这个市场已经做了三十年。Hogan Assessment、Caliper、SHL、Predictive Index、DiSC,全球每年有数十亿美元的招聘测评支出。中国市场上的"领英测评""智联人才"等也是同一套思路。
那它有效吗?答案是——比掷骰子好,但远没有想象的好。
效度系数的真相
工作绩效预测的元分析(最权威的是 Schmidt & Hunter, 1998)告诉我们:
| 选拔方法 | 与工作绩效的相关 r |
|---|---|
| 工作样本测试 | 0.54 |
| 一般认知能力测试(IQ) | 0.51 |
| 结构化面试 | 0.51 |
| 同事评分 | 0.49 |
| 工作知识测试 | 0.48 |
| 尽责性测评(C) | 0.31 |
| 学历 | 0.10 |
| 兴趣量表 | 0.10 |
注意两件事:
- 尽责性(C 因子)是 Big Five 中预测工作绩效最稳定的维度,r ≈ 0.31。这不算高,但稳定显著。
- MBTI 没有进这张表——因为 MBTI 在工作绩效预测上没有足够稳定的实证支持。这就是为什么严肃的工业心理学界基本不用 MBTI 做招聘决策。
一个让人吃惊的事实
Big Five 在招聘里的预测效度是 r ≈ 0.31。这意味着什么?
我们可以做一个简单换算:r=0.31 意味着测评分数解释了工作绩效约 10% 的方差,剩下 90% 是别的东西(能力、机遇、团队、培训、情境……)。
也就是说,即使你用了"科学的"人格测评,你预测对的能力提升大概只比掷骰子高一点点。
这不是测评的错,是人格作为单一变量本来就不够强。你的工作表现是能力 × 努力 × 情境 × 运气的乘积,人格只是其中一个。
真正的问题:不是工具,是用法
人格测评在招聘里的合理用法:
- 作为多种信息源之一,与面试、工作样本、参考人核实并列。
- 关注极端值,不关注微差。比如尽责性百分位 5 的候选人去做需要高度自律的财务工作,是一个真实信号。但 60 和 70 之间没意义。
- 关注"否定性使用"(screen out)而非"肯定性使用"(screen in)。即"很可能不合适"比"很可能合适"更有信息量。
- 永远不要单独基于测评做录用决定。这是大多数国家就业法律的灰色地带,也是道德底线。
而滥用的版本:
- 用 MBTI 决定团队角色("我们需要一个 ENTJ 做领导")。
- 用单一分数做拒绝("你尽责性偏低,所以我们不录")。
- 用人格匹配做晋升("你不是销售型人格,所以你不能升")。
- 强迫现有员工接受测评并公开结果——这在多地涉嫌就业歧视。
中国语境的额外问题
中国招聘市场对人格测评的使用还有一个特殊问题:很多企业用的是没有本土效度验证的英文量表翻译。
我自己见过的真实案例:
- 一家互联网公司用某美国厂商的 16 类型测评做技术岗筛选。完整中文翻译质量极差,候选人答题时频繁问"这道题在问什么"。这个数据就算用模型跑出来,输入本身就是垃圾。
- 一家咨询公司用未公开常模的本土 MBTI 山寨版,把"高 J 候选人"全标为"管理潜力"。没有任何研究支持这个映射。
- 多家公司用 16personalities 的免费版做团队测评。NERIS 模型本身没有学术发表,团队拿到结果后用 4 字母互相贴标签,几个月后留下"我不和 ISTJ 一起做项目"这种深层偏见。
给求职者的建议
如果你被要求做一份人格测评:
- 不要试图"答出"招聘官想要的答案。元分析显示故意作答(faking)虽然能拉高分数 0.5 个标准差,但会被验证题识破,且会让你进入一个"不像你"的岗位,最终离职。
- 照实答。如果你和这个岗位的人格不匹配,那这个岗位多半也不是适合你的。
- 测评不能拒绝你。如果一家公司只凭测评淘汰你,那家公司本身有问题。
给招聘经理的建议
- 优先用 Big Five 而不是 MBTI,因为前者有数据支持。
- 关注尽责性和神经质这两个维度——它们的预测效度最稳定。
- 测评只用作辅助信号。不要让它替你做决定。
- 如果你预算有限只能选一个工具,选工作样本测试,不要选人格测评。前者的预测效度是后者的两倍。
人格测评不是水晶球,它只是一面有用但有限的镜子。把它当作镜子用,它有价值。把它当作水晶球,它会让你做出昂贵的错误判断。