一个让无数人混淆的指标
很多测评网站会在介绍页底端写一行:
「我们的量表 Cronbach's α 系数为 0.89,达到心理测量学优秀标准。」
听起来很专业。但如果你问他们:"α 在量什么?" 大概率你会得到一个模糊的回答:"量我们的题目好不好啊。"
事实上,Cronbach's α 量的不是「题目好不好」,更不是「测评准不准」。它量的是一组题目之间的内部一致性。
α 是什么:一个朴素的概念
想象你有 10 道题量「外倾性」。如果这 10 道题确实都在量同一个东西,那么——
- 一个外倾性高的人,应该在大部分题上得高分;
- 一个外倾性低的人,应该在大部分题上得低分;
- 题目之间应该高度相关。
Cronbach's α(由 Lee J. Cronbach 在 1951 年提出)本质上就是把这 10 道题之间所有两两相关性的平均,再做一个修正放大。α 越接近 1,说明题目之间相关越强,"它们在测同一件事"。
通用经验阈值:
- α < 0.5 → 不可接受
- 0.5 ~ 0.7 → 勉强可用
- 0.7 ~ 0.9 → 良好(学术发表门槛)
- > 0.9 → 优秀,但可能题目冗余
α 高 ≠ 测评准
这是最常被误解的一点。α 量的是「一致性」(reliability),不是「准确性」(validity)。
举一个极端例子:我编一份 10 道题的量表,每道题都问「你最近一个月感到快乐吗?」只是用 10 种不同说法。受试者读完就笑了——这些题在问同一个东西。
这份量表的 α 几乎肯定 > 0.95。但它什么人格维度都没测,它只测了「你最近一个月快不快乐」。
也就是说:
α 高,只说明你的题目们协同动作;不说明它们在测对的东西。
要回答「测得对不对」,需要的是效度(Validity)研究:和外部行为指标对照、和已有量表比较、做因素分析、做实证预测。
α 在 MBTI 上的尴尬
经典 MBTI 量表的 α 系数报告值通常如下(来自 CPP 出版的 MBTI Form M 手册):
- E-I:约 .91
- S-N:约 .92
- T-F:约 .91
- J-P:约 .92
数字非常漂亮。但信度高不等于建构合理。MBTI 的真正问题不在于「题目之间一致」,而在于:
- 它把连续分数强行二分(把 51 vs. 49 算成两个类型)。
- 它的重测一致性(test-retest reliability,相隔几周再做一次)显著低于其内部一致性。多项独立研究(Howes & Carskadon, 1979;Pittenger, 1993)显示,约 40-50% 的人在 5 周内换了至少一个字母。
这是关键:
内部 α 衡量「同一时刻题目们是否团结」,重测信度衡量「不同时间分数是否稳定」。
>
MBTI 在前者拿满分,在后者经常翻车。
一个判断量表质量的清单
下次你看一个心理测评工具的介绍页,可以这样审视:
- 它有没有公开报告 α 系数?(多数商业产品避而不谈)
- 它有没有公开报告 重测信度?(这才是衡量「分数稳定吗」的指标)
- 它有没有报告因素分析结果?因子载荷是否清晰?
- 它有没有报告效标效度?比如:高分组在某行为上的表现是否真的不同?
- 它的样本来自哪里?多少人?性别年龄分布?
如果一个测评只敢报 α 不敢报其它,多半在回避问题。如果一个测评什么都不敢报——你大概知道答案了。
给读者一个实操建议
下次做完测评,回到结果页底端,找一找「方法说明」或「关于本量表」。
- 如果你看到 α、重测信度、效度系数 三个都有公开 → 可信度较高。
- 如果只看到 α → 这是入门门槛。
- 如果一个都没有 → 把它当作有趣的自我反思,但不要据此做重要决定。
MindNest 的 BFI-10 中文版页面会公开列出这三个数字(即便它们没有商业 MBTI 那么"漂亮")——这是「学术严谨」和「商业话术」最容易拉开差距的地方。