人格心理学里最稳固的那块基石,去年被人挪动了一下。没有争吵,没有宣言,只有一篇方法论论文和一个 14.9 万人的数据集。
2025 年 6 月 26 日,《European Journal of Personality》先行上线了一篇论文:Revisiting the IPIP-NEO personality hierarchy with taxonomic graph analysis,后正式收入 2026 年第 40 卷第 2 期。作者是 Andrew Samo、Luis Eduardo Garrido、Francisco J. Abad、Hudson Golino、Samuel T. McAbee 与 Alexander P. Christensen。
他们做的事听起来很技术:取一份公开的 IPIP-NEO 数据集——300 道题,149,337 人作答——用一种叫「分类图分析」(Taxonomic Graph Analysis,TGA)的网络心理测量学方法,把人格的层级结构重新算了一遍。
算出来的不是五个因素。是 28 个面(facets)→ 6 个特质(traits)→ 3 个元特质(meta-traits)的三层结构。
大五模型是怎么来的?简化地说,是自上而下:研究者先有一批描述人的形容词或既有量表,再用因素分析去看它们能收拢成几束。收拢成五束,于是有了开放性、尽责性、外倾性、宜人性、神经质。这套坐标此后统治了人格心理学四十年,理由很充分——它在跨文化样本里稳定,也确实有预测力。
TGA 反过来做。它不预设有几个因素,而是从题目与题目之间的统计关系出发,让层级结构自己长出来。论文里说,这个框架专门去处理几个长期妨碍准确还原层级结构的方法学难题:局部独立性违背、题目措辞效应、维度数判定,以及结构稳健性。
这里有一句话值得停一下:大五从来不是被发现的事实,而是一次成功的归纳。归纳可以被更好的方法改进,这不是丑闻,这是它还活着的证据。
在第二层的六个特质里,开放性、尽责性、神经质基本原样保留。变化发生在原本属于外倾性与宜人性的那片区域——它们没有以原来的形状重现,取而代之的是三个新的特质:
更上一层的元特质,除了人格研究里早已熟悉的稳定性(Stability)与可塑性(Plasticity),还多出一个此前没有的去抑制(Disinhibition)。
论文作者之一、范德堡大学皮博迪学院的 Alexander Christensen 在校方发布的说明里,措辞相当克制:
大五「一直是一个在文化上稳健、有预测力的模型」,但它「可以借助更先进的数据科学方法得到改进」。
—— Alexander P. Christensen,范德堡大学皮博迪学院
他用的词是 improved,不是 replaced。这个分寸,比结论本身更值得学。
我们不打算装作荣格类型论没有被批评过。相反,最该被认真对待的批评应该由我们自己讲清楚。
最常被引用的那篇是 Pittenger 2005 年发表在《Consulting Psychology Journal: Practice and Research》上的综述。其中汇总的复测研究显示:间隔约五周重新作答,拿到不同四字母类型的人,比例在 39% 到 76% 之间。
这个数字看上去是致命的。但它有一个几乎总被忽略的细节——不稳定几乎全部集中在首测分数接近中点的作答者身上。首测分数明确的人,一个月后大概率仍是同一型。
也就是说,问题不在于「类型不存在」,而在于把一条连续的分数线硬切成两个字母这个动作本身。切在 51 : 49 的位置,下一次自然会翻面。翻面的不是这个人,是那把刀。
这正是八维测评在做的事。四个字母只是八项认知功能排序之后的缩写;真正承载信息的,是八项分数本身。
两个同样测出 INFP 的人,一个 Ne 紧跟在 Fi 之后,另一个 Te 几乎垫底——四个字母完全相同,功能栈的形状差得很远。把八项分数完整地交给你,而不是只交给你四个字母,原因就在这里。
一个人落在中点附近,本身就是关于他的重要信息。它不该被一枚字母吞掉。
Myers-Briggs 基金会在其公开的《MBTI 伦理守则》中写得很明确:该量表不用于人员选拔;用测评结果筛选求职者,是不符合伦理的做法。
我们同意,并且把它当作产品的边界:八维测评是一种理解自己的语言,不是一把筛人的尺子。
如果真要预测一个人的工作表现,学界给出的答案从来也不是任何人格量表。Barrick 与 Mount 1991 年对 117 项研究的元分析里,尽责性与工作表现的相关约为 .22——这是所有人格维度里表现最好的一个。而在 Schmidt 与 Hunter 1998 年的经典效度排序中,工作样本(.54)、一般认知能力(.51)与结构化面试(.51)都排在人格量表前面。
有意思的是,连这份排序也已经被修订过:Roth、Bobko 与 McFarland 在 2005 年重做工作样本的元分析,把 .54 下修到了 .33。
把上面这些放在一起看,会看到一件事的轮廓:修订一个人格模型的门槛是什么。
是一份 149,337 人的公开数据集。是一种能被别人拿去重跑的方法。是一次同行评议。是作者本人在结论里保持的那种分寸——improved,不是 replaced。
这就是我们对「经典」这个词的理解。经典不是不许动,而是动它需要这样的成本。
把 16 型改成 64 型,不需要任何这样的成本。它不需要一个数据集,不需要一种方法,不需要一次同行评议。它只需要一个更热闹的说法。
所以这里仍然是十六型。它不是因为古老而正确——它是因为一百年里没有人用足够的证据把它换掉,而我们不愿意成为第一个用不足够的证据去换掉它的人。
荣格的八种功能、十六种组合,经受住了修订与验证。真正的个体差异不在类型的数量里,在八项功能的分数里。这句话我们写在首页上,今天不妨说说它背后的道理。
八项认知功能的分数、功能栈的真实顺序,以及你落在中点附近还是分得很开——这些只有测过才知道。标准版 34 题约 8 分钟,专业版 72 题约 15 分钟,免费,无需注册。
开始免费测试 →