心理指南认知·注意力
IQ分数分布与百分位数:如何解读平均分为100、标准差为15的量表分数
IQ 130是前百分之几?正态分布中平均分100和标准差15意味着什么,各分数段的百分位数表,在线IQ测试能告诉你和不能告诉你的事,弗林效应,以及Soundary综合认知功能测评是如何计算分数的。
Soundary · 6 分钟阅读 · 更新于
IQ分数是一种标准分数,旨在符合平均分为100、标准差为15的正态分布。因此,100分代表你所在年龄段的中间水平(第50百分位数),115分大约处于前16%,而130分大约处于前2%。本指南将介绍如何解读这一分布,在线测试能告诉你和不能告诉你的事,以及Soundary分数的含义。
为什么IQ的平均分是100,标准差是15
原始分数(即你答对的题目数量)本身没有任何意义。测试首先会在你所在年龄段的代表性样本(常模群体)中进行,然后将你在该分布中的位置转换为正态曲线上的标准分数。现代测试使用这种离差智商,而不是早期斯坦福-比奈智力量表中智力年龄与生理年龄的比例,而韦克斯勒量表则确立了平均分100、标准差15的惯例。
在正态曲线上,大约68%的人处于平均分的一个标准差以内,大约95%的人处于两个标准差以内。用IQ来说,大约三分之二的人得分在85到115之间,每20人中约有19人得分在70到130之间。因此,130分及以上或70分以下的分数是罕见的,各占总人口的2%左右。
各分数段的百分位数
下表将韦克斯勒类测试中常用的描述性分类与正态分布下的近似百分位数进行了对应。百分位数是指得分低于你的人数比例。这些数字不会与测试手册精确到小数点,因此请将其作为粗略的参考。
| IQ区间 | 常见分类 | 近似百分位数 |
|---|---|---|
| 130及以上 | 极优秀 | 约98及以上(前2%) |
| 120至129 | 优秀 | 约91至97 |
| 110至119 | 中上 | 约75至90 |
| 90至109 | 中等 | 约25至73 |
| 80至89 | 中下 | 约9至23 |
| 70至79 | 边缘 | 约2至8 |
| 69及以下 | 极低 | 约2及以下 |
有两点值得记住。首先,同样是15分的差距,在人群密集的曲线中间会使百分位数发生很大变化,而在两端则变化很小。其次,任何标准化测试都存在测量标准误差,因此你的真实能力是一个区间,而不是一个点。即使是精心设计的完整测试,其95%置信区间也大约在正负5分左右,这意味着在统计学上很难区分112分和117分。
在线IQ测试能告诉你和不能告诉你的事
在线测试最大的局限性在于常模。只有当测试在具有代表性的样本上进行标准化时,平均分100才有意义。但在网络上主动寻找测试的人在年龄、教育程度和动机上往往存在偏差;题目是公开的;而且时间和环境也不受控制。因此,大多数在线IQ分数更接近于你在该网站用户中的位置,而不是你在总人口中的IQ。
这并不意味着它毫无用处。像瑞文推理测验这样的图形推理题目很少依赖语言,在不同文化间的比较相对公平,并且与流体智力高度相关。由这类题目组成的测试,如果在相同条件下重复进行,非常适合用来观察你的强项和弱项模式,以及你随状态变化的波动情况。然而,对于学校、工作或医疗保健方面的决策,智力测试必须由受过训练的测试员在标准化程序下进行个别施测。
弗林效应:常模会过时
在整个二十世纪,许多国家的智力测试原始分数稳步上升,大约每十年提高2到3分。这就是弗林效应(Flynn, 1987;Trahan及其同事, 2014)。营养、教育以及对抽象思维日益熟悉等被认为是可能的原因,但目前尚无定论。其实际意义在于,过时的常模会使分数虚高:如果用二十年前的常模来评分,同一个人的得分可能会比应有水平高出几分,这就是为什么标准化测试需要定期重新制定常模的原因。
Soundary综合认知功能测评是如何设计和评分的
在韩语版中,该测评包含五个部分:言语推理(12题,5分钟)、数字推理(12题,7分钟)、3×3矩阵推理(10题,7分钟)、顺背和倒背数字(工作记忆)以及60秒符号比较(处理速度)。其他语言版本去掉了言语部分,保留了四个部分。综合分数是0到100分制上的加权平均值:在韩语版中,言语、数字和矩阵各占25%,记忆和速度各占12.5%;在其他版本中,数字和矩阵各占三分之一,记忆和速度各占六分之一。
结果屏幕上的IQ换算分数是一个参考值,它将这个综合分数映射到平均分为100、标准差为15的量表上。由于标准化样本仍在收集当中,目前使用的是临时常模,并设计为在测试积累了足够的结果后自动切换到真实的用户分布。请将其视为用熟悉的量表表达的你在本测试中相对位置的估计值,而不是等同于韦克斯勒等标准化测试的IQ值。
为什么同一个人会得到不同的分数
即使在标准化测试中,重测分数也会有几分的波动。测量误差、你的状态(睡眠、疲劳、焦虑)、因熟悉题目格式而产生的练习效应,以及时间压力下不同的策略,这些因素交织在一起。在线测试还增加了设备和环境变量,因此波动更大。这就是为什么在相似条件下多次测试的平均值,加上你在各个领域的表现概况,比将单次分数认定为你的IQ要有用得多。
智力的相对排名在成年期相当稳定,但处理速度和工作记忆对你当天的状态很敏感。如果你的综合得分下降了几分,合理的初步猜测是速度或记忆部分出现了波动,而不是你的智力下降了。将其与多元智能问卷(一项包含24个条目、评估八种智能倾向的自评量表)结合使用,还可以让你将测量出的能力与你的偏好进行比较。
简而言之,IQ是你在常模群体中的相对位置,以平均分为100、标准差为15的量表来表示,其准确性完全取决于背后的常模和测试条件。在了解其局限性的前提下,在线测评是查看你的能力剖面和趋势的好工具;当需要确定性判断时,标准化的个体测验才是答案。
常见问题
IQ 130处于什么百分位?
在平均分为100、标准差为15的量表上,130比平均分高出两个标准差,在正态分布下大约是前2%(约第98百分位)。这种计算仅适用于在具有代表性的常模群体上标准化的测验得分。
我可以完全相信在线IQ测试的结果吗?
不能将其视为你在总体人群中的IQ:在线测试没有在具有代表性的样本上建立常模,且测试环境不受控制。最好的使用方法是在相同条件下重复进行相同的测试,以查看你在各个领域的能力剖面和随时间变化的趋势。
Soundary的IQ换算分数和韦氏IQ一样吗?
不一样。它是一个参考值,将Soundary的综合得分映射到平均分为100、标准差为15的量表上,目前使用临时常模进行换算。请勿将其等同于标准化测验的IQ。
我第二次测试的分数提高了。是我变聪明了吗?
大多数情况下,这是由于熟悉题目格式带来的练习效应,加上状态的差异。要称之为真正的改变,多次重复测试的平均分需要持续变动,即便如此,在线测试也无法得出确切结论。
相关测评
参考文献
- Wechsler, D. (2008). Wechsler Adult Intelligence Scale–Fourth Edition (WAIS-IV): Administration and scoring manual. Pearson.
- Flynn, J. R. (1987). Massive IQ gains in 14 nations: What IQ tests really measure. Psychological Bulletin, 101(2), 171–191.
- Trahan, L. H., Stuebing, K. K., Fletcher, J. M., & Hiscock, M. (2014). The Flynn effect: A meta-analysis. Psychological Bulletin, 140(5), 1332–1360.
- Raven, J. (2000). The Raven's Progressive Matrices: Change and stability over culture and time. Cognitive Psychology, 41(1), 1–48.
- Deary, I. J. (2012). Intelligence. Annual Review of Psychology, 63, 453–482.
本文为 Soundary 依据公开学术文献与诊断标准撰写的一般信息,不构成对个人的医学诊断或治疗建议。若对症状有顾虑,请咨询精神科专业医师。
Soundary