IQ 测试始于 1905 年,当时阿尔弗雷德·比奈与泰奥多尔·西蒙编制了第一套实用的智力测验,用来识别需要额外帮助的法国学童。1916 年刘易斯·特曼的斯坦福-比奈量表让"智商"一词广为流传,此后戴维·韦克斯勒的量表引入了现代离差智商,即今天各类测试所采用的计分方式。
智力测验拥有长达120余年的悠久历史,其间不乏争议。从最初作为识别需要教育支持的学生的一种工具,到如今在临床评估和研究中的作用,智商测验的发展历程折射出心理学、统计学以及人类对思维认知的更广泛演变。
智力测验的诞生(1905年)
1904年,法国政府委托心理学家阿尔弗雷德·比奈及其同事西奥多·西蒙开发一种方法,用于识别需要特殊教育帮助的儿童。该成果于1905年发表,即《比奈-西蒙量表》,这是世界上第一份实用的智力测试。
比奈的方法因其简单而具有革命性:他设计了一系列按难度分级的任务,并将每个孩子的表现与同龄人的典型水平进行比较。能够完成通常属于更高年龄组任务的孩子被视为能力超前;而那些在同龄人能轻松完成的任务上却显得吃力的孩子,可能需要额外的帮助。
关键在于,比纳将他的测试视为一种诊断工具,而非衡量固定、先天能力的标准。他明确警告不要利用测试分数给儿童贴标签,或宣称智力是不可改变的。
斯坦福-比奈智力量表与智商分数(1916年)
斯坦福大学心理学家刘易斯·特曼将比内-西蒙量表翻译并大幅修订,以适应美国的使用需求,于1916年创立了斯坦福-比内智力量表。特曼借鉴了德国心理学家威廉·斯特恩提出的“智商”概念,即用儿童的心理年龄除以其实际年龄,再乘以100。
这便得出了我们熟悉的智商(IQ)分数,其平均值为100。一个心理年龄为12岁、实际年龄为10岁的儿童,其智商为120。尽管这种简单的比例计算法已被更复杂的评分方法所取代,但“智商(IQ)”这一术语却一直沿用至今。
陆军测试与大规模评估(1917-1918)
第一次世界大战标志着智力测验首次得到大规模应用。心理学家罗伯特·耶克斯(Robert Yerkes)主导开发了“陆军阿尔法”(针对识字的新兵)和“陆军贝塔”(针对文盲或非英语母语的新兵)测验,约175万名士兵接受了这些测验。测验结果被用于岗位分配和军官选拔。
虽然军方的测试项目证明了大规模认知评估的可行性,但也揭示了这些测试容易受到文化和教育偏见的影响,这一问题在随后的几十年里一直困扰着该领域。
韦克斯勒量表(1939年至今)
纽约贝尔维尤医院的心理学家大卫·韦克斯勒于1939年开发了《韦克斯勒-贝尔维尤智力量表》。由于对斯坦福-比奈智力量表过分侧重语言能力的做法感到不满,韦克斯勒设计了一种能分别评估语言能力和非语言(操作)能力的测试,除了总智商分数外,还能分别给出这两方面的具体分数。
韦克斯勒还提出了智商偏差值,用一种基于个体得分在其年龄组分布中所处位置的统计方法,取代了智龄与实际年龄的比值。这种方法至今仍是标准做法,它消除了将比值公式应用于成年人时所产生的问题。
现代发展
当代智力测验的发展深受若干关键进展的影响。卡特尔-霍恩-卡罗尔(CHC)理论综合了数十年的因子分析研究成果,提供了主要的理论框架,并对《斯坦福-比奈智力测验》和《韦氏智力测验》最新版本的设计产生了深远影响。
计算机自适应测评(即根据考生表现实时调整试题难度的测评方式)既提高了测评的效率,也提升了其准确性。跨文化测评开发在一定程度上消除了某些历史偏见,尽管关于文化公平性的争论仍在继续。
包括我们IQ-EXAMS.COM在内的在线评估平台,极大地提升了认知测试的可及性。尽管与面对面进行的临床测评工具相比,在线测试存在一定局限性,但在筛查、教育以及促进公众对认知科学的理解方面,它们发挥着重要作用。