IQテストは、標準化された推論・記憶・言語・空間の課題での成績を、同年齢層の大規模な標準化サンプルと比較して認知能力を測定します。素点は平均100・標準偏差15のベルカーブ尺度に変換されるため、スコア115なら人口の約84%を上回ることになります。
IQテストは、現存する心理測定ツールの中でも最も信頼性の高いものの一つであり、その信頼性と予測的妥当性は1世紀以上にわたる研究によって裏付けられています。しかし、その仕組みは一体どのようなものなのでしょうか?知能検査の科学的根拠を理解することで、結果をより正確に解釈し、こうした検査の長所と限界の両方を正しく把握することができるようになります。
基礎:心理測定理論
現代のIQテストは、心理的特性を測定する科学である心理測定学に基づいて構築されています。心理測定学の根底にある考え方は、知能は直接観察することはできないものの、綿密に設計された課題への取り組みぶりから確実に推察できるというものです。温度計が熱を直接観察するのではなく、水銀の膨張によって温度を測定するのと同様に、IQテストもまた、観察可能な問題解決行動を通じて知能を測定するのです。
この統計的基礎は、1900年代初頭にチャールズ・スピアマンによって開発された因子分析という手法に基づいている。スピアマンは、ある種の認知課題で優れた成績を収めた人々が、他の課題でも同様に優れた成績を収める傾向にあることを観察し、これを「g」と名付けた知能の一般因子の存在を示唆した。現代のテストでは、この一般因子と特定の認知能力の両方が測定されている。
項目反応理論
現代のIQテストでは、項目反応理論(IRT)を用いて問題の校正が行われています。各項目は、難易度(正解する人の割合)、識別力(能力の高い人と低い人をどれだけ正確に区別できるか)、および推測パラメータ(偶然に正解する確率)によって特徴づけられます。
つまり、すべての問題が同じように得点に反映されるわけではありません。事実上誰もが正解できる問題では、受験者の能力レベルに関する情報はほとんど得られませんが、自分の実力の限界に近い問題であれば、最大限の情報が得られます。よく設計された試験には、幅広い難易度の問題が含まれており、あらゆる能力レベルの受験者を正確に評価できるようになっています。
標準化と規範化
IQスコアが意味を持つのは、それが標準化サンプル、すなわち基準値を確立するために用いられる、人口統計学的に代表的な大規模な集団と比較されるからに他なりません。テストが開発されると、何千人もの人々がそれを受け、その結果がスコアの解釈の基礎となります。
粗得点(正解した問題の数)は、標準化データを用いて標準得点に変換されます。この変換により、100点が母集団の平均を表し、15点が1標準偏差に相当するようになります。このプロセスによって、個人間や異なるテスト間の有意義な比較が可能になります。
IQテストが実際に測定しているのは何か
適切に設計されたIQテストは、通常、研究によって知能の基礎的な構成要素であることが示されているいくつかの認知領域を測定します。これには一般的に、言語理解(言語の理解と使用)、知覚的推論(視覚情報の分析や空間問題の解決)、作業記憶(頭の中で情報を保持・操作すること)、処理速度(単純な認知課題を迅速かつ正確に遂行すること)などが含まれます。
各領域は、複数の問題形式を用いて評価されます。言語理解能力は、語彙、類推、読解問題などで測定されることがあります。知覚的推論能力の評価には、マトリックス問題、図形完成問題、空間回転課題などがよく用いられます。作業記憶は数字記憶課題や算数問題で評価され、処理速度は記号探索課題や符号化課題を用いて測定されます。
信頼性と妥当性
心理検査の質を決定づけるのは、2つの重要な概念である。信頼性とは一貫性を指す。つまり、異なる時期や状況で実施した場合でも、同様の結果が得られるかどうかということだ。WAISやスタンフォード・ビネーのような主要なIQ検査は、0.95を超える信頼性係数を示しており、極めて一貫性が高いことを意味している。
妥当性とは正確性を指します。つまり、その検査は、測定すると主張しているものを実際に測定できているのでしょうか。IQ検査は学業成績に対して高い予測的妥当性を示しており、IQと学業成績の間には約0.5の相関関係が見られます。また、職業上の成果についても予測が可能ですが、その関係はより複雑であり、他の多くの要因によって影響を受けます。
オンラインIQテストと対面式IQテスト
臨床用IQ検査は、訓練を受けた心理士が1対1で実施するため、受験者の解答の仕方、不安の度合い、および検査への取り組みぶりを観察することができます。オンライン検査では、このような管理された環境を再現することができず、その結果、測定誤差が生じやすくなります。
しかし、確立された心理測定の原則に基づいて適切に設計されたオンライン評価は、臨床結果と有意な相関を示す信頼性の高い推定値を提供することができる。これらは、スクリーニングツールとして、また経時的な認知機能の変化を追跡するため、さらには、そうでなければ正式な検査を受ける機会がない人々に対して、手軽に利用できる認知機能評価を提供する手段として、特に有用である。