科学的根拠
一世紀にわたる研究の系譜
知能を科学的に測ろうとする試みは、1904年にスピアマンが一般知能因子gを統計的に突き止めたところから始まりました。1940年代にはキャッテルが知能を流動性知能と結晶性知能に分け、1993年にはキャロルが数百のデータセットを再分析して三層階層モデルを打ち立てました。この流れを統合したモデルがCHCです。今日の主要な認知能力検査が共通の土台とする標準分類体系であり、心理測定学が一世紀をかけてたどり着いた合意にもっとも近い枠組みです。
MOSAIC-48が用いる課題形式も、同じ検証の系譜の上にあります。数字や順序を覚える課題は、19世紀末から記憶研究の標準的な道具でした。行列推理は1930年代以降、文化的な影響を抑えた推理測定の代表的な形式として定着し、色-単語干渉課題(1935)は注意制御研究でもっとも長く再現されてきたパラダイムの一つです。ただしMOSAIC-48は、元の課題のように反応時間で干渉量を測るのではなく、指示された次元(インクの色か文字の意味か)を選べたかどうか、つまり正答率で採点します。系譜は同じでも、測り方は異なります。MOSAIC-48は、こうして数十年、長いものでは百年以上検証されてきた理論と課題形式を土台に設計されています。
この理論も課題形式も、過去の遺産にとどまってはいません。2020年代に入っても、CHCの広範能力構造を大規模標本で検証し直す研究が続いています。公開項目バンクの妥当性や、非監督オンライン検査のデータ品質もあわせて検討されており、注意制御をどう測るべきかは今まさに整理し直されているところです。今も検証は続いています。
測定モデル
その系譜を受け継ぐMOSAIC-48は、認知能力を単一の得点に還元せず、階層的認知能力理論(CHCモデル)が示す広範能力の水準で8つの領域を測ります。流動性推理・空間認知・数量的推理・ワーキングメモリ・処理速度は、CHCの広範能力とおおむね対応します。言語推理は、もう少し慎重に読む必要があります。語彙力や一般知識(結晶性知能Gc)を問うのではなく、命題論理と論証分析、つまり言語を介した推理を測るため、Gcにそのまま対応するとは言えません。結晶性知能にあたる語彙・一般知識の設問は項目バンクにそもそも含まれておらず、その分、8つの領域でCHCの広範能力すべてを覆えているわけではありません。学習効率と注意制御は、少し事情が違います。近年の研究では、学習と制御にまたがる複合能力の中心性が報告されています。それを踏まえて、この2つの領域を加えました。
大規模なオンライン研究が後押ししているのは、個人差を一般因子ひとつで説明するモデルよりも、推理・短期記憶・言語能力といった複数の構成要素に分解するモデルのほうです。ですから結果も、複合認知指数ひとつで終わらせず、8軸のプロファイルとあわせてお見せします。
設問設計
8つの領域の設問は、すべて新しく作りました。公開認知検査研究(ICAR)の設問類型、Berlin Numeracy Testの確率・頻度形式、認知的熟慮検査(CRT)の直観-検証構造を参考にしていますが、既存の設問をそのまま借りることはせず、属性の組み合わせ規則から生成しています。
図形設問は、形・数・塗り・回転・記号の組み合わせと、その変化の規則で定義します。誤答はランダムに選んでいません。規則を1つだけ当てはめる、回転の向きを逆に読む、数の変化を見落とす、といった予測のつく推論の誤りから作ります。誤答にはそれぞれエラーコードを付け、設問をまたぐ共通の分類にまとめてあるため、同じ誤りが複数の設問で繰り返されると結果の反応傾向として現れます。
どの能力を測る設問なのかが先に見えてしまわないよう、推理・言語・数理の設問は混ぜて出題します。進め方そのものが異なるワーキングメモリ(提示後に消去)・処理速度(制限時間あり)・学習効率(学習し、時間をおいて再び使う)の課題は、別のセッションにまとめました。
得点算出
回答を得点に変えるとき、複雑なブラックボックス的な重み付けは持ち込みません。代わりに、誰でも追って検証できる計算を使います。領域の素点は難易度加重の正答率(易1.0、中1.5、難2.0)で求め、内部基準分布を仮定してz得点に変換したうえで、100±15の標準得点の形で表示します。このときzは±2.0で打ち切られるため、領域得点も複合指数も70から130の範囲でのみ表示され、パーセンタイルも上位2%から98%の間にしか現れません。
複合認知指数は、8領域のz得点の平均に再標準化係数1.25を掛けた一般因子の近似値です。複数の領域を平均すると、その分だけ分散が小さくなります。領域間の相関をr≈0.6と仮定したとき、その縮小分を戻す値が1.25です。相関係数を信頼性で補正する心理測定学の減衰補正とは、別の計算です。領域間のばらつきが大きいほど推定の幅は広くとり、パーセンタイルは標準正規分布を仮定して計算します。
ワーキングメモリの設問のうち、提示中にタブが隠れて表示が途切れたものは採点から除きます。刺激を見る機会そのものがなかったためで、採点の分母と分子だけでなく、結果に表示される正答率と下位能力の集計からも同じように除きます。ただし除く設問数には上限があり、それを超えて途切れた場合はすべて通常どおり採点します。いずれの場合も、表示が途切れた設問があったときは結果に信頼度の注意を表示します。
回答時間を得点に直接反映する領域は、処理速度の一つだけです。正確度のz得点に速度のz得点の0.3倍を加えて求め、速度は設問の制限時間に対して実際にかかった時間の比率で測ります。その基準分布(制限時間の60%を中央値とした値)はパイロット以前の仮定値であり、速度成分が得点を動かす幅は上下9点を超えません。速度が基準どおりであれば、正確度だけで採点した値と同じになります。制限時間を使い切っても答えられなかった設問は、正確度では誤答として、速度では制限時間をすべて使ったものとして数えます。
時間の記録を信頼しにくい設問は、保守的に数えます。タブが0.5秒以下しか隠れていない設問は記録された時間をそのまま使い、長く隠れていた設問や中断後に再開した設問は、標本から外すのではなく制限時間をすべて使ったものとして数えます。標本を壊すほうが有利になることがないようにするためです。そう数えた設問が処理速度の設問の半分を超えた場合は、速度成分はそのまま反映したうえで結果に信頼度の注意を表示します。ほかの7領域では、回答時間は得点に入りません。
補助指標は正確性・認知的効率性・処理安定性の3つで、そのうち回答時間を使うのは後ろの2つです。正確性は、中核となる5領域(流動性推理・空間認知・数量的推理・言語推理・ワーキングメモリ)の正誤だけから計算します。
領域ごとの得点には、その得点がどれだけ揺れる値かを設問数と難易度構成から算出して添えています。領域間の差がその測定誤差の範囲内にとどまる場合は、プロファイルのタイプや強みの順序を断定せず、2つの領域を並べて強みの候補として表示します。
基準サンプルが十分に集まったうえで、項目反応理論(2パラメータIRT)により設問の難易度と識別力を推定し、実際の分布に基づく標準化得点へ移す予定です。
同じ8領域を領域あたり12問でより細かく測る96問のフォームも用意しています。ただしこのフォームの基準はまだパイロット前で、48問フォームの暫定基準をそのまま借りており、パイロット標本が集まり次第、差し替えます。
信頼性と限界
一つだけ、はっきりさせておきます。本検査は研究文献の測定原理をもとに独自開発した検査であり、標準化・基準化を経た公認検査ではありません。得点も内部基準分布に基づく推定値です。医療的・臨床的な診断や、教育・採用などの選抜を目的とした使用はできません。
非監督のオンライン環境という制約もあります。端末の性能や画面の大きさ、検査を受ける場所の状況が結果に影響することがあります。色の知覚を必要とする一部の注意制御の設問は、色覚特性のある方には不利になることがあり、とくに赤緑の色覚特性がある場合は正答を見分けにくい設問があります。検査中は、回答時間と画面が隠れていたかどうかもあわせて記録します。異常に速い回答、複数回にわたる中断と再開、設問の表示中に長く画面を離れた形跡、制限時間のある処理速度の設問をほぼすべて時間内に終えられなかった場合、表示が途切れたワーキングメモリの設問が一つでもあった場合、処理速度の設問の半分を超えて時間の記録を信頼できず制限時間をすべて使ったものとして数えた場合、即時再生と遅延再生の間隔が30分を超えた場合には、結果に信頼度の注意を表示します。
参考文献
- Zorowitz, S., Chierchia, G., Blakemore, S.-J., & Daw, N. D. (2024). An item response theory analysis of the matrix reasoning item bank (MaRs-IB). Behavior Research Methods, 56(3), 1104–1122.
- Uittenhove, K., Jeanneret, S., & Vergauwe, E. (2023). From lab-testing to web-testing in cognitive research: Who you test is more important than how you test. Journal of Cognition, 6(1), 13.
- McGrew, K. S., Schneider, W. J., Decker, S. L., & Bulut, O. (2023). A psychometric network analysis of CHC intelligence measures: Implications for research, theory, and interpretation of broad CHC scores "beyond g". Journal of Intelligence, 11(1), 19.
- Burgoyne, A. P., Tsukahara, J. S., Mashburn, C. A., Pak, R., & Engle, R. W. (2023). Nature and measurement of attention control. Journal of Experimental Psychology: General, 152(8), 2369–2402.
- Dworak, E. M., Revelle, W., Doebler, P., & Condon, D. M. (2021). Using the International Cognitive Ability Resource as an open source tool to explore individual differences in cognitive ability. Personality and Individual Differences, 169, 109906.
- Schneider, W. J., & McGrew, K. S. (2018). The Cattell–Horn–Carroll theory of cognitive abilities. In D. P. Flanagan & E. M. McDonough (Eds.), Contemporary intellectual assessment (4th ed.). Guilford Press.
- Condon, D. M., & Revelle, W. (2014). The International Cognitive Ability Resource: Measurement reliability and validity. Intelligence, 43, 52–64.
- Hampshire, A., Highfield, R. R., Parkin, B. L., & Owen, A. M. (2012). Fractionating human intelligence. Neuron, 76(6), 1225–1237.
- Cokely, E. T., Galesic, M., Schulz, E., Ghazal, S., & Garcia-Retamero, R. (2012). Measuring risk literacy: The Berlin Numeracy Test. Judgment and Decision Making, 7(1), 25–47.
- Frederick, S. (2005). Cognitive reflection and decision making. Journal of Economic Perspectives, 19(4), 25–42.
- Carroll, J. B. (1993). Human cognitive abilities: A survey of factor-analytic studies. Cambridge University Press.
- Stroop, J. R. (1935). Studies of interference in serial verbal reactions. Journal of Experimental Psychology, 18(6), 643–662.
- Spearman, C. (1904). "General intelligence," objectively determined and measured. American Journal of Psychology, 15(2), 201–292.