死んだサケの脳が「光った」。fMRIの統計の落とし穴を暴いた伝説の実験

死んだサケの脳が「光った」。fMRIの統計の落とし穴を暴いた伝説の実験

読む前に予想してみよう!

死んだサケのfMRI実験で見つかった「脳活動」は、正しく統計を補正すると消えた

研究カード(どんな研究?)
対象
死んだタイセイヨウサケ/健康な人の安静時fMRIデータ
規模
1匹/499人分・約300万回の模擬解析
研究の種類
方法論のデモンストレーション+大規模シミュレーション
確かさ
★★★★☆
3秒でわかる

死んだサケをfMRIにかけ、人の写真を「見せた」ら脳に“活動”が出た。犯人は統計の多重比較。7年後には脳画像ソフト全体の検証へと話が広がった。

ひとことで言うとたくさんくじを引けば、偶然の当たりも出る。脳画像も同じだった!

論文スペック表研究デザイン・規模・結果・その後(玄人向け)
研究デザイン
方法論のデモンストレーション(学会ポスター)と、安静時データを使った大規模シミュレーション
データ
死んだタイセイヨウサケ1匹(8064ボクセル)/健康な人の安静時fMRI 499人分・約300万回の模擬解析
解析ソフト
SPM2(サケ)/SPM・FSL・AFNI(クラスターの失敗)
主な指標
補正なし p < 0.001 で「有意」となるボクセル数/ソフトごとの偽陽性率
主な結果
サケは16ボクセルが有意、FDR・FWE補正でゼロ。クラスター推定は条件しだいで偽陽性率が最大約70%
その後の追試・再分析
コックスら(2017)が規模の誇張を指摘。エクルンドら(2019)は1群の並べ替え検定について、両側検定とICA-FIXの組み合わせで偽陽性率が名目どおりになると報告
もくじ
  1. 問い:なぜ、わざわざ死んだ魚を?
  2. 方法:手順は「本物」、被験者だけがありえない
  3. 結果:8064個中16個が「有意」、補正したらゼロ
  4. 7年後の続き:「クラスターの失敗」
  5. 研究史の中の位置づけ
  6. まとめ

2009年6月、サンフランシスコで開かれた脳画像の国際学会(ヒト脳機能マッピング学会)に、一枚の奇妙なポスターが貼られました。

被験者はタイセイヨウサケ1匹。体長およそ18インチ(約46cm)、体重3.8ポンド(約1.7kg)。方法の欄には、さらりとこう書かれていました。「スキャンの時点で生きていなかった」。

研究チームはこのサケをfMRI装置に入れました。そして、社会的な場面にいる人の写真(それぞれ特定の感情が読み取れるもの)を次々に「見せ」、写真の人物がどんな気持ちかを「判断してもらった」のです。標準的な手順でデータを解析すると――サケの脳のあたりに、活動を示す点が浮かび上がったのです。

もちろん、死んだ魚が他人の気持ちを想像したわけではありません。この“実験”の本当の主役は、サケではなく統計でした。

01問い:なぜ、わざわざ死んだ魚を?

ポスターの著者は、カリフォルニア大学サンタバーバラ校のベネット(Bennett)さん、ミラー(Miller)さん、ヴァッサー大学のベアード(Baird)さん、ダートマス大学のウォルフォード(Wolford)さん。

彼らが言いたかったのは、魚のことではありません。ポスターの冒頭には、典型的なfMRI画像には約13万個のボクセルがあり、補正しなければ偽陽性はほぼ確実に出るのに、その補正がしばしば省かれている、という問題意識が書かれています。

口で「補正しないと危ないよ」と言っても、なかなか響かない。そこで、絶対に脳活動があるはずのない被験者で本物の実験をやってみせる、という作戦をとったのです。

ベネットさんらは同じ2009年、学術誌『Social Cognitive and Affective Neuroscience』に、きちんとした論考も発表しています。そこでは、FWEやFDRといった「原理的な」補正法はすでに確立しているのに、ボクセル1個ずつの偽陽性の確率だけを抑え、脳全体での偽陽性の量はわからない不適切な方法で報告される論文が、少数ながら毎月出続けていると指摘しました。

02方法:手順は「本物」、被験者だけがありえない

サケ実験の手順は、ふつうの人間の実験とほぼ同じでした。

この「p < 0.001・小さなクラスターサイズ」という基準は、当時も一部の論文で使われていた設定で、ポスターは考察で、これでは多重比較への対策として効果がないと批判しています。つまりサケは、よくある解析の“ものさし”そのものを試すための標本だったのです。

マスを何千個も調べれば、偶然「光る」マスはどこかに出てくる
マスを何千個も調べれば、偶然「光る」マスはどこかに出てくる

03結果:8064個中16個が「有意」、補正したらゼロ

解析の結果、サケの脳の位置に小さな活動クラスターが見つかりました。調べた範囲は8064ボクセル。そのうち16ボクセルが基準を超えたのです。

ここで、ちょっとした計算をしてみましょう。もしボクセルどうしが独立なら、p < 0.001 の基準で8064回検定すると、偶然だけでも8個前後は「有意」になると見込めます。実際にはさらに、平滑化のせいで隣り合うボクセルの値が似てくるため、偶然の当たりがかたまり(クラスター)として現れやすい。「3ボクセル以上」という条件は、思ったほど強いフィルターにはならないのです。

そして決定打。同じデータにFDR補正とFWE補正をかけると、活動しているボクセルは一つも残りませんでした。基準を p = 0.25 まで大きくゆるめても、ゼロのままでした。

サケは考えていなかった。考えていないことを、正しい統計はちゃんと示せた。この実験のメッセージは「fMRIはインチキだ」ではなく、「補正をすれば、ノイズはノイズとして消える」だったことに注意が必要です。

047年後の続き:「クラスターの失敗」

サケのポスターが投げかけたのは、主に「補正をサボるな」という問題でした。ところが2016年、補正していたはずの研究にも問題が潜んでいる可能性を示す論文が出ます。

スウェーデン・リンショーピン大学のエクルンド(Eklund)さんとクヌートソン(Knutsson)さん、イギリス・ウォーリック大学のニコルズ(Nichols)さんの論文「Cluster failure(クラスターの失敗)」です。

彼らは、課題をしていない健康な人499人分の安静時fMRIデータを使いました。安静時のデータに、ありもしない「課題の時間割」を当てはめて群解析をすれば、本当の効果はゼロのはず。これを組み合わせを変えて約300万回くり返し、代表的なソフト(SPM、FSL、AFNI)が何回「有意」と言ってしまうかを数えたのです。

理屈の上では、偽陽性は5%に収まるはず。ところが、

  • ボクセル単位の補正は、むしろ慎重すぎる(偽陽性が5%より少ない)側だった
  • クラスター単位の推定では、条件によって偽陽性率が最大で約70%にまで膨らんだ
  • 主な原因は、ノイズの「空間的なつながり方」(空間自己相関)がソフトの想定(ガウス関数の形)とずれていたこと
  • 一方、データを並べ替えて基準を作る並べ替え(パーミュテーション)検定は、ほぼ5%どおりだった(ただし本文では、1群の検定で偽陽性率がずれる例外も報告されている)

と報告しました。さらに、AFNIのプログラム(3dClustSim)に15年間残っていたバグも指摘されました。

この論文は、脳画像の分野の外でも大きな話題になります。実は論文本体の要点の欄に「約4万件のfMRI研究の妥当性に疑問を投げかける」という一文がありました。著者らはのちに訂正を出し、この部分を「一定数のfMRI研究」「弱く有意な結果の解釈」に影響しうる、という表現に改めています。訂正では、論文の結論そのものは変わらないとされています。

ここから玄人ゾーン

ここまで読めば要点はつかめています。この先は反論・方法論・未解決の問いまで踏み込みます。

05研究史の中の位置づけ

死んだサケのポスターは、2012年にイグ・ノーベル賞(神経科学賞)を受賞しました。授賞理由は「複雑な装置と単純な統計を使えば、脳研究者はどこにでも――死んだサケの中にさえ――意味のある脳活動を見いだせることを示した」というものです。けれども、その価値は笑いだけではありません。

一つめは、「ありえない被験者で手法を試す」という発想です。正解がゼロだと分かっている対象に手法をかければ、手法そのものの“くせ”が見える。エクルンドさんらが安静時データを「答えがゼロの実験」として使ったのは、同じ考え方をはるかに大規模にしたものだといえます。

二つめは、再現性をめぐる議論の先がけになったことです。2010年代には、心理学や神経科学で「論文の結果が追試で再現されない」問題が大きく取り上げられました。サケとクラスターの論争は、その中で解析ソフトの初期設定や慣習的な基準まで疑う流れの一部になりました。エクルンドさんらは2019年の続報で、データ共有と「答えがゼロの現実的なデータ」での手法検証の大切さをあらためて強調しています。AFNIにも並べ替えにもとづく群解析が加わり、主要な3つのソフトのいずれでも並べ替え検定が使えるようになりました(SPMでは拡張ツールのSnPMを使います)ようになりました。

06まとめ

死んだサケの脳が「光った」のは、魚が考えたからではなく、数千回のくじ引きで偶然の当たりが出たからでした。正しく補正すれば、その当たりはきちんと消えた。

そして7年後、「補正したつもり」の方法にも前提のずれがありうることが示され、脳画像研究は自分たちの道具をあらためて点検することになりました。脳の画像に色がついていたら、「何回くじを引いて、どう補正したのか」を一度考えてみてください。

この研究を英語で読もう原田英語の English CornerA dead Atlantic salmon, about 46 centimeters long, became famous in brain science. 音声 4択クイズ9問A2・B1・B2タップして開く

原田英語の English Corner

この研究を英語で読もう

A dead Atlantic salmon, about 46 centimeters long, became famous in brain science. In a 2009 poster, Craig Bennett and his colleagues described placing it in an fMRI scanner and showing it 15 photos of people in social situations.

They analyzed the data with a common method that tests each tiny cube of the brain, called a voxel, on its own. Out of 8,064 voxels, 16 passed the test, and they formed a small cluster inside the fish's head. The reason is simple.

If you run thousands of tests, a few will come out positive by luck. When the team applied standard corrections for multiple comparisons, no voxels were left. The joke had a serious point. Without these corrections, random noise can look like real brain activity.

127 words ・ CEFR B1

和訳を見る

体長約46センチの死んだタイセイヨウサケが、脳科学で有名になった。2009年のポスター発表で、クレイグ・ベネットさんらは、このサケをfMRIスキャナーに入れ、社会的な場面にいる人々の写真15枚を見せたと報告した。

それから、脳の小さな立方体(ボクセル)を一つずつ別々に検定する、よく使われる方法でデータを分析した。8,064個のボクセルのうち16個が基準を超え、魚の頭の中で小さなかたまりをつくった。理由は単純だ。

何千回も検定すれば、運だけでいくつかは陽性になる。チームが多重比較の標準的な補正をかけると、ボクセルは一つも残らなかった。この冗談には真剣な狙いがあった。補正をしなければ、偶然のノイズが本物の脳活動のように見えてしまうのだ。

4択リーディングクイズ

Q1. What was the main purpose of the salmon study?

Q2. How many voxels passed the test before correction?

Q3. Why did some voxels look active?

重要単語

  • false positiveB2
    名詞(句)偽陽性A false positive can look like a real discovery. 反対は false negative(偽陰性)。医療検査のニュースでも頻出。
  • multiple comparisonsC1
    名詞(句)多重比較Testing thousands of spots at once is a multiple comparisons problem. correct for multiple comparisons で「多重比較を補正する」。統計の定番コロケーション。
  • thresholdB2
    名詞しきい値、基準The team set a strict threshold for significance. もとは「敷居」。on the threshold of ~で「~の入り口に」という比喩も入試に出る。
  • noiseB1
    名詞(データの)雑音、偶然のゆらぎRandom noise in the scanner can create fake patterns. signal(意味のある信号)と対で使う。signal-to-noise ratio「S/N比」。
  • correctionB1
    名詞補正、訂正After the correction, no active spots were left. 動詞 correct。論文の「訂正記事」も correction と呼ぶ。
  • voxelC1
    名詞ボクセル(3D画像の最小単位)Each voxel is a tiny cube of brain tissue. volume + pixel を合わせた造語。2Dなら pixel、3Dなら voxel。
  • permutationC1
    名詞並べ替え、順列A permutation test shuffles the labels many times. 数学の「順列」と同じ語。permute(並べ替える)の名詞形。

4コマでわかる

死んだサケの脳が「光った」。fMRIの統計の落とし穴を暴いた伝説の実験の4コマ漫画
死んだサケをMRIに入れて人の写真を見せたら、脳の一部が「反応」した。もちろんサケは考えていない。統計の補正をサボると、偶然のノイズが“脳活動”に見えてしまう。その7年後、別のチームが脳画像ソフトの「補正のしかた」そのものを検証し、大論争になった。

押すと「マジかリスト」に保存されます

出典・参考文献(5件)タップで表示

原典ガイド:入門から読むと入りやすく、必読は議論の土台、発展はその先の論点です。

  1. 入門Bennett, Miller & Wolford (2009) Neural correlates of interspecies perspective taking in the post-mortem Atlantic Salmon: an argument for multiple comparisons correction, NeuroImage 47(Suppl. 1) S125(学会抄録)doi.orgサケのポスターの学会抄録。著者が公開しているポスター本体とあわせて、方法の欄の「生きていなかった」と、補正前後の結果を確かめられる
  2. 必読Bennett, Wolford & Miller (2009) The principled control of false positives in neuroimaging, Social Cognitive and Affective Neurosciencedoi.orgFWE・FDRなど原理的な補正法と、不適切な基準で報告される論文の実態をまとめた論考
  3. 必読Eklund, Nichols & Knutsson (2016) Cluster failure: Why fMRI inferences for spatial extent have inflated false-positive rates, PNASdoi.org499人分の安静時データで3つのソフトの偽陽性率を検証した本論文。のちの訂正もあわせて読む
  4. 発展Cox, Chen, Glen, Reynolds & Taylor (2017) FMRI Clustering in AFNI: False-Positive Rates Redux, Brain Connectivitydoi.orgAFNI開発元による反論。条件ごとの偽陽性率の違いと、改良した手法
  5. 発展Eklund, Knutsson & Nichols (2019) Cluster failure revisited: Impact of first level design and physiological noise on cluster false positive rates, Human Brain Mappingdoi.org批判への応答。課題デザインと生理ノイズの影響、ICA-FIXによるノイズ除去の効果