ウソ?ホント?検証 マジカ!?ゼミ・統計・研究方法論ビミョー

「発表された研究の大半はまちがい」は本当か? 有名論文の“計算”を読み解く

「発表された研究の大半はまちがい」は本当か? 有名論文の“計算”を読み解く

読む前に予想してみよう!

「統計的に有意(p<0.05)」なら、その研究結果が正しい確率は95%以上である

研究カード(どんな研究?)
対象
医学・心理学などの出版研究
規模
理論モデル/100研究の追試
研究の種類
確率モデルによる理論的分析+大規模追試
確かさ
★★★☆☆
3秒でわかる

2005年の有名論文は「発表された研究の多くは誤り」と計算をもとに論じた。でも答えは分野と前提しだい。「全部ウソ」とも「心配ない」とも言えない。

ひとことで言うと当たりの少ないくじを、雑に引くほど「当たり!」の中にハズレがまざる!

論文スペック表研究デザイン・規模・結果・その後(玄人向け)
研究デザイン
確率モデルによる理論的分析(データ収集なし)
主な指標
陽性的中率(PPV)を、検出力・事前の見込みの比R・バイアスで表す
主な結論
研究規模が小さい、効果が小さい、分析の自由度が大きいなど、誤りやすさの6条件を提示
試算の例
十分な規模で事前の見込みが五分五分のランダム化比較試験なら正しい確率は約85%、当たりの比が1対10の探索的な疫学研究なら5回に1回ほど
反論・実測
Goodman & Greenland (2007) がモデルの前提を批判。Jager & Leek (2014) は一流医学誌5誌の5,322個のp値から偽の発見を約14%と推定
関連する大規模追試
再現性プロジェクト(2015年):心理学100研究の追試で有意になったのは36%、効果の大きさは平均で元の半分ほど
もくじ
  1. 問い:「有意」の中に、ハズレはどれくらい混ざっている?
  2. 計算してみる:1,000個の仮説で考える
  3. 6つの「誤りやすさ」の条件
  4. 検出力不足は「二重に」効く
  5. 現実のデータは理論どおりだったか
  6. 研究史の中の位置づけ
  7. まとめ

科学論文のタイトルで、これほど挑発的なものはそうありません。

"Why Most Published Research Findings Are False"――「発表された研究結果の大半はなぜ誤りなのか」。

2005年、医学研究者のヨアニディス(Ioannidis)さんがオープンアクセス誌『PLoS Medicine』に発表した論文です。科学への信頼をゆさぶる一本として、今も繰り返し引用されています。

ところがこの論文、実際に論文を集めて「ウソ」を数えたわけではありません。中身は、紙と鉛筆でもたどれる確率の計算です。では、その計算は何を前提にしていて、どこまで正しいのか。反論も含めて読み解いてみましょう。

01問い:「有意」の中に、ハズレはどれくらい混ざっている?

よくある誤解から始めましょう。「p<0.05 で有意なら、その結果が正しい確率は95%」。これはまちがいです。

5%というのは「効果がない仮説を調べたとき、うっかり有意になる確率」。知りたいのはその逆、「有意になった結果のうち、本当に効果があるものの割合」です。この二つは、病気の検査でいう「偽陽性率」と「陽性的中率」の関係と同じで、まったく別物です。

ヨアニディスさんの論文は、この陽性的中率を、検出力・事前確率・バイアスの三つで表す式を示し、さまざまな研究分野に当てはめたものでした。

02計算してみる:1,000個の仮説で考える

式を使わず、数で追いかけてみましょう(ここでの数字は説明用の例です)。

ある分野で1,000個の仮説が調べられ、そのうち本当に当たりなのは100個だけ(事前確率10%)だとします。

  • ハズレの900個のうち、5%の45個がうっかり「有意」になる
  • 当たりの100個のうち、検出力が80%なら80個が「有意」になる

有意になったのは合計125個。そのうち本物は80個なので、陽性的中率は約64%。すでに3分の1以上がハズレです。

では、研究が小さく、検出力が20%しかなかったら? 当たりから有意になるのは20個だけ。ハズレからの45個はそのままなので、有意65個のうち本物は20個、約31%。有意な結果の7割近くがハズレになります。

ここにバイアス(都合のいい分析・報告)が加われば、ハズレはさらに増えます。「大半は誤り」という結論は、当たりの少ない分野で、小さな研究を、柔軟な分析で行うと、こうなるという計算なのです。

当たり(金色)が少ない棚では、すくい上げた「有意」の中にハズレが多く混ざる
当たり(金色)が少ない棚では、すくい上げた「有意」の中にハズレが多く混ざる

036つの「誤りやすさ」の条件

論文は、こうした計算から、研究結果が誤りになりやすい条件を6つ挙げています。要約すると次のとおりです。

  1. 研究の規模が小さい
  2. 効果の大きさが小さい
  3. 調べる関係の数が多く、事前の絞り込みが弱い
  4. デザイン・定義・評価項目・分析方法の自由度が大きい
  5. 金銭的な利害や先入観が強い
  6. 多くのチームが競い合う「ホットな」分野である

6番目は少し意外です。競争が激しいほど、目立つ「有意」な結果を急いで発表しようとする圧力が強まり、偶然の当たりが先に世に出やすくなる、という理屈です(ただし、この6番目の条件には後で紹介する批判があります)。

論文では分野ごとの目安も示されています。十分な規模で、事前の見込みが五分五分の質の高いランダム化比較試験なら、結果が正しい確率はおよそ85%。一方、十分な規模の探索的な疫学研究でも、当たりの比率が1対10なら5回に1回ほど。3万個の遺伝子を調べて本物は30個、というような(当たりの比が1対1,000の)発見型の研究では、ひとつひとつの「発見」が正しい確率は0.1%前後にとどまる、と試算されました。

つまり「大半は誤り」は、すべての研究に一律に当てはまる宣告ではなく、条件の悪い研究ほどそうなるという主張なのです。

04検出力不足は「二重に」効く

2013年、バトン(Button)さんら(ヨアニディスさんも共著者)は、この理論を神経科学に当てはめました。

検出力が低いと「本物を見逃す」ことはよく知られています。でもバトンさんらが強調したのは、もう一つの害でした。検出力が低いと、有意になった結果が本物である確率そのものも下がる。上の1,000個の計算で、検出力80%と20%を比べたときに起きたことです。

さらに、小さな研究でたまたま有意になった結果は、効果の大きさを過大に見積もりがちになります。偶然大きく出たときだけ有意の線を越えるからです。この「勝者の呪い」によって、後から大きな研究で確かめると効果が縮んでしまう。バトンさんらは、神経科学の研究の平均的な検出力は非常に低いと結論づけています。

05現実のデータは理論どおりだったか

理論の予測を、現実で確かめるような大規模な試みも行われました。2015年の「再現性プロジェクト」では、心理学の100の研究を追試したところ、元の研究の97%が有意だったのに対し、追試で有意になったのは36%。効果の大きさも、平均で元の半分ほどに縮みました。

効果の縮みは、まさに「勝者の呪い」の予測どおりです。ただし注意も必要です。追試で有意にならなかったからといって、元の結果が「誤り」と決まるわけではありません。追試自体にも見逃しの可能性があります。再現率の数字は、そのまま「正しい研究の割合」ではないのです(追試の舞台裏や個別の事例は、パワーポーズの記事などでも紹介しています)。

ここから玄人ゾーン

ここまで読めば要点はつかめています。この先は反論・方法論・未解決の問いまで踏み込みます。

結局、「誤りの割合」はどの分野の、どんな研究を対象にするかで大きく変わります。ランダム化比較試験の多い一流医学誌の論文と、探索的な小規模研究とでは、同じ数字になるはずがありません。

06研究史の中の位置づけ

ヨアニディスさんの論文自体は、新しい統計手法を発明したものではありません。検査の陽性的中率の考え方は昔からありました。

この論文の功績は、それを「発表された研究全体」にあてはめ、研究の規模・分析の柔軟性・利害・競争といった、科学の“生態系”の性質と結びつけたことにあります。

その後の10年あまりで、検出力の重視、事前登録、データ公開、大規模な追試プロジェクトといった改革が次々と進みました。「メタサイエンス(科学についての科学)」と呼ばれる分野の、出発点の一つといえる論文です。

一つの「有意」は出発点にすぎない。追試や大規模研究をくぐり抜けた結果ほど、信頼できる
一つの「有意」は出発点にすぎない。追試や大規模研究をくぐり抜けた結果ほど、信頼できる

07まとめ

「発表された研究の大半はまちがい」。この言葉は、半分ホントで、半分は言いすぎです。

ホントなのは、「有意」という一つの判定だけでは、結果が正しいかどうかは決まらないということ。当たりの少ない分野で、小さな研究を、柔軟な分析で行えば、有意な結果の中にハズレが多く混ざるのは計算上避けられません。

言いすぎなのは、それがあらゆる研究に一律に当てはまるかのように聞こえること。答えは、分野と前提しだいです。

ニュースで「研究で判明!」を見たら、「その研究は大きかった? ほかでも確かめられた?」と問いかけてみてください。それだけで、ハズレを引く確率はぐっと下がります。

この研究を英語で読もう原田英語の English CornerJohn Ioannidis's 2005 essay has one of the boldest titles in science, "Why Most Published Research Findings… 音声 4択クイズ9問A2・B1・B2タップして開く

原田英語の English Corner

この研究を英語で読もう

John Ioannidis's 2005 essay has one of the boldest titles in science, "Why Most Published Research Findings Are False." The paper does not count mistakes in real studies. It uses a probability model. Suppose 1,000 ideas are tested and only 100 are true.

With the usual 5 percent threshold, about 45 false ideas will look significant by chance. If studies are small and can detect a true effect only 20 percent of the time, just 20 true ideas will pass.

So most of the significant results would be false. Ioannidis listed conditions that make this worse, such as small studies, small effects, flexible analyses and financial interests. Critics answered that the result depends heavily on these starting assumptions.

118 words ・ CEFR B1

和訳を見る

ジョン・ヨアニディスさんの2005年の論文は、科学の世界で最も大胆なタイトルの一つ、「発表された研究結果の大半はなぜ誤りなのか」を持っている。この論文は、実際の研究のまちがいを数えたものではない。確率のモデルを使っている。1,000個のアイデアが調べられ、正しいのは100個だけだとしよう。

ふつうの5%の基準では、まちがったアイデアのうち約45個が偶然有意に見える。研究が小さく、本当の効果を見つけられるのが20%の確率しかなければ、合格する正しいアイデアは20個だけだ。

そうなると、有意な結果の大半はまちがいになる。ヨアニディスさんは、小さな研究、小さな効果、柔軟な分析、金銭的な利害など、状況を悪くする条件を挙げた。批判者たちは、その結果はこうした出発点の前提に大きく左右されると反論した。

4択リーディングクイズ

Q1. What kind of paper did Ioannidis write?

Q2. In the example, how many true ideas pass when studies can detect a true effect only 20 percent of the time?

Q3. Why might critics object to the paper's conclusion?

重要単語

  • false positiveC1
    名詞(句)偽陽性A false positive can look just like a real discovery. 検査で「陽性」と出たのに実際は陰性のこと。反対は false negative(偽陰性)。
  • statistical powerC1
    名詞(句)検出力Small studies often have low statistical power. 本当の効果を見つけられる確率。power は「力」だけでなく統計では専門用語になる。
  • probabilityB2
    名詞確率、見込みThe probability of a true finding depends on the field. 形容詞 probable(ありそうな)、副詞 probably(たぶん)と同じ語源。
  • biasB2
    名詞偏り、偏見Bias can push weak results across the line. 統計では「系統的なずれ」、日常では「偏見」。be biased against ~ で「~に偏見を持つ」。
  • assumptionB2
    名詞前提、仮定The conclusion depends on the assumptions. 動詞 assume(仮定する、思い込む)。make an assumption で「仮定を立てる」。
  • replicationC1
    名詞追試、再現Replication tests whether a result holds up. replicate(再現する)の名詞形。reproducibility(再現性)とあわせて科学英語の頻出語。
  • thresholdC1
    名詞しきい値、境目The usual threshold for significance is 5 percent. もとは「敷居」。on the threshold of ~ で「~の始まりに」。発音は THRESH-hold。

動画でもっと知る

4コマでわかる

「発表された研究の大半はまちがい」は本当か? 有名論文の“計算”を読み解くの4コマ漫画
「発表された研究結果の大半はまちがい」という論文が2005年に出た。実はデータ集めではなく“確率の計算”の論文。当たりの少ない分野で小さな研究をたくさんやると、「有意」の中にハズレが増える。反論も含めて読み解く。

押すと「マジかリスト」に保存されます

出典・参考文献(5件)タップで表示

原典ガイド:入門から読むと入りやすく、必読は議論の土台、発展はその先の論点です。

  1. 必読Ioannidis (2005) Why Most Published Research Findings Are False, PLoS Medicinedoi.org議論の出発点。陽性的中率の式、誤りやすさの6条件、研究の種類ごとの試算
  2. 必読Goodman & Greenland (2007) Why Most Published Research Findings Are False: Problems in the Analysis, PLoS Medicinedoi.org同じ誌上での反論。結果を「有意かどうか」の二択で扱うモデルの問題点と、前提が結論を決めているという指摘
  3. 発展Jager & Leek (2014) An estimate of the science-wise false discovery rate and application to the top medical literature, Biostatisticsdoi.org一流医学誌の要旨に書かれた p 値から、偽の発見の割合を推定した研究。推定手法とその限界を考える材料に
  4. 入門Button et al. (2013) Power failure: why small sample size undermines the reliability of neuroscience, Nature Reviews Neurosciencedoi.org検出力不足が「見逃し」だけでなく、有意な結果の信頼性や効果の過大評価にもつながることを整理した総説
  5. 発展Open Science Collaboration (2015) Estimating the reproducibility of psychological science, Sciencedoi.org心理学100研究の大規模追試。再現率の数字を「正しい研究の割合」と読んでよいかを考える材料に