テクノロジー・未来

AIが堂々とウソをつくのは「テストで当てずっぽうを書く癖」のせいかもしれない

AIが堂々とウソをつくのは「テストで当てずっぽうを書く癖」のせいかもしれない

読む前に予想してみよう!

AIは知らないことを聞かれると、必ず「わかりません」と答えてくれる

研究カード(どんな研究?)
対象
大規模言語モデル
規模
理論分析+多数のモデル・質問での評価
研究の種類
理論研究・実験研究・レビュー
確かさ
★★★☆☆
3秒でわかる

AIのもっともらしいウソ=ハルシネーション。原因の一つは「わからない」と言うより当てずっぽうが得をする採点の仕組みにあるらしい。

ひとことで言うとAIは「知らない」と言うのが苦手。だから答えは自分でも確かめよう!

もくじ
  1. AIは「正しい答え」ではなく「ありそうな続き」を作っている
  2. 犯人は「当てずっぽうが得をする」採点ルール?
  3. 「いつウソをつきそうか」を見抜く研究も
  4. AIのウソに振り回されない3つのコツ
  5. まとめ

「この本の著者は?」とAIに聞いたら、存在しない本のあらすじまでスラスラ答えてきた――。そんな経験、ありませんか?

AIがもっともらしいウソを自信満々に話してしまう現象は、ハルシネーション(幻覚)と呼ばれています。わざと騙そうとしているわけではありません。

実はこの「ウソ癖」、AIの頭が悪いからというより、AIの仕組みと“採点ルール”に原因があるらしいのです。

01AIは「正しい答え」ではなく「ありそうな続き」を作っている

ChatGPTのような大規模言語モデル(LLM)は、ざっくり言うと「次に来そうな言葉を予測するマシン」です。スマホの予測変換を、ものすごく賢く巨大にしたものだと思ってください。

大量の文章から「こういう文の次には、だいたいこういう言葉が来る」というパターンを学んでいます。だから得意なのはそれっぽい文章を作ること。

ところが「それっぽい」と「正しい」は別物です。学習データにほとんど出てこない人物の誕生日や、マイナーな論文の題名などは、パターンから“それらしく”組み立てるしかありません。その結果、文法も口調も完璧なのに中身がデタラメな答えが生まれるのです。

AIは「正しい言葉」ではなく「次に来そうな言葉」を選んでいる。
AIは「正しい言葉」ではなく「次に来そうな言葉」を選んでいる。

02犯人は「当てずっぽうが得をする」採点ルール?

では、なぜ「わかりません」と言わないのでしょう。

これ、選択式テストで「空欄にするより何か書いた方がいい」と考える受験生とそっくりですよね。研究者たちは、自信がない時に「わからない」と言えたら評価されるような採点に変えるべきだと提案しています。

03「いつウソをつきそうか」を見抜く研究も

ハルシネーションを見抜く工夫も進んでいます。2024年に英オックスフォード大学の Farquhar らが科学誌 Nature で発表した方法は、とてもシンプルな発想でした。

同じ質問を何回もAIにして、答えの「意味」がバラバラになるか調べるのです。本当に知っていることなら毎回ほぼ同じ意味の答えになるはず。毎回言うことが違うなら、作り話の可能性が高い――というわけ。人間でも「話を盛る人は、聞くたびに話が変わる」ものですよね。

現実の被害も出ています。2023年には米国で、弁護士がAIの作った存在しない判例を裁判所に提出して問題になりました。米スタンフォード大学などの研究(Dahl ら, 2024)では、米国の裁判例について答えを検証できる質問をした結果、AIは少なくとも58%の割合で誤った答えを出したと報告されています(調査は2023年時点のモデル)。

04AIのウソに振り回されない3つのコツ

AIは「物知りな友だち」ではなく、「文章づくりがとても上手な相棒」くらいに考えるとちょうどいいかもしれません。アイデア出しや下書きには最強ですが、事実の最終チェックは人間の仕事です。

05まとめ

ハルシネーションは、AIが「ありそうな言葉をつなぐ」仕組みと、「当てずっぽうが得をする」評価のクセから生まれる、と考えられています。

AIの答えがスラスラ出てくるほど、ちょっと立ち止まって「それ、本当?」と聞き返す。それが、AI時代のいちばんシンプルな自衛術です。

この研究を英語で読もう原田英語の English CornerAI chatbots sometimes produce answers that sound perfect but are completely false, such as the summary of a… 音声 4択クイズ9問A2・B1・B2タップして開く

原田英語の English Corner

この研究を英語で読もう

AI chatbots sometimes produce answers that sound perfect but are completely false, such as the summary of a book that does not exist. This is called hallucination. Large language models work by predicting the word that is most likely to come next, so they are good at sounding natural, not at checking facts.

In 2025, researchers from OpenAI and Georgia Tech argued that the way AI is tested also matters. Many tests give one point for a correct answer and zero for both a wrong answer and "I don't know," so guessing is always the better strategy. This is similar to students who never leave a multiple-choice question blank. The researchers suggested rewarding AI when it honestly admits uncertainty.

119 words ・ CEFR B1

和訳を見る

AIチャットボットはときどき、完璧に聞こえるのにまったくの誤りである答えを出します。存在しない本のあらすじなどです。これはハルシネーションと呼ばれます。

大規模言語モデルは、次に来る可能性が最も高い言葉を予測することで動いているので、自然に聞こえることは得意ですが、事実を確かめることは得意ではありません。2025年、OpenAIとジョージア工科大学の研究者たちは、AIのテストのされ方も重要だと主張しました。多くのテストは正解に1点を与え、間違いにも「わかりません」にも0点を与えるので、当てずっぽうが常により良い作戦になります。これは、選択問題を決して空欄にしない生徒と似ています。研究者たちは、AIが不確かさを正直に認めたときに評価することを提案しました。

4択リーディングクイズ

Q1. How do large language models create answers?

Q2. Why is guessing "always the better strategy" for AI in many tests?

Q3. What would the researchers most likely support?

重要単語

  • hallucinationC1
    名詞幻覚(AIのもっともらしい誤答)The chatbot's hallucination included a book that does not exist. 動詞 hallucinate。もとは医学用語の「幻覚」。AI用語として広く使われるようになった。
  • plausibleC1
    形容詞もっともらしいThe answer sounded plausible, but it was wrong. 「本当らしく聞こえる」が核。反対は implausible。a plausible explanation がよく出る。
  • benchmarkC1
    名詞性能評価テスト、基準Many benchmarks give no points for saying "I don't know." もとは測量の「水準点」。比較の基準となるもの全般に使う。
  • verifyB2
    動詞検証する、確かめるAlways verify names and numbers from AI. ver-(真実)= very と同語源。名詞 verification、形容詞 verifiable(検証可能な)。
  • uncertaintyB2
    名詞不確かさA good model should express its uncertainty. un-(否定)+certain(確かな)+-ty。admit uncertainty「不確かさを認める」。
  • fabricationC1
    名詞でっち上げ、捏造The court case was a complete fabrication. 動詞 fabricate は「組み立てる」と「でっち上げる」の両義。研究不正(データ捏造)の文脈でも頻出。
  • peer reviewC1
    名詞(句)査読(専門家による審査)The paper has not yet gone through peer review. peer は「同僚・仲間」。peer-reviewed journal「査読付き学術誌」。preprint(査読前論文)と対で覚える。

動画でもっと知る

AIが平気でウソをつく理由、「わからない」と答えるより当てずっぽうで書いた方が点がもらえる“テストの採点ルール”に一因があるらしい。人間の受験生と同じだった…

押すと「マジかリスト」に保存されます

出典・参考文献(4件)タップで表示
  1. Kalai et al. (2025) Why Language Models Hallucinate, arXivarxiv.org
  2. Farquhar et al. (2024) Detecting hallucinations in large language models using semantic entropy, Naturedoi.org
  3. Huang et al. (2025) A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions, ACM Transactions on Information Systemsdoi.org
  4. Dahl et al. (2024) Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models, Journal of Legal Analysisdoi.org