AIが堂々とウソをつくのは「テストで当てずっぽうを書く癖」のせいかもしれない

読む前に予想してみよう!
AIは知らないことを聞かれると、必ず「わかりません」と答えてくれる
もっともらしい作り話を自信満々に答えることがある。これがハルシネーション。
- 対象
- 大規模言語モデル
- 規模
- 理論分析+多数のモデル・質問での評価
- 研究の種類
- 理論研究・実験研究・レビュー
- 確かさ
- ★★★☆☆
AIのもっともらしいウソ=ハルシネーション。原因の一つは「わからない」と言うより当てずっぽうが得をする採点の仕組みにあるらしい。
ひとことで言うとAIは「知らない」と言うのが苦手。だから答えは自分でも確かめよう!
「この本の著者は?」とAIに聞いたら、存在しない本のあらすじまでスラスラ答えてきた――。そんな経験、ありませんか?
AIがもっともらしいウソを自信満々に話してしまう現象は、ハルシネーション(幻覚)と呼ばれています。わざと騙そうとしているわけではありません。
実はこの「ウソ癖」、AIの頭が悪いからというより、AIの仕組みと“採点ルール”に原因があるらしいのです。
01AIは「正しい答え」ではなく「ありそうな続き」を作っている
ChatGPTのような大規模言語モデル(LLM)は、ざっくり言うと「次に来そうな言葉を予測するマシン」です。スマホの予測変換を、ものすごく賢く巨大にしたものだと思ってください。
大量の文章から「こういう文の次には、だいたいこういう言葉が来る」というパターンを学んでいます。だから得意なのはそれっぽい文章を作ること。
ところが「それっぽい」と「正しい」は別物です。学習データにほとんど出てこない人物の誕生日や、マイナーな論文の題名などは、パターンから“それらしく”組み立てるしかありません。その結果、文法も口調も完璧なのに中身がデタラメな答えが生まれるのです。

02犯人は「当てずっぽうが得をする」採点ルール?
では、なぜ「わかりません」と言わないのでしょう。
これ、選択式テストで「空欄にするより何か書いた方がいい」と考える受験生とそっくりですよね。研究者たちは、自信がない時に「わからない」と言えたら評価されるような採点に変えるべきだと提案しています。
03「いつウソをつきそうか」を見抜く研究も
ハルシネーションを見抜く工夫も進んでいます。2024年に英オックスフォード大学の Farquhar らが科学誌 Nature で発表した方法は、とてもシンプルな発想でした。
同じ質問を何回もAIにして、答えの「意味」がバラバラになるか調べるのです。本当に知っていることなら毎回ほぼ同じ意味の答えになるはず。毎回言うことが違うなら、作り話の可能性が高い――というわけ。人間でも「話を盛る人は、聞くたびに話が変わる」ものですよね。
現実の被害も出ています。2023年には米国で、弁護士がAIの作った存在しない判例を裁判所に提出して問題になりました。米スタンフォード大学などの研究(Dahl ら, 2024)では、米国の裁判例について答えを検証できる質問をした結果、AIは少なくとも58%の割合で誤った答えを出したと報告されています(調査は2023年時点のモデル)。
04AIのウソに振り回されない3つのコツ
AIは「物知りな友だち」ではなく、「文章づくりがとても上手な相棒」くらいに考えるとちょうどいいかもしれません。アイデア出しや下書きには最強ですが、事実の最終チェックは人間の仕事です。
05まとめ
ハルシネーションは、AIが「ありそうな言葉をつなぐ」仕組みと、「当てずっぽうが得をする」評価のクセから生まれる、と考えられています。
AIの答えがスラスラ出てくるほど、ちょっと立ち止まって「それ、本当?」と聞き返す。それが、AI時代のいちばんシンプルな自衛術です。
この研究を英語で読もう原田英語の English CornerAI chatbots sometimes produce answers that sound perfect but are completely false, such as the summary of a…
音声
4択クイズ9問A2・B1・B2タップして開く
原田英語の English Corner
この研究を英語で読もう
Sometimes AI chatbots give wrong answers in a very confident way. They may even talk about books that do not exist. This is called a hallucination. AI does not check facts. It guesses the next word that sounds right.
Also, many AI tests give points for guessing but no points for saying "I don't know." So always check names and numbers from AI by yourself.
65 words ・ CEFR A2
和訳を見る
AIチャットボットは、ときどきとても自信満々に間違った答えを出します。存在しない本について話すことさえあります。これはハルシネーション(幻覚)と呼ばれます。AIは事実を確かめていません。正しそうに聞こえる次の言葉を推測しているのです。
また、AIの多くのテストでは、当てずっぽうには点をくれますが、「わかりません」と言っても点はもらえません。だから、AIが出す名前や数字は、いつも自分で確かめましょう。
4択リーディングクイズ
Q1. What is the passage mainly about?
AIが自信満々に間違える「ハルシネーション」とその理由が主題なので B。
Q2. What does AI do instead of checking facts?
AI does not check facts. It guesses the next word that sounds right. とあるので D。
Q3. In this passage, "confident" means ...
confident は「自信がある」。in a very confident way で「とても自信満々に」なので A。
AI chatbots sometimes produce answers that sound perfect but are completely false, such as the summary of a book that does not exist. This is called hallucination. Large language models work by predicting the word that is most likely to come next, so they are good at sounding natural, not at checking facts.
In 2025, researchers from OpenAI and Georgia Tech argued that the way AI is tested also matters. Many tests give one point for a correct answer and zero for both a wrong answer and "I don't know," so guessing is always the better strategy. This is similar to students who never leave a multiple-choice question blank. The researchers suggested rewarding AI when it honestly admits uncertainty.
119 words ・ CEFR B1
和訳を見る
AIチャットボットはときどき、完璧に聞こえるのにまったくの誤りである答えを出します。存在しない本のあらすじなどです。これはハルシネーションと呼ばれます。
大規模言語モデルは、次に来る可能性が最も高い言葉を予測することで動いているので、自然に聞こえることは得意ですが、事実を確かめることは得意ではありません。2025年、OpenAIとジョージア工科大学の研究者たちは、AIのテストのされ方も重要だと主張しました。多くのテストは正解に1点を与え、間違いにも「わかりません」にも0点を与えるので、当てずっぽうが常により良い作戦になります。これは、選択問題を決して空欄にしない生徒と似ています。研究者たちは、AIが不確かさを正直に認めたときに評価することを提案しました。
4択リーディングクイズ
Q1. How do large language models create answers?
work by predicting the word that is most likely to come next とあるので C。
Q2. Why is guessing "always the better strategy" for AI in many tests?
zero for both a wrong answer and "I don't know" とあり、白紙でも間違いでも0点なら推測した方が得なので B。
Q3. What would the researchers most likely support?
suggested rewarding AI when it honestly admits uncertainty とあるので A。
In 2023, a US lawyer submitted court cases that did not exist. An AI had generated them. This is hallucination, the tendency of large language models to produce fluent, plausible statements that are factually wrong.
The models are trained to predict likely continuations of text. That makes them good at convincing prose, but they have no built-in way to verify facts, especially about obscure people or papers that rarely appear in their training data. A 2025 preprint by Kalai and colleagues, not yet peer-reviewed, argued that the way models are evaluated makes things worse.
Most benchmarks give a point only for a correct answer and treat declining to answer exactly like an error, so models are in effect trained to guess. A 2024 study in Nature proposed a check. Ask a model the same question several times and measure whether the meaning of its answers changes.
If it does, the model is probably making things up. The method misses errors that a model makes consistently, though. Hallucination rates also vary widely from task to task. In one 2024 study, models answered verifiable legal questions incorrectly at least 58 percent of the time.
192 words ・ CEFR B2
和訳を見る
2023年、米国のある弁護士が、存在しない判例を裁判所に提出しました。それはAIが生成したものでした。これがハルシネーション、つまり大規模言語モデルが、流暢でもっともらしいのに事実としては誤った文を生成する傾向です。
これらのモデルは、文章のありそうな続きを予測するよう訓練されています。そのため説得力のある文章を作るのは得意ですが、事実を検証する仕組みは内蔵しておらず、特に学習データにめったに出てこない無名の人物や論文については弱いのです。Kalaiらによる2025年のプレプリントは、まだ査読を経ていませんが、モデルの評価のしかたが事態を悪化させていると主張しました。
ほとんどのベンチマークは正解にしか点を与えず、回答を控えることを間違いとまったく同じに扱うため、モデルは事実上、当てずっぽうで答えるよう訓練されてしまうのです。2024年に『Nature』に掲載された研究は、ある確認方法を提案しました。モデルに同じ質問を何度か尋ね、答えの意味が変わるかどうかを測るのです。
変わるなら、モデルはおそらく作り話をしています。ただしこの方法では、モデルが一貫して犯す誤りは見逃してしまいます。また、ハルシネーションの割合は課題によって大きく異なります。2024年のある研究では、モデルは検証可能な法律の質問に少なくとも58パーセントの割合で誤答しました。
4択リーディングクイズ
Q1. According to the passage, why do models hallucinate more about obscure people or papers?
especially about obscure people or papers that rarely appear in their training data とあるので D。
Q2. What is a weakness of the method proposed in Nature?
The method misses errors that a model makes consistently, though. とあるので C。
Q3. What did the 2025 preprint by Kalai and colleagues argue?
treat declining to answer exactly like an error, so models are in effect trained to guess とあるので B。
重要単語
- hallucinationC1名詞幻覚(AIのもっともらしい誤答)The chatbot's hallucination included a book that does not exist.
動詞 hallucinate。もとは医学用語の「幻覚」。AI用語として広く使われるようになった。 - plausibleC1形容詞もっともらしいThe answer sounded plausible, but it was wrong.
「本当らしく聞こえる」が核。反対は implausible。a plausible explanation がよく出る。 - benchmarkC1名詞性能評価テスト、基準Many benchmarks give no points for saying "I don't know."
もとは測量の「水準点」。比較の基準となるもの全般に使う。 - verifyB2動詞検証する、確かめるAlways verify names and numbers from AI.
ver-(真実)= very と同語源。名詞 verification、形容詞 verifiable(検証可能な)。 - uncertaintyB2名詞不確かさA good model should express its uncertainty.
un-(否定)+certain(確かな)+-ty。admit uncertainty「不確かさを認める」。 - fabricationC1名詞でっち上げ、捏造The court case was a complete fabrication.
動詞 fabricate は「組み立てる」と「でっち上げる」の両義。研究不正(データ捏造)の文脈でも頻出。 - peer reviewC1名詞(句)査読(専門家による審査)The paper has not yet gone through peer review.
peer は「同僚・仲間」。peer-reviewed journal「査読付き学術誌」。preprint(査読前論文)と対で覚える。
動画でもっと知る
動画は各チャンネルの公式埋め込みで表示しています(YouTube)。
この話題を TED で聞く
同じテーマの TED・TED-Ed を、
TED HACK で。英語の見どころ・使える表現・学習ミッションつきの日本語ガイドです。(運営:原田英語)
公式・一次情報をチェック
このネタ、誰かに教えたくなった?
AIが平気でウソをつく理由、「わからない」と答えるより当てずっぽうで書いた方が点がもらえる“テストの採点ルール”に一因があるらしい。人間の受験生と同じだった…
押すと「マジかリスト」に保存されます
出典・参考文献(4件)タップで表示
- Kalai et al. (2025) Why Language Models Hallucinate, arXivarxiv.org
- Farquhar et al. (2024) Detecting hallucinations in large language models using semantic entropy, Naturedoi.org
- Huang et al. (2025) A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions, ACM Transactions on Information Systemsdoi.org
- Dahl et al. (2024) Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models, Journal of Legal Analysisdoi.org
※本記事は上記の研究・公開資料をもとに、原田英語が独自の言葉で解説したものです。引用は著作権法第32条の範囲で行い、出典を明記しています。画像はすべてオリジナルのイメージです。研究結果には限界や個人差があります。誤りのご指摘は原田英語のお問い合わせフォームから。









