LLMが、もっともらしいけれど誤った内容を生成してしまう「ハルシネーション」。社内文書などの根拠を検索して渡すRAGは有力な対策ですが、根拠となる資料が存在しない質問や、資料に答えが書かれていない場面では、AIが推測で答えてしまう問題が残ります。
現場で本当に困るのは、間違えることそのものより、「分からないはずの質問に、自信満々で答えてしまう」ことです。回答の自信の度合いが当てにならなければ、どの回答を人が確認すべきかも判断できません。
この記事では、公的な資料と各社の公式ドキュメントでハルシネーションの正体と対策の全体像を整理し、「AIが自分の分からなさに気づき、答えを控える」ことを扱った論文4本を紹介します。結論を先に言うと、根拠を渡したうえで、「分からない」と答えることを評価で罰せず、自信の数字は運用する条件で確かめてから使うのが基本です!
ハルシネーションとは何か:問題は「自信のある誤り」
公的な定義:NIST は「作話(confabulation)」と呼ぶ
米国国立標準技術研究所(NIST)は、生成AIのリスク管理の指針「NIST AI 600-1(生成AIプロファイル)」で、生成AI特有のリスクの1つにconfabulation(作話)を挙げています。定義は「自信をもって述べられた、誤った内容や虚偽の内容を生成すること」で、俗に「ハルシネーション」と呼ばれるものだと説明しています。入力から外れた出力や、同じ会話で前に述べたことと矛盾する出力も含みます(NIST「AI 600-1」)。
定義に「自信をもって」が入っている点が重要です。同じ資料は、利用者が誤りを信じてしまうのは回答が自信ありげだからだと指摘し、もっともらしい理由づけや出典まで作ってしまうことがさらに人を信用させる、とも書いています。
なぜ起きるのか
NIST の説明では、作話は生成モデルの作り方から自然に生じます。モデルは学習データの統計的な分布に近い出力を作るので、その予測が事実と違う内容や矛盾した内容になることもあります。特に、長い回答を求める自由な質問や、高い専門性が必要な分野で問題になりやすいとしています(NIST「AI 600-1」)。
OWASP も、LLMアプリの主要リスク「LLM09:2025 Misinformation(誤情報)」の主な原因としてハルシネーションを挙げ、モデルが学習データの隙間を統計的なパターンで埋めることで起きると説明しています。利用者が確かめずに信じ込む過度の依存が被害を大きくする、とも指摘しています(OWASP「LLM09:2025 Misinformation」)。
対策の全体像:根拠を与える・不確かさを測る・出力を確かめる
公的な資料と各社のガイドにある対策は、次の3つに整理できます。
| 手段 | 何をするか | 限界 |
|---|---|---|
| 根拠を与える | 検索(RAG)で信頼できる資料を渡し、その範囲で答えさせる | 資料に答えがないと推測で埋めることがある |
| 不確かさを推定する | 同じ質問への回答のばらつきなどから「迷い具合」を測り、答えを控える | 自信満々の誤りは見逃しやすい |
| 出力を検証する | 引用・出典の確認、人による確認、運用中の監視 | 手間がかかり、全件は見られない |
1つ目では、OWASP が対策の筆頭にRAGを挙げ、Google も Gemini API の検索連携(グラウンディング)でハルシネーションを減らし、出典も示せると説明しています(OWASP「LLM09:2025 Misinformation」、Google「Grounding with Google Search」)。RAGの設計とつまずきどころはRAGの実務の記事で詳しく扱っています。
Anthropic のガイドは、「分かりません」と答えてよいと明示する、渡した資料の情報だけを使わせる、主張ごとに引用を示させて裏づけのない主張は取り下げさせる、同じ質問を何度か投げて答えの食い違いを見る、などを挙げつつ、それでも完全には無くならないので重要な情報は必ず確かめるよう書いています(Anthropic「Reduce hallucinations」)。
3つ目について、NIST は、導入前と運用中に出力の出典・引用を確かめること、導入後に作話を監視する手順を整えることを推奨しています(NIST「AI 600-1」)。ここからは、2つ目を中心に論文を見ていきます。
研究で見る「なぜ推測で答えるのか」と「どう見抜くか」
📄 論文: AIが推測で答えるのは「そう採点されてきたから」
Why Language Models Hallucinate(Adam Tauman Kalai ほか、2025年9月、arXiv:2509.04664)は、査読前の論文(プレプリント)です。
OpenAI などの研究者による理論の論文で、モデルを作って測った実験はありません。分析に加え、広く使われている評価ベンチマーク10本の採点方法を調べています。
著者らは原因を2段階で説明します。まず事前学習では、誤った文と事実を見分けられないなら、二値分類の誤りと同じように統計的に自然と誤りが生じます。学習データに1回しか出てこない人物の誕生日のような事実は、特に間違えやすくなります。次に、その後の調整でも無くならないのは、評価が「分からない」と答えることを罰しているからだと主張します。正解に1点、誤答と「分からない」に0点という採点では、自信がなくても当て推量で答えた方が得になるからです。実際に調べた10本のうち9本はこの二値の採点で、「分からない」に点を与えていませんでした。
処方箋は、専用の評価を増やすより、既存の主要な評価の採点を変えることです。たとえば問題文に「90%以上の確信があるときだけ答えること。誤答はマイナス9点、正解は1点、分からないは0点」のように、確信の基準と減点を明記する方法です。検索(RAG)を組み合わせても、確かな答えが見つからないときに推測が得になる構造は変わらない、とも指摘しています。
運営者にとっての意味は、社内の評価でも正答率だけで比べると「当て推量の上手なモデル」が選ばれてしまうということです。
📄 論文: 「迷い具合」だけで回答を控える判断をすると危ない
Entropy Alone is Insufficient for Safe Selective Prediction in LLMs(Edward Phillips ほか、2026年3月、arXiv:2603.21172)は、査読前の論文(プレプリント)です。
オックスフォード大学の研究者らが、公開されている3B〜8Bパラメータの小型モデル4種(Ministral-8B、Llama-3.2-3B、Qwen3-4B、Gemma-3-4B)を、雑学(TriviaQA)・生物医学(BioASQ)・医療(MedicalQA)の質問応答それぞれ1,000問で調べました。公開モデルを自前で動かしていますが、機器は本文に書かれていません。
不確かさの指標で危ない回答を見つけて答えを控える仕組みを選択的予測と呼び、指標には回答の確率の低さや、何度か答えさせたときの意味のばらつき(エントロピー)がよく使われます。この論文は、これらの指標にはモデルによって「自信満々の誤り」をまとめて見逃す弱点があることを示しました。Qwen では、ばらつきゼロと判定された回答に正解と誤答が混在していました。そこで、モデルの内部状態から「この答えは正しいか」を予測する小さな分類器(正誤プローブ。学習用の正誤はLLMで判定)を作り、エントロピーと組み合わせたところ、3つのデータと4つのモデルでおおむね改善しました。
著者らが重視するのは「答えた回答の誤り率を〇%以下にする」目標を守れるかです。Ministral-8B で BioASQ を解いた例では、エントロピーだけでは、ある程度の数に答えたまま誤り率を15%以下に抑えることができず、目標を厳しくするほど実際の誤り率が目標から離れました。組み合わせた指標では、このずれが小さくなりました。ただし最も難しい MedicalQA では改善が安定せず、正誤プローブの学習には正解ラベル付きのデータが要ります。
運営者にとっての意味は、不確かさの指標は1つに頼らず、「この基準で誤りはどれだけ残るか」で確かめる必要があるということです。
研究で見る「答えを控えさせる」方法と、その限界
📄 論文: 答える前に、自分で「確認の質問」をさせる学習
Do I Really Know? Learning Factual Self-Verification for Hallucination Reduction(Enes Altinisik ほか、2026年2月、arXiv:2602.02018)は、査読前の論文(プレプリント)です。
カタール計算機研究所の研究者らが、公開されている2B〜12Bパラメータの指示追従モデル8種(Gemma、Llama、Qwen の各系列)を、雑学の質問集 TriviaQA の学習用8万7,622問で追加学習させ、TriviaQA と別の3つの質問集で調べました。機器は本文に書かれていません。
「自信がなければ答えない」と学習させると、慎重すぎるモデルになりがちです。この論文の VeriFY は、まず答えを出し、その答えを確かめる質問(言い換えなど)に答え、2つが矛盾しないかを判断してから、答えるか控えるかを決める流れを学習させます。学習用の確認の質問と矛盾の判定は、より大きなモデルが作ります。工夫は、学習データ中の誤った答えの部分を学習の対象から外し、確認の手順だけを学ばせることです。外さないと、不要な回答拒否が増えました。
本文の表では、たとえば Gemma-2-2B の TriviaQA で、全質問のうち誤った答えを返した割合が40.8%から17.5%に下がり、正しく答えた割合は58.5%から54.4%への低下にとどまりました。間違えた問題を「控える」よう学習させる従来法では、正答が46.6%まで下がりました。TriviaQA だけで学習させても、別の質問集でハルシネーションは減りました。ただし、別の系列のモデルが作った確認のデータで学習させると、控える判断はうまく身につきませんでした。
運営者にとっての意味は、モデルを自前で追加学習できるなら、「控える」より「確かめてから答える」を教える方が、使える回答を残しやすいということです。
📄 論文: 正解が選択肢にないと分かっても、AIの自信はほとんど下がらない
When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information(Maryam Tahermazandarani ほか、2026年8月、arXiv:2608.09080)は、査読前の論文(プレプリント)です。
マッコーリー大学の研究者らが、インドの医学系入試の問題集 MedMCQA から選んだ4択の500問を、5つのモデルに解かせて調べました。GPT-5・GPT-4o・GPT-4o-mini は API 経由で、LLaMA-3-8B と Mistral-7B は4ビットに量子化して NVIDIA T4 GPU で動かしています。実際の診療記録ではなく、試験問題での実験です。
自信はモデル自身に0〜1の数字で申告させ、2つの設定で調べました。1つ目は、問題文に「臨床情報の一部が欠けているかもしれない」といった注意書きを段階的に加える設定です。ここでは、注意書きを強めても正答率はおおむね変わらず、自信も下がりませんでした。GPT-4o などの自信過剰は直らず、自信と正答率がそろっていたのは GPT-5 だけでした。
2つ目は、正解の選択肢を「情報が足りず判断できない」に置き換え、控えるのが正解になる設定です。どのモデルもこれを選んだのは4割未満(15.6〜38.2%)で、多くは残った誤りの選択肢を選びました。しかも、自信0.8超えの誤答の割合は GPT-4o で42.8%、LLaMA-3 で82.8%でした。GPT-5 は控えた割合が19.2%と低いものの、申告する自信が全体に低めで、この割合は18.6%でした。
運営者にとっての意味は、AIの申告する自信や「慎重に」という注意書きだけでは、答えのない質問を見抜けないということです。
現場でやること
評価で「分からない」を罰しない
回答は正解・誤答・「分からない」に分けて採点し、誤答の減点を「分からない」より重くします。評価の進め方はLLMの評価の記事も参考にしてください。
根拠を渡し、根拠の範囲で答えさせる
- 社内文書や公式情報を検索して渡し、その範囲の情報だけで答えるよう指示する
- 資料に答えがないときは「分かりません」と答えてよいと、プロンプトで明示する
- 主張ごとに資料の引用を付けさせ、引用が見つからない主張は出さない
自信の数字をそのまま信じない
AIが申告する「自信90%」は当てになりません。答えを控える仕組みを入れるなら、複数の信号を使い、「答えた回答の誤り率が目標以下に収まるか」を自社の質問で測ってから基準を決めます。重要な回答は人が確かめる流れも残します。
「答えのない質問」をテストに入れる
評価用の質問に、資料に答えがない質問や情報が欠けた質問を混ぜます。「分からない」と答えられるか、誤答の自信が高くないかを、導入前と運用中に確かめます。
ハルシネーション対策の鍵は次の3点です
- 「分からない」と答えることを、評価で罰しない
正解・誤答・「分からない」を分けて採点します。正答率だけを追うと、推測で答えるモデルが有利になります。 - 回答を控える判断は、複数の信号で、運用するリスク水準で確かめる
1つの指標やAIの自己申告に頼らず、「この基準で誤りはどれだけ残るか」で確かめます。 - 「答えのない質問」でのテストを評価に入れる
正解のない質問や情報が欠けた質問を評価に入れ、自信と正しさが連動しているかを見ます。
まとめ:ハルシネーション対策は「間違えない」から「分からないと言える」へ!
ハルシネーションは、NIST の定義どおり「自信ありげな誤り」が問題です。検索で根拠を与えても、資料に答えがないときに推測で埋める問題は残ります。研究は、それぞれの実験条件の範囲でですが、その背景に「分からない」を罰する採点があること、迷い具合の指標やAIの自己申告では自信満々の誤りを見逃しやすいこと、確かめてから答える振る舞いは学習で教えられることを示しています。
まずは自社のAIに「資料に答えがない質問」を10問ほど投げ、「分かりません」と言えるかを確かめてみてください。直すべき点が見えてきます!
参考文献
- NIST「Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile(NIST AI 600-1)」(https://doi.org/10.6028/NIST.AI.600-1)2026-10-01 確認
- OWASP Gen AI Security Project「LLM09:2025 Misinformation」(https://genai.owasp.org/llmrisk/llm092025-misinformation/)2026-10-01 確認
- Anthropic「Reduce hallucinations」(https://platform.claude.com/docs/en/test-and-evaluate/strengthen-guardrails/reduce-hallucinations)2026-10-01 確認
- Google「Grounding with Google Search」(https://ai.google.dev/gemini-api/docs/google-search)2026-10-01 確認
- Adam Tauman Kalai ほか「Why Language Models Hallucinate」arXiv:2509.04664(https://arxiv.org/abs/2509.04664)2026-10-01 確認
- Edward Phillips ほか「Entropy Alone is Insufficient for Safe Selective Prediction in LLMs」arXiv:2603.21172(https://arxiv.org/abs/2603.21172)2026-10-01 確認
- Enes Altinisik ほか「Do I Really Know? Learning Factual Self-Verification for Hallucination Reduction」arXiv:2602.02018(https://arxiv.org/abs/2602.02018)2026-10-01 確認
- Maryam Tahermazandarani ほか「When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information」arXiv:2608.09080(https://arxiv.org/abs/2608.09080)2026-10-01 確認
2026-10-01 更新: 構成を見直し、論文へのリンクと参考文献を追加し、医療の試験問題でAIの自信過剰を調べた論文の結果の記述の誤りを修正しました

