【2026年最新】学習データの合成×論文4選|「データが足りない」「AIが作ったデータで劣化しないか」を解く

【2026年最新】学習データの合成×論文4選|「データが足りない」「AIが作ったデータで劣化しないか」を解く AIニュース

自社向けにモデルを調整したくても、肝心の学習データが足りない。そんなときの定番になっているのが、LLMに学習用のデータを作らせる「合成データ」です。

しかし現場では、「作らせると似たようなデータばかりになる」「合成データで学習を繰り返したら性能が落ちた」「生成に使うAPIの費用がかさむ」といった問題に直面します。特に、AIが作ったデータで学習を重ねるうちに性能が劣化していく「モデル崩壊」は、多くの人が心配している現象です。

この記事では、公式ドキュメントやサーベイ論文で合成データの作り方と注意点を整理し、「多様で質の高いデータを、劣化させずに、安く作る」ための論文4本を紹介します。結論を先に言うと、多様さを出す工程と質を整える工程を分け、人が作ったデータを手放さず、作る前に生成元の規約やライセンスを確かめるのが基本です!

合成データとは何か:LLMに学習用のデータを作らせる

主な作り方は「大きなモデルに作らせる」と「手元のデータを膨らませる」

合成データとは、人の代わりにモデルに作らせた学習用のデータです。作り方は大きく2つあります。

1つ目は、大きなモデルに作らせて小さなモデルを鍛える方法です。OpenAI の説明では、大きなモデルで良い結果が出るまでプロンプトを調整し、その出力から基準を満たすものを集めてデータセットにし、小さなモデルを学習させる流れを「蒸留」として紹介しています。特定の作業なら、小さなモデルを大きなモデルに近い性能にできるという位置づけです(OpenAI「Supervised fine-tuning」)。

2つ目は、手元の少しのデータを膨らませる方法です。LLMによる合成データのサーベイ論文は、何もないところから作るよりも、少数の見本やラベルのない入力をもとにデータを増やすほうが多いと整理しています。作らせる中身も、新しい問題と答え、既存の文章の言い換え、既存データへのラベル付けなどさまざまです(Long ほか「On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey」)。

問題は「正しさ」と「多様さ」の両立

同じサーベイは、合成データに求められる条件として正しさと多様さを挙げています。LLMはもっともらしい誤りを混ぜることがあり、工夫しないと似た内容ばかり出しがちです。そのため研究の多くは、「作る」に加えて、低品質なものを捨てたりラベルを直したりする「選ぶ」工程と、データや学習後のモデルで「確かめる」工程を組み合わせています(Long ほか、同上)。

合成データの2つの落とし穴:モデル崩壊と利用規約

モデル崩壊:AIの出力で学習を繰り返すと何が起きるか

モデル崩壊は、モデルが作ったデータで次のモデルを学習させることを繰り返すうちに、元のデータにあった珍しい事例(分布の裾)が失われ、性能が落ちていく現象です。この名前を広めた論文は、言語モデルを含む複数の種類の生成モデルで、生成データでの学習が元に戻らない欠陥を生むと報告しました(Shumailov ほか「The Curse of Recursion」)。

一方、その後の研究は条件で結果が変わることを示しました。毎世代、元の実データを生成データに置き換えると崩壊に向かいますが、実データを残したまま生成データを積み増すと、言語モデルの事前学習などの実験では崩壊が避けられたと報告しています(Gerstgrasser ほか「Is Model Collapse Inevitable?」)。ほかの学習方法でも同じとは限りませんが、実データをどう扱うかが分かれ目の1つです。

利用規約:生成元のサービス規約とモデルのライセンスを確かめる

見落としやすいのが、生成に使うサービスの規約やモデルのライセンスです。2026年10月1日時点で確認できた範囲では、次の定めがあります。

  • Anthropic の商用利用規約(2025年6月17日発効)は、出力の権利を利用者に譲る一方で、競合する製品やサービスを作るためにサービスを使うこと(競合するAIモデルの学習を含む)を禁じています(Anthropic「Commercial Terms of Service」)
  • Gemini API の追加規約(2026年3月23日発効)も、サービスと競合するモデルの開発に使うことを禁じています(Google「Gemini API Additional Terms of Service」)
  • 公開モデルの Llama 3.1 のライセンスは、Llama 3.1 本体やその出力を使ってAIモデルを作成・学習・改善し、それを配布や公開する場合は、モデル名の先頭に「Llama」を付けるよう求めています(Meta「Llama 3.1 Community License Agreement」)

「競合する」の範囲はこの記事では判断できません。規約は改定されるので、作る前に最新版を読み、迷えば法務に相談してください。

研究で見る「多様で、劣化しないデータ」の作り方

📄 論文: 素のモデルに書かせ、調整済みのモデルで仕上げる

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation(Alan Zhu ほか、2025年2月投稿・5月改訂、arXiv:2502.01697)は、査読前の論文(プレプリント)です。

対象は、算数の文章題(GSM8K)、プログラムの出力予測(LiveCodeBench)、RAG向けの質問応答(HotpotQA、PubMedQA)などの公開データで、見本を3件だけ渡してデータを1,000件作らせ、そのデータで Llama 系の小さなモデルを学習させて試験問題の正答率を比べました。生成と学習はデータセンター向けGPU(A100、H100)で行っています。

見本が少ないと、指示に従うよう調整済みのモデルは似た出力ばかりになり、追加学習をしていない「素の」ベースモデルは、出来は粗いものの出力がはるかに多様です。そこで、ベースモデルで多様な下書きを作り、調整済みのモデルで1件ずつ直す2段階の方法(BARE)を提案しました。算数(GSM8Kの500問)で Llama 3.2 1B を学習させると、学習前21.8%の正答率が、BARE(70Bのベースモデルで下書き、GPT-4o で直す)のデータで35.8%になり、人が作った訓練データ1,000件の26.6%も上回りました。下書きを調整済みモデルに替えると30.8%に下がりました。ただし、RAG向けで既存手法を上回った幅は最大18.4%で、モデルの組み合わせによっては既存手法を下回っています。

運営者にとっての意味は、見本が数件でも、工程を分ければ使えるデータになりうることです。仕上げ役のモデルの力で結果は変わります。

📄 論文: 崩壊は「得意はより得意に、苦手はより苦手に」として現れる

Learning from Synthetic Data without Model Collapse in Iterative Instruction Tuning(Xiaonan Luo ほか、2026年7月、arXiv:2607.17043)は、査読前の論文(プレプリント)です。

対象は、算数・数学・理系の知識を問う4つの試験問題(GSM8K、MMLU-Pro、MATH、GPQA)と、17億〜80億パラメータの公開モデル5種です。モデル自身に問題を作らせ、外部の強いモデルで答えを付けて学習データに積み増し、同じ元のモデルから学習し直す、という手順を5世代くり返し、3回の平均で比べました。人が作った元の訓練データは毎世代残しています。

算数の問題を技能別に分析すると、合成データで学習したモデルは、得意な技能(お金の計算など)は伸びた一方、苦手な技能(代数、時間の計算など)はさらに悪化していました。著者らはこれを「能力の二極化」と呼んでいます。そこで、モデルが間違えた問題から苦手な技能を推定してそこを狙った問題を作り、さらにモデルに何度か答えさせ、もっともらしい答え同士が割れる中程度の難しさの問題を選んで学習に回す手法(KITE)を提案しました。たとえば Llama-3-8B-Instruct では4つの試験の平均正答率が、学習前43.45%、人のデータだけで44.55%、KITE で45.23%でした。ほかの合成手法の多くは、人のデータだけと同程度か下回りました。

運営者にとっての意味は、平均点だけを見ると「苦手がさらに苦手になる」変化を見逃すということです。なお、学習前からの伸びは各モデルで2ポイント前後で、技能の推定は目安にとどまると著者ら自身が述べています。

研究で見る「小さく、安く作る」

📄 論文: 大きなLLMは「分類器」より「先生役」で使う

Better as Generators Than Classifiers: Leveraging LLMs and Synthetic Data for Low-Resource Multilingual Classification(Branislav Pecher ほか、2026年1月、arXiv:2601.16278)は、Findings of EACL 2026 採録(abs のコメント欄の記載)です。

対象は、データの少ない言語から英語まで11言語の、感情・話題・意図の分類(英語は皮肉の検出も追加)です。Llama-3 70B に、訓練データから選んだ見本10件を参考にして、ラベルごとに200件の合成データを作らせました。これで小さな分類モデルや小型LLM(Llama-3.1-8B など3種)を学習させたり、プロンプトの見本に使ったりして、70Bモデルが直接分類した場合と比べました。各条件20回ずつ、計3万回以上の学習を A100 で行いました。

結果は、50件程度の合成データで小さなモデルが生成元の70Bモデルを上回り、すべて使うと平均で約10ポイント上回りました。データの少ない言語ほど効果は大きく出ました。ただし、よく知られた感情分類では、小さな分類モデルを学習させても生成元に届きませんでした。件数を増やすと、人が作ったデータは伸び続けるのに合成データは頭打ちになり、設定次第で学習に失敗しやすいことも報告されています。

運営者にとっての意味は、大きなLLMを毎回の分類に使うより、データ作りに使って小さなモデルに任せる道があることです。ただし件数を増やすだけでは人のデータに追いつきません。

📄 論文: 低品質なデータは「書き終わる前に」捨てる

Know When To Fold ‘Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection(Anjir Ahmed Chowdhury ほか、2026年5月、arXiv:2605.14062)は、査読前の論文(プレプリント)です。

対象は、算数・数学・化学の7つの公開データを手本にした問題と解答の合成で、公開モデル5種(38億〜80億パラメータ)を、GPU 2枚(RTX 4090)で動かしました。合成データは普通、最後まで書かせてから選別しますが、捨てる分にも費用がかかります。この論文は生成を段階に分け、問題を作った直後や解答の途中で、計算の食い違い、ハルシネーションに典型的なパターン、形式の崩れをルールで調べ、不合格ならその場で打ち切る手法(MSIFR)を提案しました。追加の学習は要りません。

抄録は「トークン消費を11〜77%削減し、精度は維持または向上」としていますが、本文の表1を確かめると、削減幅はモデルと問題の組み合わせで約1〜78%と幅があります。また、表の「精度」の定義は本文に明記がなく、評価には別のLLMによる採点を使ったと説明されています。学習後のモデルの評価ではありません。表1で各モデルを従来方式と比べると、35通りのうち18通りで下がっていました(2つのモデルではすべてのデータで低下)。最大78.2%の削減は、算数(GSM8K)で既存の早期終了の手法と組み合わせた場合の値です。

運営者にとっての意味は、検査を途中に入れると生成の費用を削れる可能性があることです。ただし効果と品質はモデルで大きく違うので、自分の環境で測ります。

現場でやること

生成元の規約とライセンスを最初に確かめる

作り始める前に、生成元のサービス規約やモデルのライセンスで「出力を学習に使ってよいか」「作ったモデルを公開するときの条件」を確認します。確認した日付と規約の版も記録しておきましょう。

少ない見本から作るなら「下書き」と「仕上げ」を分ける

見本が数件しかない場合は、1本目の論文のように、多様な下書きを出す工程と1件ずつ直す工程を分けます。直す工程には強いモデルを使い、似たデータばかりでないかを人が数十件読んで確かめます。

人が作ったデータは捨てずに積み増し、技能別に見る

学習を繰り返す場合は、人が作った元のデータを置き換えずに残します。評価は業務の種類や技能ごとに分け、苦手な領域が下がっていないかを世代ごとに確かめます。評価の作り方はLLMの評価の記事、学習そのものの進め方はファインチューニングの記事も参考にしてください。

生成の途中に安い検査を入れる

形式の崩れや計算の食い違いのような機械的に見つかる誤りは、生成の途中にルールで検査して打ち切ります。導入時は、削れたトークン数だけでなく、残したデータの質も従来の方法と比べます。

合成データ活用の鍵は次の3点です

  1. 多様さと質を別々の工程で確保する
    1つのモデルに「多様で正しいデータ」を一度に求めず、多様さを出す工程と質を整える工程を分けます。
  2. 人が作ったデータを残し、技能別に評価する
    人が作ったデータは置き換えずに積み増し、平均点では見えない「苦手の悪化」を技能別の評価で確かめます。
  3. 規約と費用を作る前に設計する
    生成元の規約やライセンスで出力の扱いを確かめ、途中で捨てる検査を入れて、無駄な生成の費用を抑えます。

まとめ:合成データは「たくさん作る」から「狙って作り、選んで、確かめる」へ!

合成データはデータ不足を補う有力な手段ですが、作らせるだけでは似たデータばかりになり、使い方を誤ると劣化を招きます。研究からは、ベースモデルで多様さを出す工夫、苦手を狙う工夫、途中で見切って費用を抑える工夫が見えてきました。一方で効果の大きさは条件次第で、人が作ったデータの代わりにはなりません。

まずは、使いたい生成元の規約やライセンスを確認し、手元の見本を数件そろえて、小さく作って技能別に確かめるところから始めてみてください!

参考文献

2026-10-01 更新: 構成を見直し、論文へのリンクと参考文献を追加し、生成途中での打ち切りによる削減幅と精度、RAG向けデータ生成の改善幅の記述の誤りを修正しました

タイトルとURLをコピーしました