回答する前に長い思考過程を生成してから答える「推論モデル」が普及し、推論時スケーリング(test-time scaling:学習済みのモデルに、回答時により多くの計算をさせて精度を上げる考え方)が注目されています。「じっくり考えさせれば、より賢い答えが返ってくる」というわけです。
しかし現場では、「思考を長くしたら、遅く高くなったのに精度はほとんど変わらない」「簡単な質問でも延々と考え込む」「答えようのない質問で暴走する」といった問題が起きています。思考に使うトークンもそのまま費用になるため、無制限に考えさせるわけにもいきません。
この記事では、各社の公式ドキュメントをもとに推論モデルの仕組みと思考の量の決め方を整理し、「どれだけ考えさせればよいか、考えさせ方をどう設計するか」を扱った論文4本を紹介します。結論を先に言うと、思考は長いほど良いとは限らず、自分の業務の質問で「ちょうど良い量」と「止めどき」を測って決めるのが基本です!
推論モデルと推論時スケーリングとは
推論モデル:答える前に「考える」モデル
推論モデルは、回答の前に内部で考える過程を持つモデルです。Anthropic は、思考を使うと Claude が問題を自分の言葉で言い直し、いくつかの方法を試し、途中の結果を確かめ、うまくいかない方針を捨ててから答えると説明しています。数学やプログラミング、分析、長いエージェント作業のように、途中の作業が答えの質を左右する場面で効果があるとしています(Anthropic「Thinking」)。OpenAI と Google も、推論のトークンや「思考の過程」を使って、複雑な問題や複数の段階を踏む作業に強くなると説明しています。なお、内部の思考がそのまま利用者に返るわけではありません。OpenAI では推論のトークンはAPIから見えず、Anthropic と Google でも返るのは要約か、設定によっては何も返りません(OpenAI「Reasoning models」、Google「Gemini thinking」、Anthropic「Thinking」)。
計算を増やす2つの方向:「長く考える」と「複数の答えから選ぶ」
この記事で扱う論文が比べているのは、主に2つのやり方です。1つは、1本の思考を長くする方法です。もう1つは、独立した答えを複数作り、多数決などで1つを選ぶ方法です。1本目の論文は前者を、2本目の論文は両者を同じ予算で比べています。ほかに、思考の止めどきを質問ごとに決める方法もあり、4本目の論文が扱っています。いずれも、計算を増やせば費用と待ち時間も増えます。
思考の量の決め方とコスト
思考のトークンは「出力」として課金される
3社とも、思考に使ったトークンは出力トークンとして課金すると明記しています。Anthropic は、思考の文章が返ってこない場合でも課金されるとしています。Google も、APIが返すのは思考の要約だけでも、料金は実際に生成した思考の全量で決まると書いています(Anthropic「Thinking」、OpenAI「Reasoning models」、Google「Gemini thinking」)。画面に見えている文章の量だけで、費用は判断できないということです。推論コスト全体の決まり方は推論コスト削減の記事で詳しく扱っています。
「トークン数の上限」から「どれだけ頑張るか」の指定へ
思考の量の指定方法は、2026年10月時点で、各社とも新しいモデルでは「努力の度合い」を段階で選ぶ形が中心です。ただし、使える設定や段階はモデルごとに違うので、使うモデルの資料で確かめてください。
- Anthropic: 以前のモデルは、思考に使うトークン数の予算(
budget_tokens、最低1,024トークン)を指定する方式でした。新しいモデルではこの方式は非推奨または使えず(対応はモデルごとに異なります)、モデルが質問ごとに考えるかどうかと量を決める「適応的な思考」と、effort(low〜max)で深さを調整します。effortは厳密な上限ではなく、振る舞いの目安だとしています(Anthropic「Extended thinking」、Anthropic「Effort」) - OpenAI:
reasoning.effortで、none〜max のうちモデルが対応する段階を選びます。低いほど速さとトークンの節約を優先し、高いほどしっかり考えて質の高い答えを目指します。また、簡単な質問では少なく考えるよう自動で調整されます(OpenAI「Reasoning models」) - Google: Gemini は既定で質問の複雑さに応じて思考の量を変え、
thinking_levelで段階を指定できます(Google「Gemini thinking」)
各社とも、出力の上限(max_tokens や max_output_tokens)には思考のトークンも含まれます。OpenAI と Google は、思考の途中で上限に達すると、答えが空のまま思考分の料金だけがかかることがあると注意しています。Google は、費用を抑えたいなら上限を小さくするより思考の段階を下げるよう勧めています(OpenAI「Reasoning models」、Google「Gemini thinking」)。
使い分けの目安として、Google は事実の検索や分類には低い段階を、OpenAI は最上位に近い段階を「評価で明確な効果が確かめられたときだけ」使うよう勧め、Anthropic は自分の評価データで段階を変えて比べるよう勧めています。
研究で見る「思考の長さ」と精度
📄 論文: 「Wait」を足すだけで考え直させる
s1: Simple test-time scaling(Niklas Muennighoff ほか、2025年1月投稿・3月改訂、arXiv:2501.19393)は、査読前の論文(プレプリント)です。
対象は公開モデルの Qwen2.5-32B-Instruct で、16基のH100 GPUで26分だけ追加学習し、競技数学(AIME24の30問、MATH500)と大学院レベルの理科の問題(GPQA Diamond)で正答率を測りました。
著者らは、難しさ・多様性・品質で選んだ1,000問について、問題・思考過程・解答の組で追加学習し、思考の量を外から操る「バジェットフォーシング」を組み合わせました。思考が長すぎれば打ち切って答えさせ、モデルが思考を終えようとしたら終わりの合図を抑えて「Wait」を付け足し、考え続けさせる方法です。これで答えを見直し、誤りを直すことがよくありました。思考を延ばすと、AIME24の正答率は50%から57%(30問中15問から17問)へ上がりました。抄録の「o1-preview を最大27%上回る」は、AIME24での44.6%と56.7%の比で、差は12.1ポイントです。ただし本文では、延長は6回ほどで頭打ちになり、終わりの合図を抑えすぎると同じ内容の繰り返しに陥るとも述べています。
運営者にとっての意味は、思考の量は外から調整できるつまみであり、効果には上限があるということです。
📄 論文: 思考を延ばす効果は、途中から逆効果になる
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models(Soumya Suvra Ghosal ほか、2025年6月投稿・10月改訂、arXiv:2506.04210)は、NeurIPS 2025 採録(abs のコメント欄の記載)です。
対象は 1.5B〜8B の公開推論モデル3つ(DeepSeek-R1 を元に蒸留したもの)で、算数・数学の3つの問題集(GSM8K、MATH-500、AIME 2024)を RTX A6000 GPU で解かせました。
1本目と同じく「Wait」で思考を延ばすと、最初は正答率が上がり、ある点を過ぎると下がる、という形がモデルと問題集を通じて見られました。たとえば最小のモデルで GSM8K を解かせると、思考を平均1,100トークンまで延ばしたときに87.3%だった正答率は、約16,000トークンまで延ばすと70.3%に落ちました。著者らは確率モデルと答えのばらつきの分析から、思考を延ばすと答えのばらつきが大きくなり、初めの改善の大部分は推論が良くなったのではなく、そのばらつきによる見かけのものだと説明しています。代わりに、同じトークン数の予算を複数の独立した思考に分け、多数決で答えを選ぶ「並列思考」を提案し、これらのモデルと問題集では、思考を延ばす方法より正答率が最大で約2割高くなりました。著者ら自身、32B以上の大きなモデルは試せていないと書いています。
運営者にとっての意味は、同じ費用なら「1本を長く」より「複数本で多数決」の方が良い場合がある、ということです。
研究で見る「考えすぎ」と止めどき
📄 論文: 答えようのない質問で、推論モデルは考え込み続ける
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?(Chenrui Fan ほか、2025年4月投稿・4月改訂、arXiv:2504.06514)は、査読前の論文(プレプリント)です。
対象は、算数・数学の問題集(SVAMP、GSM8K、MATH500)から必要な条件を1つ消すなどして作った「答えようのない問題」と、未定義の変数を含む合成の数式です。公開モデルと商用API(推論モデル7つ、そうでないモデル5つ)に解かせ、応答の長さと「情報が足りない」と答えた割合を測りました。機器の記載はありません。
多くの推論モデルは、前提が欠けた質問に対して、前提のそろった問題より2〜4倍長い応答を生成し、それでも「答えられない」とは言えませんでした。推論モデルは早い段階で問題の不備を疑っていても、その判断を貫けず、問い直しや仮定を繰り返していました。一方、推論向けに特化していないモデルは、短い応答で不備を指摘する傾向がありました。ただし推論モデルの中にも、OpenAI の o1 のように「答えられない」と言えたものがあります。さらに、DeepSeek-R1 が答えようのない数式に答えた応答わずか50件で Qwen2.5-7B-Instruct を追加学習させると、この考えすぎの傾向が移りました。
運営者にとっての意味は、評価データに答えようのない質問を混ぜないと、この失敗は見えないということです。もっともらしい誤答への対策はハルシネーションの記事も参考にしてください。
📄 論文: 「十分に考えたら止める」でトークンを減らす
Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning(Renliang Sun ほか、2025年10月、arXiv:2510.10103)は、査読前の論文(プレプリント)です。
対象は公開モデルの Qwen3-8B と gpt-oss-20B で、数学(GSM8K、MATH-500)、常識問題(CSQA)、大学院レベルの理科(GPQA-Diamond)の4つの問題集を A100 GPU で解かせ、何も止めない場合と比べました。
提案手法「REFRAIN」は追加学習が要りません。思考の中で「見直してはいるが、もう新しいことを言っていない」部分を見つけて止め、止める基準を問題の難しさに合わせて自動で調整します。結果、トークン使用量は20〜55%減り、8つの組み合わせのうち6つで正答率は同じか上がりました。残る2つでは0.2〜1.2ポイント下がっています。なお、この方法は思考を途中で見られることが前提で、思考の途中経過を受け取れず最終的な答えしか返さないAPIには使えないと著者らは述べています。
運営者にとっての意味は、「いつ止めるか」も精度と費用を左右するつまみになる、ということです。
現場でやること
思考の段階を変えながら、自社の質問で測る
まず業務の質問を数十件集め、思考の段階(low・medium・high など)を変えて、正答率・応答時間・思考のトークン数を並べてみてください。効果はどこかで頭打ちになり、逆に下がることもあります。低い段階から始めて、効果が確かめられたときだけ上げます。
「1本を長く」と「複数本で多数決」を同じ費用で比べる
正解が1つに決まる質問(計算、分類、選択式の判定など)なら、思考の段階を上げる代わりに、低めの段階で複数回答えさせて多数決をとる方法も試します。比べるときは、思考のトークンを含めた合計の費用をそろえます。
答えようのない質問を評価データに入れる
評価データには、必要な情報が欠けた質問を必ず混ぜ、「情報が足りません」と言えるか、長く考え込んでいないかを確かめます。指示文で「情報が足りなければ聞き返す」よう求めておき、前後で比べるのも有効です。評価の進め方はLLMの評価の記事も参考になります。
止めどきを仕組みで用意する
出力の上限を小さくしすぎると、答えが空のまま思考の料金だけがかかります。上限は余裕を持たせ、費用は思考の段階で抑えます。応答の利用記録から思考のトークン数を集計し、極端に長い質問を洗い出して、その種類の質問だけ段階を変えるのが現実的です。
推論時スケーリングを使いこなす鍵は次の3点です
- 思考の量は「長いほど良い」と決めつけず、測って決める
思考の段階を変えながら、精度・応答時間・費用の関係を自社の質問で確かめ、頭打ちになる点を把握します。 - 予算の使い道は「1本を長く」と「複数本で多数決」を比べる
同じ費用なら、独立した複数の答えから多数決で選ぶ方が良い場合があります。 - 答えようのない質問と「止めどき」を設計に入れる
前提の欠けた質問を評価データに含め、聞き返しを促す指示や、思考の段階による歯止めを用意します。
まとめ:推論時スケーリングは「長く考えさせる」から「ちょうど良く考えさせる」へ!
推論モデルの思考は精度を上げる一方で、そのトークンは出力として課金されます。論文からは、思考を延ばす効果には上限があり、行きすぎると逆効果になること、同じ費用なら並列に考えさせる方が良い場合があること、答えようのない質問で考え込むこと、止めどきの調整でトークンを大きく減らせることが見えてきます。
まずは、よく使う業務の質問で思考の段階を1つ下げて、正答率がどれだけ変わるかを測ってみてください。思ったより下がらなければ、それがそのまま節約になります!
参考文献
- Anthropic「Thinking」(https://platform.claude.com/docs/en/build-with-claude/thinking)2026-10-01 確認
- Anthropic「Extended thinking」(https://platform.claude.com/docs/en/build-with-claude/extended-thinking)2026-10-01 確認
- Anthropic「Effort」(https://platform.claude.com/docs/en/build-with-claude/effort)2026-10-01 確認
- OpenAI「Reasoning models」(https://developers.openai.com/api/docs/guides/reasoning)2026-10-01 確認
- Google「Gemini thinking」(https://ai.google.dev/gemini-api/docs/thinking)2026-10-01 確認
- Niklas Muennighoff ほか「s1: Simple test-time scaling」arXiv:2501.19393(https://arxiv.org/abs/2501.19393)2026-10-01 確認
- Soumya Suvra Ghosal ほか「Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models」arXiv:2506.04210(https://arxiv.org/abs/2506.04210)2026-10-01 確認
- Chenrui Fan ほか「Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?」arXiv:2504.06514(https://arxiv.org/abs/2504.06514)2026-10-01 確認
- Renliang Sun ほか「Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning」arXiv:2510.10103(https://arxiv.org/abs/2510.10103)2026-10-01 確認
2026-10-01 更新: 構成を見直し、論文へのリンクと参考文献を追加し、思考の早期停止の手法で正答率が下がらないとした記述の誤りを修正しました

