LLM

【2026年最新】マルチエージェントの協調×論文4選|「エージェントを増やしたのに精度が上がらない」を解く AIエージェント

【2026年最新】マルチエージェントの協調×論文4選|「エージェントを増やしたのに精度が上がらない」を解く

計画役・実行役・レビュー役のように、複数のAIエージェントに役割を分担させる「マルチエージェント」構成が人気を集めています。人間のチームのように分業させれば、より難しい仕事もこなせるはずだという期待があります。ところが現場では、「エージェン...
【2026年9月 急上昇ワード】エージェント・ハーネス×論文4選|「同じモデルなのに、エージェントの出来が安定しない」を解く AIエージェント

【2026年9月 急上昇ワード】エージェント・ハーネス×論文4選|「同じモデルなのに、エージェントの出来が安定しない」を解く

コーディングエージェントを業務に入れたチームから、「モデルを最新版に替えたのに、思ったほど良くならない」「同じモデルでも、ツールによって結果がまるで違う」という声をよく聞くようになりました。その答えとして、いま arXiv で急に語られ始め...
【2026年最新】LLMの評価×論文4選|「LLM-as-a-Judgeの点数やベンチマークを信じてよいのか」を解く AIニュース

【2026年最新】LLMの評価×論文4選|「LLM-as-a-Judgeの点数やベンチマークを信じてよいのか」を解く

生成AIの回答品質を人手ですべて確かめるのは現実的ではありません。そこで、LLMに採点させる「LLM-as-a-Judge」(LLMを審査員として使い、回答の良し悪しを判定させる手法)が評価の定番になりました。モデル選びでは、公開ベンチマー...
【2026年最新】長文脈とAIの記憶×論文4選|「長い資料ほど見落とす」「前に伝えたことを忘れる」を解く AIニュース

【2026年最新】長文脈とAIの記憶×論文4選|「長い資料ほど見落とす」「前に伝えたことを忘れる」を解く

LLMのコンテキストウィンドウ(1回の処理でモデルに渡せる文章量の上限)は大きく伸び、分厚い資料や大量のログをまるごと渡せるようになりました。過去の会話の内容を覚えておく「メモリ機能」を備えたチャットサービスやエージェントも増えています。と...
【2026年最新】ファインチューニングとプロンプトの使い分け×論文4選|「LoRAで学習させるか、プロンプトで済ませるか」を解く AIニュース

【2026年最新】ファインチューニングとプロンプトの使い分け×論文4選|「LoRAで学習させるか、プロンプトで済ませるか」を解く

LLMを自社の業務に合わせる方法は、大きく2つに分かれます。プロンプトの中に指示や例、資料を入れて振る舞いを変える方法と、モデルそのものを追加で学習させるファインチューニングです。後者では、元の重みを固定したまま小さな追加部分だけを学習する...
【2026年最新】推論時スケーリング(思考の深さと精度)×論文4選|「長く考えさせれば賢くなるのか」を解く AIニュース

【2026年最新】推論時スケーリング(思考の深さと精度)×論文4選|「長く考えさせれば賢くなるのか」を解く

回答する前に長い思考過程を生成してから答える「推論モデル」が普及し、推論時スケーリング(test-time scaling:学習済みのモデルに、回答時により多くの計算をさせて精度を上げる考え方)が注目されています。「じっくり考えさせれば、よ...
【2026年最新】LLMエージェントのセキュリティ×論文4選|「プロンプトインジェクションが怖くて権限を渡せない」を解く AIエージェント

【2026年最新】LLMエージェントのセキュリティ×論文4選|「プロンプトインジェクションが怖くて権限を渡せない」を解く

AIエージェントに、メールの送信やファイルの操作、社内システムへの登録といった「実際に手を動かす権限」を渡す動きが広がっています。それと同時に最大の懸念になっているのが「プロンプトインジェクション」です。Webページやメール、ツールの説明文...
【2026年最新】マルチモーダルAIの文書理解×論文4選|「PDFの表やグラフを読み違える」を解く AIニュース

【2026年最新】マルチモーダルAIの文書理解×論文4選|「PDFの表やグラフを読み違える」を解く

画像と文章を同時に扱えるAI(VLM:Vision-Language Model)が進化し、スキャンしたPDFや帳票、報告書のグラフをそのままAIに読ませる使い方が広がっています。しかし現場では、「本文はよく読めるのに、表の数字やグラフを取...
【2026年最新】LLMの推論コスト削減×論文4選|「APIの請求額が怖い」を解く小型モデル・ルーティング・量子化 AIニュース

【2026年最新】LLMの推論コスト削減×論文4選|「APIの請求額が怖い」を解く小型モデル・ルーティング・量子化

生成AIの業務利用が当たり前になった一方で、多くの現場で問題になり始めているのが「推論コスト」です。推論コストとは、学習済みのモデルに質問を投げて回答を得るたびにかかる費用のことで、API利用料やGPUサーバー代として毎月積み上がっていきま...
【2026年最新】RAG(検索拡張生成)の実務×論文4選|「検索が外れる」「もっともらしい嘘」「評価できない」を解く AIニュース

【2026年最新】RAG(検索拡張生成)の実務×論文4選|「検索が外れる」「もっともらしい嘘」「評価できない」を解く

社内文書やマニュアルをAIに読ませて答えさせる「RAG(Retrieval-Augmented Generation:検索拡張生成)」は、企業のAI活用で広く使われる構成の一つです。RAGとは、質問に関係する文書をまず検索し、その内容を根拠...