AIニュース

【2026年最新】速く・型付きで判断するAI「Jev」×論文8選|「LLMの判断は遅いし、自信の数字も当てにならない」を解く AIニュース

【2026年最新】速く・型付きで判断するAI「Jev」×論文8選|「LLMの判断は遅いし、自信の数字も当てにならない」を解く

問い合わせの振り分け、書類からの項目の抜き出し、不審なアクセスかどうかの判定。こうした「選択肢の中から1つを選ぶ」判断をLLMに任せたいと考えたとき、つまずきがちなのが速さと扱いやすさです。LLMは文章を1語ずつ書き出すので、返事が来るまで...
【2026年最新】車載・運転支援のオンデバイスAI×論文4選|「クラウドの返事を待っていたら間に合わない」を解く AIニュース

【2026年最新】車載・運転支援のオンデバイスAI×論文4選|「クラウドの返事を待っていたら間に合わない」を解く

自動運転や運転支援に、画像と言葉をまとめて扱える視覚言語モデル(VLM)を使う研究が急速に進んでいます。従来の認識モデルが苦手とする「その場の状況が何を意味するか」まで読み取れる可能性があるからです。しかし車の中では、クラウドに問い合わせて...
【2026年最新】医療・臨床現場のオンデバイスAI×論文4選|「患者データを院外に出せない」を解く AIニュース

【2026年最新】医療・臨床現場のオンデバイスAI×論文4選|「患者データを院外に出せない」を解く

診察中の会話の記録、カンファレンスの議事録、カルテの略語の読み解き。医療現場にも、生成AIに任せたい作業はたくさんあります。一方で、患者の診療情報は最も機微な個人情報の一つです。外部のクラウドへ送ること自体を院内の規程で認めていない、という...
【2026年最新】オンデバイスAI(エッジ推論)×論文4選|「スマホや端末の中でLLMは使い物になるのか」を解く AIニュース

【2026年最新】オンデバイスAI(エッジ推論)×論文4選|「スマホや端末の中でLLMは使い物になるのか」を解く

クラウドにデータを送らず、スマートフォンやPCなどの端末の中でLLMを動かす「オンデバイスAI」への期待が高まっています。個人情報を外に出さずに済み、通信が不安定な場所でも使え、クラウドの利用料も抑えられる、というのが主な理由です。しかし現...
【週刊論文ウォッチ 9/21〜9/27】コーディングエージェントの続報と、今週の新語「音響グラウンディング」 AIエージェント

【週刊論文ウォッチ 9/21〜9/27】コーディングエージェントの続報と、今週の新語「音響グラウンディング」

毎週、arXiv の cs.SE(ソフトウェア工学)・cs.CR(セキュリティ)・cs.CL(自然言語処理)に投稿された論文をすべて読み、2 つの観点で拾います。1 つは、月次の「急上昇ワード」で取り上げたテーマのその後。もう 1 つは、こ...
【2026年最新】ハルシネーションの検出と抑制×論文4選|「分からないのに自信満々で答える」を解く AIニュース

【2026年最新】ハルシネーションの検出と抑制×論文4選|「分からないのに自信満々で答える」を解く

LLMが、もっともらしいけれど誤った内容を生成してしまう「ハルシネーション」。社内文書などの根拠を検索して渡すRAGは有力な対策ですが、根拠となる資料が存在しない質問や、資料に答えが書かれていない場面では、AIが推測で答えてしまう問題が残り...
【2026年最新】学習データの合成×論文4選|「データが足りない」「AIが作ったデータで劣化しないか」を解く AIニュース

【2026年最新】学習データの合成×論文4選|「データが足りない」「AIが作ったデータで劣化しないか」を解く

自社向けにモデルを調整したくても、肝心の学習データが足りない。そんなときの定番になっているのが、LLMに学習用のデータを作らせる「合成データ」です。しかし現場では、「作らせると似たようなデータばかりになる」「合成データで学習を繰り返したら性...
【2026年最新】マルチエージェントの協調×論文4選|「エージェントを増やしたのに精度が上がらない」を解く AIエージェント

【2026年最新】マルチエージェントの協調×論文4選|「エージェントを増やしたのに精度が上がらない」を解く

計画役・実行役・レビュー役のように、複数のAIエージェントに役割を分担させる「マルチエージェント」構成が人気を集めています。人間のチームのように分業させれば、より難しい仕事もこなせるはずだという期待があります。ところが現場では、「エージェン...
【2026年9月 急上昇ワード】エージェント・ハーネス×論文4選|「同じモデルなのに、エージェントの出来が安定しない」を解く AIエージェント

【2026年9月 急上昇ワード】エージェント・ハーネス×論文4選|「同じモデルなのに、エージェントの出来が安定しない」を解く

コーディングエージェントを業務に入れたチームから、「モデルを最新版に替えたのに、思ったほど良くならない」「同じモデルでも、ツールによって結果がまるで違う」という声をよく聞くようになりました。その答えとして、いま arXiv で急に語られ始め...
【2026年最新】LLMの評価×論文4選|「LLM-as-a-Judgeの点数やベンチマークを信じてよいのか」を解く AIニュース

【2026年最新】LLMの評価×論文4選|「LLM-as-a-Judgeの点数やベンチマークを信じてよいのか」を解く

生成AIの回答品質を人手ですべて確かめるのは現実的ではありません。そこで、LLMに採点させる「LLM-as-a-Judge」(LLMを審査員として使い、回答の良し悪しを判定させる手法)が評価の定番になりました。モデル選びでは、公開ベンチマー...