【2026年最新】速く・型付きで判断するAI「Jev」×論文8選|「LLMの判断は遅いし、自信の数字も当てにならない」を解く

【2026年最新】速く・型付きで判断するAI「Jev」×論文8選|「LLMの判断は遅いし、自信の数字も当てにならない」を解く AIニュース

問い合わせの振り分け、書類からの項目の抜き出し、不審なアクセスかどうかの判定。こうした「選択肢の中から1つを選ぶ」判断をLLMに任せたいと考えたとき、つまずきがちなのが速さと扱いやすさです。LLMは文章を1語ずつ書き出すので、返事が来るまでに数秒かかることもあります。返ってきた文章から答えを取り出す処理を書いても、ときどき想定外の書き方で返ってきて、プログラムが止まってしまいます。

さらに厄介なのが自信の扱いです。「確信度は90%です」と答えさせても、その数字がどこまで当てになるのかは分かりません。95%の確率で正しく判断できるAIでも、残りの5%がどれなのかを教えてくれなければ、人が確認すべき回答を選べず、自動化には踏み切れません。

2026年9月15日、スタートアップの TypeSafe AI が、この悩みに正面から挑む新しい種類のモデル「System One Model」と、その最初の公開モデル「Jev」を発表しました。この記事では、発表の要点を整理したうえで、Jev の考え方につながる研究論文8本を紹介します。なお、筆者が確認した範囲(2026年10月6日時点)では TypeSafe 自身は Jev の論文を公開していないので、ここで紹介するのは「Jev の仕組みそのもの」ではなく、同じ問題に取り組んできた研究の流れです。結論を先に言うと、速く型どおりに答えることと、判断が正しいことは別の話で、自信の数字は自分の使い方で確かめてから使うのが基本です!

Jev とは何か:文章を書かずに「型付きの判断」だけを返すモデル

発表の要点

TypeSafe の発表によれば、Jev は「構造化されていない状態(文章など)を入力し、型の決まった確率付きの判断を出力する」モデルです。同社はこれを「最先端の知能を持った関数呼び出し」と表現しています。使う側は、あらかじめ「どんな質問に、どの選択肢で答えるか」というスキーマ(出力の型の定義)を決めておき、そこへ文章やプログラムの状態を渡します。Jev は、スキーマで決めた値のいずれかを、確率と確信度を添えて返します(TypeSafe AI「Introducing System One Models & Jev」)。

発表の中で、既存のLLMとの違いは次のように整理されています。

項目既存のLLMJev(同社の説明)
出力自由な文章。使うには解析と検証が要るあらかじめ決めた型の値。確率と確信度が必ず付く
生成のしかた1トークンずつ、前の出力を受けて順番にすべての出力を1回の問い合わせで並列に
学習で最適化するもの人の好み(RLHF)や機械で検証できる正解(RLVR)較正された判断(RLCD)
応答時間最先端モデルで3〜329秒70〜500ミリ秒

RLCD(Reinforcement Learning for Calibrated Decisions)は同社が名付けた学習法で、「確信度が高いほど正答率も高い」という正直な確率を出すことを目標にしているといいます。名前の由来は、心理学者ダニエル・カーネマンの『ファスト&スロー』です。速く直感的な「システム1」と、遅く熟考する「システム2」の区別から、速い判断に特化したモデルを System One Model と呼んでいます。Jev は現在、早期アクセス(順番待ちの開発者に順次開放)の段階です。

「ハルシネーションしない」の意味に注意

発表では、Jev は「ハルシネーションできない」とうたっています。ただし、その根拠は「スキーマと一致することが保証されているので型の誤りが起きない」という点で、同社も比較グラフの注記で、自社の数字は実測ではなくスキーマとの一致が保証されているから0%と書き込んだものだと説明しています。つまりここでの「ハルシネーションしない」は、決めた選択肢の外の値を返さないという意味です。選んだ選択肢が正しいかどうかの保証ではありません。

数字はベンダー自身の主張

速さやコストの数字は、いずれも TypeSafe 自身の主張です。同社のトップページにある「193.6倍速く、444.6倍安い」は、同社が作った業務フロー型の評価から来ていて、同社自身が「現実の効果としては高めの値だろう」と注記しています。この評価の正解は GPT-6 Astra と Fable 5.1 の答えの平均で、評価の中身を作ったのも同社のチームなので、偏りがありうることも認めています。公開ベンチマークでの成績は意図的に公開していません。速度の計測は、同社のサービスがある米国西海岸からノートPCで行ったものです。

第三者による検証も出始めている

発表から3週間ほどで、TypeSafe 以外の研究者による評価も公開され始めました。いずれも査読前の論文(プレプリント)や個人の測定で、結論はまだ固まっていませんが、ベンダーの主張と見比べる材料になります。

  • 政治学の文章分類での比較: 政治学の研究で行われた文章の分類・尺度づけ7件を再現した評価(JEV versus LLMs: Accuracy, Cost and Calibration on Seven Political Science Replications、Matthew DiGiuseppe ほか、2026年10月、arXiv:2610.06625)では、Jev は比較したLLMと同等か、それに近い性能でした。一方で、OpenAI のバッチ料金で使う GPT-6 Luna と比べてコストの優位は見られず、確率の較正は GPT-6 Luna より良いものの、公開モデルの Qwen3.8-27B より一貫して良いとは言えませんでした。著者らは、速さが必要でなければ、はっきりした利点は選択肢ごとの確率を取り出しやすいことくらいだと結論づけています
  • AIの不具合の検出: 迎合、ジェイルブレイク、プロンプトインジェクションなど10種類の「AIの振る舞いの不具合」を Jev で検出させた評価(Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures、Ruoqi Guo ほか、2026年9月、arXiv:2609.29429)では、汎用の質問1つだけで、44のベンチマークの中央値で AUROC 0.886(見分ける力を0.5〜1で表す指標で、1に近いほどよい)を追加学習なしで達成し、LLMに採点させる方式の63分の1のコストだったと報告しています
  • 個人による独立の測定: GitHub で公開されている個人の評価(PriorBench「Jev」。2026年9月20日に欧州から OpenRouter 経由で計測)では、応答時間に約430ミリ秒の下限がありました(中継の影響かどうかは未切り分け)。また、Jev はどの選択肢にも当てはまらない入力でも必ずどれかを選び、「該当なし」の選択肢を用意しないと、範囲外の問い合わせ30件のうち範囲外と判定されたものは0件で、確信度は0.99だったと報告しています。本人も「一晩で行った広く浅い測定」と断っています

それでも、この発表は「文章を書かせる」以外のAIの使い方を考えるきっかけになります。ここからは、Jev の特徴を「並列に出す」「確信度」「型で縛る」「速い判断と遅い推論」「安全の判定」の5つに分け、それぞれにつながる論文を見ていきます。

非自己回帰の系譜:1語ずつ書かずに、まとめて出す

いまのLLMは、前に出した語を手がかりに次の語を1つずつ決めていく「自己回帰」という方式で文章を作ります。Jev の発表にある「並列に出す」は、この方式をやめるという意味です。この発想自体は新しいものではなく、機械翻訳の研究で早くから試されてきました。

📄 論文: 翻訳を1語ずつではなく、まとめて出す

Non-Autoregressive Neural Machine Translation(Jiatao Gu ほか、2017年11月、arXiv:1711.02281)は、ICLR 2018 採録の論文です。

それまでのニューラル機械翻訳は、出力する語のそれぞれを、それより前に出した語に条件づけて決めていました。この論文は、その依存をなくして訳文の語を並列に出すモデルを提案し、推論の待ち時間を1桁小さくできるとしています。並列に出すと語どうしのつながりが崩れやすくなるため、自己回帰型の翻訳モデルを先生にした知識の蒸留、入力の各語が訳文で何語に対応するか(fertility)を隠れた変数として扱う工夫、強化学習による仕上げを組み合わせました。

IWSLT 2016 の英独翻訳と WMT の2つの言語の組で評価し、先生役のモデルとの差を最小で BLEU 2.0 ポイントに抑えたと報告しています。現場にとっての意味は、「まとめて出す」と速くなる代わりに、出力どうしの整合をどう保つかが課題になるということです。Jev が自由な文章を手放し、決まった型の値だけを返す設計にしたのは、この課題を避ける1つの割り切り方と読むこともできます。

確信度をどこまで信じてよいか

Jev の売りの1つは「較正された確率」です。較正(キャリブレーション)とは、AIが出す確信度が実際に正しい確率と一致していることを指します。「80%」と言った回答を集めると、実際に8割が正しい、という状態です。

📄 論文: 精度の高い最新のモデルほど、自信過剰になっていた

On Calibration of Modern Neural Networks(Chuan Guo ほか、2017年6月、arXiv:1706.04599)は、ICML 2017 採録の論文です。

著者らは、10年前のニューラルネットワークと違い、最新のネットワークは較正が悪いことを見つけました。本文の例では、画像分類のデータ CIFAR-100 で、5層の LeNet は平均の確信度が正答率とほぼ一致していたのに対し、110層の ResNet は正答率がより高い一方で、平均の確信度が正答率を大きく上回っていました。ネットワークの深さや幅、重み減衰、バッチ正規化といった要素が較正に影響することも、実験で示しています。

対策として、学習後に確率を補正する方法を画像と文書の分類で比べ、ほとんどのデータでは、1つの数値(温度)で出力を割るだけの「温度スケーリング」が驚くほど効くと報告しています。この補正には学習に使っていない検証用データを使います。現場にとっての意味は、精度が高いことと、確信度が当てになることは別で、確信度は手元のデータで測って補正するものだということです。

📄 論文: LLMは自分が答えられるかを(だいたい)分かっている

Language Models (Mostly) Know What They Know(Saurav Kadavath ほか、2022年7月、arXiv:2207.05221)は、査読前の論文(プレプリント)です。

LLMが自分の答えの正しさを評価できるか、どの質問に正しく答えられそうかを予測できるかを調べた研究です。まず、大きなモデルは、多肢選択や正誤を問う多様な問題で、適切な形式で問われれば較正がよいことを示しました。そこで、自由に答える問題では、まず答えを出させ、次に「その答えが正しい確率」を評価させる方法を試し、よい性能と較正が得られたとしています。自分の答えを複数出させてから判断させると、さらに改善しました。

一方、答えを出す前に「この質問の答えを知っている確率」を予測するよう学習させると、予測自体はよくできて、別の課題にもある程度は通用しましたが、新しい課題では較正が崩れやすいことも報告しています。現場にとっての意味は、確信度は「問い方」と「課題の種類」で当てになる度合いが変わるということです。Jev の確信度も、自社の課題で確かめるまでは参考値として扱うのが安全です。自信の数字との付き合い方は、ハルシネーションの検出と抑制の記事でも詳しく扱っています。

出力を型で縛る:決まった形でしか答えさせない

「決まった選択肢の外の値を返さない」ことは、実は既存のLLMでも、生成の仕方を工夫すれば実現できます。その代表的な方法と、反対側の知見を見てみましょう。

📄 論文: 文章の生成を「状態の移り変わり」として捉え直す

Efficient Guided Generation for Large Language Models(Brandon T. Willard ほか、2023年7月、arXiv:2307.09702)は、査読前の論文(プレプリント)です。

この論文は、LLMの文章生成を、有限状態機械(決められた状態の間を規則どおりに移っていく仕組み)の状態の移り変わりとして捉え直しました。そのうえで、正規表現や文脈自由文法で決めた形に沿うよう生成を導くために、モデルの語彙に対する索引をあらかじめ作っておく方法を示しています。生成の各段階で「次に出してよい語」をすぐに引けるので、余分な負荷はわずかで、既存の方法を大きく上回る効率だとしています。

特定のモデルに依存せず、生成される文章の構造を保証できるため、ソフトウェアとの信頼できる接点を作れる、というのが著者らの主張です。実装はオープンソースのライブラリ Outlines として公開されています。現場にとっての意味は、「型どおりに出す」こと自体は、モデルを替えなくても生成の制約で実現できるということです。Jev との違いは速さと確率の出し方にあり、型の保証だけなら既存の選択肢もあります。

📄 論文: 形式を厳しく縛ると、推論の力が落ちることがある

Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models(Zhi Rui Tam ほか、2024年8月、arXiv:2408.02442)は、EMNLP 2024 Industry Track 採録の論文です(ACL Anthology)。

JSON や XML のような決まった形式で答えさせると、LLMの能力に影響が出るのかを調べた研究です。さまざまな課題で、形式を指定した場合と自由に答えさせた場合を比べたところ、形式を縛ると推論の力がはっきり落ち、縛りが厳しいほど落ち方が大きい傾向が見られました。本文では、この差は答えの取り出しの失敗が主な原因ではないことも確かめています。ある設定では、取り出しの失敗が0.148%しかないのに、正答率に38.15ポイントの差がありました。

一方で、選択肢から選ぶ分類の課題では傾向が違いました。生成を JSON に縛るモードは、ほかの方法と互角か、上回る場合もありました。著者らは、答えの候補が絞られることで選び間違いが減るのではないかと考えています。現場にとっての意味は、型で縛るのは分類のような判断には向くが、考える過程が要る課題では力を削ぐことがあるということです。Jev が自らを「システム1の課題」向けと位置づけているのは、この線引きと重なります。

速い判断と遅い推論の組み合わせ

Jev のように速い判断に特化したモデルがあっても、難しい問題では時間をかけて考えるモデルが要ります。両者をどう組み合わせるかという問いに、1つのモデルの中で答えようとした研究があります。

📄 論文: 1つのモデルで「速く答える」と「じっくり考える」を切り替える

Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces(DiJia Su ほか、2024年10月、arXiv:2410.09918)は、ICLR 2025 採録の論文です(ICLR Proceedings)。

この論文も、カーネマンのシステム1とシステム2の区別を出発点にしています。LLMには、答えだけを出す「速いモード」と、推論の過程と答えの両方を出す「遅いモード」があると捉え、その両方を1つの Transformer で扱えるようにしました。学習のときに推論の過程の一部をわざと抜き取ったデータを使うのが工夫で、使うときに速いモード・遅いモードを指定することも、モデル自身にどちらを使うか決めさせることもできます。

30×30 の迷路の課題では、遅いモードで最適な解を出せた割合が97.6%で、推論の過程をすべて学習した比較対象(93.3%)を上回りつつ、推論の手数を45.5%減らしました。速いモードでも80%で、答えだけを学習したモデルの30%を大きく上回っています。数学の問題でも、LLMの追加学習に応用して改善が見られたとしています。現場にとっての意味は、速い判断と遅い推論は二者択一ではなく、問題に応じて使い分ける設計がありうるということです。実務では、確信度の高い判断は速いモデルに任せ、低いものだけを時間のかかるモデルや人に回す、という組み合わせが考えられます。

セキュリティの視点:速く・型付きで・確信度付きの判断をどう使うか

TypeSafe は、Jev の用途の1つに、LLMの入力・推論・出力の採点や、ガードレール、ジェイルブレイク(安全対策の回避)の検出を挙げています。セキュリティの判定は、まさに「決まった選択肢から速く選ぶ」判断です。ここでは、安全の判定と「答えを控える」判断の研究を見てみます。

📄 論文: LLMの入力と出力を、分類用のLLMで判定する

Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations(Hakan Inan ほか、2023年12月、arXiv:2312.06674)は、査読前の論文(プレプリント)です。

人とAIの会話の安全を守るために、利用者の入力(プロンプト)とLLMの応答の両方を、安全上のリスクの分類表に沿って判定するモデルを作った研究です。Llama 2 の7B モデルを、集めた高品質なデータで指示追従の追加学習をして作りました。データの量は多くないものの、OpenAI Moderation Evaluation や ToxicChat といった既存のベンチマークで、既存のコンテンツ審査ツールと同等以上の性能を示したとしています。

このモデルは言語モデルとして動き、複数の分類を行いながら、二値の判定スコアも出します。指示で分類表の項目を差し替えたり、出力の形式を変えたりできるので、用途に合わせた調整がしやすいのも特徴です。現場にとっての意味は、安全の判定は「自由な文章」ではなく「決めた分類表に沿った分類」として作ると扱いやすいということです。Jev がうたう用途は、こうした判定を速く行う方向の延長線上にあると言えます。LLMを使うシステム全体のセキュリティについては、LLMエージェントのセキュリティの記事も参考にしてください。

📄 論文: 「誤りの率」を先に決めて、それを守れるときだけ答える

Selective Classification for Deep Neural Networks(Yonatan Geifman ほか、2017年5月、arXiv:1705.08500)は、NIPS 2017 採録の論文です(NeurIPS Proceedings)。

選択的分類(reject option)とは、自信のない入力には答えず保留することで、答えた分の正確さを高める考え方です。この論文は、学習済みのニューラルネットワークから選択的な分類器を作る方法を提案しました。利用者が「許容する誤りの率」を先に決めると、その率を高い確率で守れるように、答えずに保留する入力を選びます。

CIFAR と ImageNet で評価し、たとえば ImageNet の上位5候補の分類で、誤り率2%を99.9%の確率で保証しつつ、テストデータのおよそ6割に答えられたと報告しています。現場にとっての意味は、確信度は「答えるか、保留して人に回すか」を決めるための道具で、そのしきい値は守りたい誤りの率から逆算できるということです。

WAF のような判断への応用は考えられるか

Webサイトを攻撃から守る WAF(Web アプリケーションファイアウォール)は、届いたリクエストを「通す」「止める」「記録して様子を見る」のいずれかに振り分ける仕組みです。決まった選択肢から選ぶ判断であり、速さが求められる点でも、Jev のようなモデルの考え方と相性がよさそうに見えます。ただし、実際に使うには次の点を考える必要があります。

  • 速さの桁: 70〜500ミリ秒は LLM と比べれば速いものの、Webのアクセス1件ごとに外部の判定を挟むには重い場合があります。すべてを判定させるより、従来の規則で判断がつかないものだけを回す使い方が現実的です
  • 確信度の検証: 確信度が当てになるかは、自社のアクセスで測るまで分かりません。Guo らや Kadavath らの結果が示すように、課題や条件が変わると較正は崩れえます
  • 保留の設計: Geifman らの考え方のように、許容する誤検知・見逃しの率を先に決め、確信度が低いものは人の確認や遅い判定に回します
  • 範囲外の入力: 第三者の測定のとおり、決めた選択肢の中から必ず1つを選ぶ仕組みでは、想定外の入力も何かに分類されます。「該当なし」「判断できない」を選択肢に入れておく必要があります
  • 攻撃者がいる前提: 攻撃者は判定をすり抜ける入力を工夫してきます。「型どおりに答える」ことは、判定をだまされないことを意味しません
  • データの送り先: アクセスの内容を外部のサービスに送ることになるため、個人情報や秘密情報の扱いを確認する必要があります

「型付きの判断」を使いこなす鍵は次の3点です

  1. 「型どおり」と「正しい」を分けて考える
    スキーマの外の値を返さないことは、判断が正しいことの保証ではありません。正しさは自分の課題で別に測ります。
  2. 確信度は、自分のデータで較正を確かめてから使う
    確信度が高いほど正答率も高いかを手元のデータで確かめ、問い方や課題が変わったら測り直します。
  3. 確信度の低い判断の行き先を決めておく
    許容する誤りの率からしきい値を決め、それを下回る判断は人や時間をかけて考えるモデルに回します。

まとめ:速いAIの数字は、自分の課題で確かめよう!

TypeSafe の Jev は、文章を書くことをやめ、決めた型の値を確率付きで速く返すという、LLMとは違う方向を打ち出したモデルです。その考え方は、並列に出力する機械翻訳、確信度の較正、出力を型で縛る生成、速い判断と遅い推論の使い分け、安全の判定と保留の設計といった、これまでの研究の流れと重なっています。

一方で、Jev の速さやコスト、確信度の正直さは、現時点ではベンダー自身の主張で、評価の方法も同社が作ったものです。第三者による検証は始まったばかりで、筆者が確認した範囲では、査読を経た評価も、TypeSafe 自身による Jev の論文もまだ見当たりません。速く型どおりに答えるAIが自分の業務で使えるかどうかは、自分の課題で正答率と確信度を測って初めて分かります。数字に飛びつかず、まずは小さく試して確かめてみてください!

参考文献

タイトルとURLをコピーしました