【2026年最新】車載・運転支援のオンデバイスAI×論文4選|「クラウドの返事を待っていたら間に合わない」を解く

【2026年最新】車載・運転支援のオンデバイスAI×論文4選|「クラウドの返事を待っていたら間に合わない」を解く AIニュース

自動運転や運転支援に、画像と言葉をまとめて扱える視覚言語モデル(VLM)を使う研究が急速に進んでいます。従来の認識モデルが苦手とする「その場の状況が何を意味するか」まで読み取れる可能性があるからです。

しかし車の中では、クラウドに問い合わせて返事を待つ余裕はありません。トンネルや山間部では通信が途切れますし、判断の遅れはそのまま安全に響きます。とはいえ、車載コンピューターで大きなモデルを動かすと遅く、軽くするために圧縮すると、肝心の危険を見逃すおそれがあります。

この記事では、まず国土交通省の資料をもとに「運転支援と自動運転の違い」「つながる車に求められるサイバーセキュリティとソフトウェア更新のルール」を整理し、そのうえで、車の中でAIを間に合わせる工夫とその限界を扱った論文4本を紹介します。結論を先に言うと、許される時間から逆算して軽量化の方法を選び、速さと見逃しを別々に確かめ、車に載せたモデルの更新もソフトウェア更新として管理するのが基本です!

車載AIの前提:運転支援と自動運転の「レベル」

レベル1・2は運転支援、レベル3以上が自動運転

国土交通省のASV推進検討会は、自動運転のレベルと呼び方を整理しています(2020年2月1日時点)。レベル1はアクセル・ブレーキかハンドルのどちらか、レベル2はその両方が部分的に自動化された状態で、運転操作の主体は運転者です。呼び方は「運転支援車」です。

レベル3は、特定の走行環境条件を満たす限られた領域で、自動運行装置が運転操作の全部を代わりに行う状態です。ただし、正常に作動しないおそれがあるときは警報が出るので、運転者が適切に応じる必要があり、「条件付自動運転車(限定領域)」と呼ばれます。レベル4は同じく限られた領域で運転者の対応が要らない「自動運転車(限定領域)」、レベル5は領域の限定がない「完全自動運転車」です(国土交通省「自動運転車両の呼称」)。

レベル3では「引き継ぐまで車が制御を続ける」

2020年6月、国連の自動車基準調和世界フォーラム(WP29)で、高速道路等の渋滞時などに作動する車線維持の自動運行装置(レベル3)の国際基準が初めて成立しました。国土交通省の概要によると、主な要件は、運転操作の引き継ぎを求める警報を出したあとも運転者に引き継がれるまで制御を続け、引き継がれなければリスク最小化制御で車両を止めること、そして運転者が引き継げる状態かを見張るドライバーモニタリングを載せることなどです(国土交通省「自動運行装置(レベル3)に係る国際基準が初めて成立しました」)。

レベル3では、引き継ぎまでの制御と運転者の見守りを車自身が担うことが求められています。

車の中で考える理由と、つながる車の約束事

なぜ車載で推論するのか:遅延と通信

理由の1つ目は遅延です。時速60kmの車は、推論に0.6秒かかればその間に約10m進みます。クラウドに問い合わせれば通信の往復が加わり、待ち時間もばらつきます。

2つ目は通信が前提にできないことです。国土交通省の「自動運転車の安全技術ガイドライン」(2018年9月)は、自動運転車が地図・交通・信号の情報や遠隔監視、無線でのソフトウェア更新などで通信を使うことを前提に、サイバー攻撃への対策が欠かせないとしています。一方で、自動運転の継続が難しくなったときに車両を安全に止めるMRM(ミニマル・リスク・マヌーバー)の設定も求めています(国土交通省「自動運転車の安全技術ガイドライン」)。通信が途切れたときに運行を続けるか安全に止まるかは、車両の設計と走行条件に応じて決めることになります。

車載コンピューターも強力になり、NVIDIA の自動運転向け DRIVE AGX Thor は INT8 で1,000TOPS超をうたっています(NVIDIA「In-Vehicle Computing」)。端末の中でAIを動かすこと全般はオンデバイスAIの総論の記事で紹介しました。

サイバーセキュリティとソフトウェア更新の国際基準(UN-R155・R156)

レベル3の基準と同じ2020年6月のWP29で、サイバーセキュリティ(協定規則第155号、UN-R155)とソフトウェアアップデート(同第156号、UN-R156)の国際基準も成立しました。国土交通省の概要では、メーカーに、両者の業務管理システムを持つこと、車両のリスクアセスメントと対策の検証試験を行うこと、危険・無効な更新を防ぐなど更新を適切に行うことを求めています。

国内では、国土交通省が2020年12月25日に保安基準を改正し、これらの基準を自動運行装置のない車にも広げました。発表時の適用時期は、無線で更新できる車は新型車が2022年7月1日、継続生産車が2024年7月1日、無線で更新できない車は新型車が2024年1月1日、継続生産車が2026年5月1日で、いずれも2026年10月時点では過ぎています(国土交通省「自動運転技術に関する国際基準等を導入します」、同 別紙)。さらに、通信などでプログラムを書き換えて性能を変える「特定改造等」には国土交通大臣の許可が要る制度が、2020年11月に始まっています(国土交通省「自動車の特定改造等の許可制度を本年11月より開始します」)。

車載AIのモデルの差し替えも、車にとってはソフトウェアの更新です。制度の当てはまり方は個別に確認しつつ、載せたあとの更新まで最初から設計しておきます。

研究で見る「車載の機器で間に合わせる」工夫

📄 論文: 見なくてよいカメラ映像を省いて、VLMを約2.5倍速く

LiteVLM: A Low-Latency Vision-Language Model Inference Pipeline for Resource-Constrained Environments(Jin Huang ほか、2025年6月投稿・10月改訂、arXiv:2506.07416)は、査読前の論文(プレプリント)です。

NVIDIA の研究者らが、車載コンピューター DRIVE Thor の上で2B規模のVLM(InternVL2.5)の応答時間を測った研究です。評価に使ったのは、6台のカメラ映像と質問・回答の組からなる運転データセット(DriveLM)の検証用約1万5千問で、実車を走らせた試験ではありません。工夫は3つで、質問に関係するカメラだけを選ぶ、LLMに渡す画像のトークンを絞る、小さな下書き用モデルの候補をまとめて確かめる(投機的デコーディング)、です。

結果、総合スコアをほぼ保ったまま(0.6618→0.6602)、1問あたりの遅延が約530ミリ秒から約214ミリ秒になり、表では2.5倍の短縮でした(本文の別の箇所では2.4倍と書かれています)。FP8の量子化を加えると3.2倍まで縮みましたが、スコアは0.6450に下がり、著者らも精度がわずかに落ちると書いています。運営者にとっての意味は、「全カメラを毎回見る」前提を見直すだけで大きく速くなる一方、量子化の上乗せは精度と引き換えになるということです。

📄 論文: カーナビの先読みで「どこまで考えるか」を決める

Nav-EE: Navigation-Guided Early Exiting for Efficient Vision-Language Models in Autonomous Driving(Haibo Hu ほか、2025年10月投稿・同月改訂、arXiv:2510.01795)は、査読前の論文(プレプリント)です。

VLMの計算を途中の層で打ち切る「早期終了」は、打ち切ってよい層が作業ごとに違います。この論文は、カーナビや高精度地図なら「この先に信号がある」と前もって分かる点に着目しました。作業ごとに、全層と同じ正答率が出る最も浅い層を事前に調べておき、走行中は地図の情報に応じて切り替えます。歩行者・車両・動物の認識(CODA、Waymo)と信号の状態の判定(Bosch)で、LLaVA-7B など3つのモデルを試しました。

データセットでの評価では、遅延の短縮は LLaVA-7B の車両認識で最大63.9%でしたが、DeepSeek-VL2 の2モデルでは平均で約2割にとどまります。RTX 3090 を積んだ実験車(Autoware.Universe)では、車両認識の推論が0.608秒から0.295秒に半減した一方、信号の判定は0.611秒から0.486秒と約2割の短縮でした。実車では遅延だけを表にしており、正答率の比較はありません。データセットでは打ち切ったほうが正答率が上がったと報告していますが、層の選び方と評価データの関係は本文から読み切れません。運営者にとっての意味は、走行状況という車ならではの手がかりで計算を減らせる一方、効き方は作業ごとに大きく違うということです。

速さの裏で見落としやすいもの

📄 論文: 「見張り役」のVLMは、量子化の方式と入力の形で見逃しが急増する

A Semantic Observer Layer for Autonomous Vehicles: Pre-Deployment Feasibility Study of VLMs for Low-Latency Anomaly Detection(Kunal Runwal ほか、2026年3月、arXiv:2603.28888)は、査読前の論文(プレプリント)です。

運転制御とは別に、量子化したVLM(Cosmos-Reason1-7B)を1秒に1〜2回並走させ、想定外の危険を見つけたら安全側の仕組みへ引き継ぐ「見張り役」の層の実現性を検討しました。計測はすべて公開データセットと、机上のGPU(RTX 5090)で行っており、車載機器や実車での検証は今後の課題とされています。4ビットのNVFP4方式と高速な注意機構(FlashAttention2)の併用で1回約500ミリ秒としますが、比べた相手は同じGPUで高速化なしの約25秒の構成です。

注目すべきは量子化の結果です。路面の損傷画像(静止画)では、4ビットのNF4方式がINT8より良い成績でした。ところが運転映像(英国の運転免許試験用の危険予測動画224本)を5秒の窓で2秒ずつずらして判定させると、NF4では危険を拾えた割合(再現率)が10.6%に崩れ、量子化しないBF16(77.3%)を大きく下回りました。著者らは映像でのNF4の使用を禁じ、BF16でも安全目標の再現率90%に届かないため単独の安全層にしないよう述べています。運営者にとっての意味は、量子化の評価は「静止画で良かった」では済まず、実際の入力の形で見逃しを測る必要があるということです。

📄 論文: 安価な小型ボードで、運転者の脇見や居眠りを見守る

Real-Time In-Cabin Driver Behavior Recognition on Low-Cost Edge Hardware(Vesal Ahsani ほか、2025年12月投稿・2026年1月改訂、arXiv:2512.22298)は、査読前の論文(プレプリント)です。

レベル3の要件にもあるドライバーモニタリングを、カメラ1台と安価なボードで実現した研究です。対象は通話・飲食・脇見・居眠りなど17種類の行動で、使用許諾を得たデータと自前の収録を合わせた80万コマ超の画像で学習・評価しました。機器は、CPUだけの Raspberry Pi 5 と、推論用のアクセラレーター(Edge TPU)を持つ Google Coral の開発ボードです。いずれも8ビット整数(INT8)で動かし、実車の中で撮影から警告の判定までを通して測りました。

結果は Raspberry Pi 5 で1秒約16コマ(1コマ60ミリ秒未満)、Coral で約25コマ(約40ミリ秒)でした。似た動作を別の分類にするラベル設計と、「確信度が高く一定時間続いたときだけ警告する」判定で誤報を抑えています。ただし、実車での試験は処理速度と警告の安定ぶりを定性的に確かめたもので、路上での本格的な性能評価ではないと著者ら自身が断っています。運営者にとっての意味は、見守りなら高価な車載コンピューターでなくても間に合う一方、誤報と見逃しの評価は別に要るということです。

現場でやること

用途ごとに「許される時間」を先に決める

許される遅延は用途で違い、見張り役の論文は1秒に1〜2回、見守りの論文は1秒に15〜25コマを目安にしていました。「何倍速くなったか」ではなく、「その用途の時間の枠に、ばらつきも含めて収まるか」で判断します。

量子化は「速さ」と「見逃し」を別々に測る

  • 量子化の前後で、平均の精度だけでなく危険を拾えた割合(再現率)を比べる
  • 静止画と映像のように、実際の入力の形で評価する
  • 方式(INT8、FP8、NF4など)ごとに、速さと見逃しの両方を表にする

測った条件を書き残す

論文の数値は、データセットか実車か、机上のGPUか車載機器かで意味が変わります。自分の評価でも、機器・データ・比較対象を記録しましょう。

載せたモデルの更新も管理する

UN-R155・R156を受けた国内の基準や許可制度のもとで、モデルの差し替えにどの手続きが要るかを開発の初期に確認し、更新の記録と検証の手順を決めておきます。医療機器のように規制のある分野での考え方は、医療・臨床のオンデバイスAIの記事も参考になります。

車載・運転支援のオンデバイスAIの鍵は次の3点です

  1. 許される時間から逆算して、モデルと軽量化の方法を選ぶ
    用途ごとに時間の枠を決め、入力の絞り込みや早期終了など、車ならではの情報で無駄な計算を減らします。
  2. 量子化は「速さ」と「見逃し」の両方で評価する
    同じ4ビットでも、方式と入力の形によって再現率が崩れることがあります。実際の入力で危険を拾えているかを確かめます。
  3. 載せたあとの更新まで含めて設計する
    車載のモデルもソフトウェア更新の対象です。サイバーセキュリティと更新の管理の仕組みを最初から組み込みます。

まとめ:車載AIは「大きなモデルを載せる」から「時間の枠に収めて安全を確かめる」へ!

レベル3では引き継ぎまでの制御と運転者の見守りが車に求められ、サイバーセキュリティとソフトウェア更新の国際基準も国内の保安基準に取り入れられています。今回の論文は、映像の取捨選択やナビ情報を使った早期終了で大きく速くできること、安価なボードでも見守りが間に合うことを示しました。一方で、量子化が見逃しを増やすことや、多くの数値が実車以外で測られていることにも注意が要ります。

車載AIを検討している方は、まず「この機能は何ミリ秒以内に、何を見逃してはいけないか」を書き出すところから始めてみてください!

参考文献

2026-10-01 更新: 構成を見直し、論文へのリンクと参考文献を追加し、車載VLMの高速化での量子化による精度の低下、見張り役のVLMの計測条件と量子化による見逃しの条件、ナビ情報を使った早期終了の実車での遅延、車室内の見守りの実車試験の範囲の記述の誤りを修正しました

タイトルとURLをコピーしました