【2026年最新】医療・臨床現場のオンデバイスAI×論文4選|「患者データを院外に出せない」を解く

【2026年最新】医療・臨床現場のオンデバイスAI×論文4選|「患者データを院外に出せない」を解く AIニュース

診察中の会話の記録、カンファレンスの議事録、カルテの略語の読み解き。医療現場にも、生成AIに任せたい作業はたくさんあります。一方で、患者の診療情報は最も機微な個人情報の一つです。外部のクラウドへ送ること自体を院内の規程で認めていない、というケースも少なくありません。そこで注目されているのが、院内の端末や機器の中だけでAIを動かす「オンデバイスAI」です。

しかし現場からは、「端末に載る小さなモデルで医療の文章を扱えるのか」「院内の古いスマホやタブレットでも動くのか」「AIが事実と違うことを書いたら、誰が気づくのか」といった声が上がります。データを外に出さない代わりに、性能と安全性の確認は自分たちで引き受けることになります。

この記事では、まず公的機関の資料をもとに「医療機関は患者情報をどう扱うことになっているか」「AIのプログラムが医療機器に当たるのはどんな場合か」を整理し、そのうえで医療データを院内に閉じたままAIを動かすことを試した論文4本を紹介します。結論を先に言うと、ルール上の位置づけを先に確かめ、端末も医療情報システムの一部として管理し、論文の数字は「何を・どの機器で測ったか」まで読んで自分たちで測り直すのが基本です!

医療機関が患者情報を扱うときのルール

ここでは公的資料に書かれている範囲で整理します。個々のケースの扱いは、各機関の規程や専門家の判断によります。

診療情報は「要配慮個人情報」に当たりうる

個人情報保護法には、不当な差別や偏見が生じないよう特に配慮が必要な要配慮個人情報という区分があり、病歴や、医師などが行った健康診断・検査の結果、診療や調剤が行われたことなどが含まれます。取得や第三者提供には原則として本人の同意が必要で、それを含む個人データの漏えい(おそれを含む)は、高度な暗号化などの保護措置を講じた場合を除き、委員会への報告の対象とされています(個人情報保護委員会「個人情報の保護に関する法律についてのガイドライン(通則編)」 2-3)。

医療機関向けのガイダンスは、診療録などに記載された病歴や、診療の過程で医療従事者が知り得た診療情報などを、医療機関で想定される要配慮個人情報の例に挙げています。個人データの取り扱いを外部に委託する場合は、委託先を適切に監督する必要があるとも書かれています(個人情報保護委員会・厚生労働省「医療・介護関係事業者における個人情報の適切な取扱いのためのガイダンス」)。

安全管理ガイドラインは第7.0版が最新

医療機関の情報システムの安全管理については、厚生労働省の「医療情報システムの安全管理に関するガイドライン」があり、2026年10月時点の最新版は第7.0版(令和8年6月)です(厚生労働省「医療情報システムの安全管理に関するガイドライン 第7.0版」)。オンデバイスAIに関係しそうな点は次のとおりです。

  • 対象は医療情報を扱う情報システム全般で、事業者が提供するものだけでなく、医療機関が自ら開発・構築したシステムも含む
  • 「サーバ」は医療情報の保存や主要な処理を担う機器を指し、原則としてPCやタブレットなどの端末は含まないが、電子カルテのアプリなどを端末に入れてその機器の上で処理が完結する場合は、その端末も「サーバ」に含むとされている
  • 医療情報を入れた端末を持ち出すときは、記録媒体の暗号化、起動パスワード、目的から見て不要なアプリを入れないことなどが求められ、管理されていない私物端末の利用(BYOD)は許可してはならない

(概説編 2.3・図3-1、システム運用編 7.1・8.5)

またQ&Aは、外部と遮断した環境でも持ち込み媒体や保守接続、脆弱性のリスクは残るため、更新・マルウェア対策・監視などが必要だとしています(システム運用編 Q16)。

一方で、同じガイドラインはクラウドを禁じてはいません。適切な外部保存はセキュリティを高める安全管理策の一つで、専任の担当者がいない小規模な医療機関などでは、適切なクラウドサービスの利用が望ましいとしています(概説編 4.7)。同じQ&A(令和8年9月)は、生成AIサービスに医療情報を入力する場合、情報が保存されないことが契約などで担保されていれば、国内法の適用を受けないサーバも利用できるとしています(企画管理編 Q18)。つまり「院外に出せない」は法令の一律の禁止というより、各機関の判断と規程による部分が大きいと読めます。オンデバイスAIは、その条件を満たすための選択肢の一つです。

AIのプログラムが「医療機器」になるのはどんなときか

厚生労働省のガイドラインでは、医療機器としての目的を持ち、意図どおりに動かないと生命や健康に影響を与えるおそれのあるプログラムを医療機器プログラムとしています。該当するかは、表示や説明資料、広告からみた使用目的とリスクの程度で判断され、同じ機能でも使用目的が違えば判断が変わりうるため、企画の段階から使用目的を検討することが望ましいとされています(厚生労働省「プログラムの医療機器該当性に関するガイドライン」)。

判断事例集では、カルテ情報から情報提供用の文書を出力するような院内業務の支援や、医療関係者と患者のやり取りを支えるプログラムが、医療機器に当たらない例に挙げられています。一方で、診断結果の候補を示す診断支援や、治療計画・方法の決定を支援するプログラムは、医療機器に当たる例に挙げられています(厚生労働省「プログラムの医療機器該当性判断事例」)。生成AIの記録作成と治療方針の提案では、位置づけが変わりうるということです。判断に迷う場合は相談窓口が案内されています(厚生労働省「医療機器プログラムについて」)。

なお、端末で動かすかクラウドで動かすかで、医療機器かどうかが決まるわけではありません。オンデバイス推論が主に関わるのは、データの置き場所と安全管理の側です。オンデバイスAIの全体像は 総論の記事 で紹介しています。

研究で見る「院内に閉じたまま、どこまでできるか」

📄 論文: ブラウザの中で動く1Bモデルが、診療の会話を記録に整える

Preserving Privacy, Increasing Accessibility, and Reducing Cost: An On-Device Artificial Intelligence Model for Medical Transcription and Note Generation(Johnson Thomas ほか、2025年7月、arXiv:2507.03033)は、査読前の論文(プレプリント)です。

対象は、AIで作った内分泌科の診察の書き起こしと、公開ベンチマーク(ACI-Bench)を書式に合わせて直した140件です。評価は文章の一致度と、GPT-4.1 mini を採点役にした品質評価で行っています。ブラウザ上での速度や、どの機器で動かしたかの測定結果は本文に示されていません。

Llama 3.2 1B を少数の追加パラメータだけ学習するLoRAで調整し、書き起こしから構造化された診療記録を作らせました。ACI-Benchでは、事実と異なる重大な記述(重大なハルシネーション)が85件から35件に減っています。ただし、140件のうち35件には重大な誤りが残っています。採点はAIによるもので、臨床医が見た有用性をすべて捉えるものではない、と著者らも書いています。

現場にとっての意味は、小さなモデルでも調整で記録の下書きは大きく改善しうる一方、医師が確認する前提は外せないということです。

📄 論文: エッジ機器1台で、カンファレンスの書き起こしから治療提案まで

Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings(Aarzoo Dhiman ほか、2026年8月投稿・9月改訂、arXiv:2608.22108)は、査読前の論文(プレプリント)です。

対象は、英国の病院の乳がんチームが過去の症例を演じた模擬カンファレンスの録音2本(6症例)、合成した議論10本と雑音などを加えた1,270本です。臨床での評価ではありません。機器は NVIDIA Jetson AGX Orin(64GB)1台で、音声認識(Whisper)、8ビット化した MedGemma 27B、英国NICEのガイドラインの検索を組み合わせました。

音声認識は、無音の除去などの工夫で、模擬カンファレンスの録音での単語誤り率を既定の設定より下げました。治療の提案は、66種類の介入から該当するものを選ばせ、「情報不足」の回答を「該当なし」と数える形式では、クラウドの比較対象(ChatGPT-5.2)の2.3倍、カンファレンスの結論と一致する介入を挙げました。ただし全体の正確さに統計的な差はなく、自由記述で提案させた場合は、2種類の指示文のどちらでもクラウド側の再現率の方が高い結果でした。関係者への聞き取りでは、業務への組み込み、ガバナンス、医師の信頼が導入の課題に挙がっています。

現場にとっての意味は、院内の機器1台でも一連の処理は動く一方、治療の提案は前の章で見た医療機器の論点に直結し、結果も評価の形式で変わる、ということです。

📄 論文: 小型モデルは略語を「見つける」のは得意でも「展開」は苦手

PLACID: Privacy-preserving Large language models for Acronym Clinical Inference and Disambiguation(Manjushree B. Aithal ほか、2026年3月、arXiv:2603.23678)は、査読前の論文(プレプリント)です。米国の学会(AMIA)に投稿中と abs に記載されています。

対象は、PubMedの論文要旨から作られた略語のベンチマーク(GLADIS)の医学分野で、実際のカルテではありません。機器は Apple M4 Max のPCで、20億〜100億パラメータの範囲から選んだ汎用モデルと医学向けモデルを動かしました。

汎用モデルは略語を見つける精度が高く、最も高い Apple のモデルで0.988でした。しかし正式名称への展開は、正解の語の並びとの重なりを測る ROUGE-L という指標で、最も良い Mistral 7B でも0.655にとどまりました(完全一致率ではありません)。略語を医学向けモデルに渡す2段構成では同じ指標で0.81まで上がりましたが、これは正しい略語を与えたうえでの別のデータセットでの値で、同じ条件の汎用モデルも0.62〜0.75でした。モデルが誤った展開に非常に高い確信度を付ける例も報告されています。

現場にとっての意味は、汎用と医学向けの使い分けは有望ですが、展開の結果は人が確かめる前提で、モデルの自己申告の確信度を当てにしないことです。

📄 論文: 古い端末でも動く、ただし壁はメモリ

Medicine on the Edge: Comparative Performance Analysis of On-Device LLMs for Clinical Reasoning(Leon Nissen ほか、2025年2月、arXiv:2502.08954)は、査読前の論文(プレプリント)です。

対象は、20の臨床症例に記述式で答える評価用データセット(AMEGA)で、採点は GPT-4o が行いました。機器は2020〜2024年発売の iPhone 4台と iPad Pro 2台で、13の公開モデルを4ビットなどに量子化して動かしています。

GPT-4o の採点による平均点(1,000点満点)は医学向けの Aloe と Med42 が最も高く、汎用の Phi-3 Mini が速度とのバランスに優れていました。ただし医学向けのモデルがすべて良かったわけではなく、汎用モデルより大きく低いものもありました。古い端末でも動きましたが、メモリが4GBの iPhone 13 では10億パラメータ級のモデルしか動かず、OSの使用上限でアプリが落ちる例もありました。計算性能よりメモリが主な制約だったと著者らは述べています。iPhoneでは発熱が進むと出力の速さが大きく落ちました。

現場にとっての意味は、端末選びではメモリを先に確かめ、連続利用での発熱も試すことです。

現場でやること

用途の位置づけを最初に決める

記録の下書きか、診断や治療方針の支援かで、医療機器としての扱いが変わりえます。どこまでの機能を持たせるかを企画の段階で決め、迷うときは相談窓口を使います。

端末も医療情報システムとして管理する

  • 端末の中で処理が完結するなら、その端末も安全管理の対象と考える
  • 暗号化・起動パスワード・不要なアプリを入れない設定をそろえる
  • 管理されていない私物端末では動かさない
  • 外部と切り離しても、端末やモデルの更新、マルウェア対策、監視は続ける

クラウドとの比較も同じ物差しで

院外に出さないことは手段です。契約で保存や学習利用を管理できるクラウドと院内の機器を、安全管理の手間と精度の両面で比べます。

論文の数字は条件まで読み、自院で測り直す

  • 評価データが合成か、模擬か、実際の診療記録かを確かめる
  • 採点が医師かAIかを確かめる
  • 形式や条件を変えると逆転する結果がないかを確かめる
  • 自院の文書と端末で、少数でよいので試してから広げる

医療・臨床現場のオンデバイスAIの鍵は次の3点です

  1. ルール上の位置づけを先に確かめる
    患者情報の扱いは要配慮個人情報と安全管理ガイドラインで、医療機器かどうかは使用目的で決まりえます。技術選定の前に整理します。
  2. 端末も医療情報システムの一部として管理する
    院内で動かしても、端末の暗号化や管理は必要です。計算性能より先にメモリを確認します。
  3. AIの出力は下書きとして、医師が確認する
    調整しても重大な誤りはゼロにならず、確信度も当てになりません。業務フローと確認の手順をセットで設計します。

まとめ:医療のオンデバイスAIは「外に出さない」から「院内で確かめながら使う」へ!

医療のオンデバイスAIは、「どの作業を、どの大きさのモデルに、どこまで任せるか」を実測で決める段階に入っています。今回の論文は、記録の下書きや略語の読み解き、カンファレンスの支援が院内の機器で動きうる一方、評価の多くが合成・模擬のデータやAIによる採点で、条件しだいで結果が変わることも示しました。

まずは使いたい作業を一覧にし、それぞれが医療機器の論点に触れるか、どの端末で処理するかを公的資料で確かめるところから始めてみてください! 車載でのオンデバイスAIは 車載の記事 で紹介しています。

参考文献

2026-10-01 更新: 構成を見直し、論文へのリンクと参考文献を追加し、カンファレンス支援の論文でクラウドより多くの介入を挙げたとする記述と、略語の論文の検出・展開の精度の記述の誤りを修正しました

タイトルとURLをコピーしました