【2026年9月 急上昇ワード】オープンウェイトモデルの安全性ギャップ×論文4選|「OSSモデルに乗り換えたら安全性はどこまで落ちるのか」を解く

【2026年9月 急上昇ワード】オープンウェイトモデルの安全性ギャップ×論文4選|「OSSモデルに乗り換えたら安全性はどこまで落ちるのか」を解く AIセキュリティ

「顧客データを外部のAPIに送れないので、公開されているモデルを自社のサーバーで動かしたい」。セキュリティ要件や社内規程の都合で、こう考える組織が増えています。ところが検討を進めると、「有名な商用モデルと比べて、危ない依頼を断る力はどれくらい違うのか」「セキュリティの分析に使えるだけの実力はあるのか」という問いに、はっきり答えられる材料が意外と見つかりません。

しかも、重みが手元にあるモデルは、攻撃者も同じように手元で改変できます。「中身が見えるから安心」なのか、「中身をいじられるから危ない」のか。両方の声を聞いて、判断に迷っている方も多いのではないでしょうか。

当ブログ独自の arXiv 急上昇ワード集計では、「open-weight model(オープンウェイトモデル)」がセキュリティ分野(cs.CR)で急に伸びました。論文全体に占める割合は2026年1〜6月の0.4%から7〜9月は1.4%になり、平滑化した伸びは2.5倍です。ソフトウェア工学と自然言語処理の分野でも同時に伸びています。この記事では、米国商務省の電気通信情報局(NTIA)などの公的資料で前提を整理したうえで、9月に出た論文4本から「どこに差が出て、何で埋めるか」を読み解きます。結論を先に言うと、差は「オープンウェイトかどうか」よりもモデルの規模や世代で大きく変わるので、自分の用途で測り、足りない分はモデルの外側の仕組みで補うのが基本です!

オープンウェイトモデルとは:「重みが手元にある」ことの意味

「オープンソース」と「オープンウェイト」は同じではない

AIモデルの振る舞いは、学習で決まった膨大な数値(重み、パラメータ)で決まります。この重みを誰でもダウンロードできる形で公開したモデルを、一般に「オープンウェイトモデル」と呼びます。

現場では「OSSモデル」とひとまとめに呼ばれがちですが、オープンソース・イニシアティブ(OSI)の「オープンソースAIの定義 1.0」は、重みなどのパラメータに加えて、学習と実行に使ったコードの全体と、同等のシステムを作り直せるだけの学習データの詳しい情報まで公開されていることを求めています(Open Source Initiative「The Open Source AI Definition 1.0」)。重みだけが公開されていても、この定義でいう「オープンソースAI」にはあたりません。この記事では、重みが手に入るかどうかに注目して「オープンウェイト」と呼びます。

重みを公開すると何が変わるか

NTIA は2024年7月の報告書で、重みが広く公開されると次の3つが起きると整理しています(NTIA「Dual-Use Foundation Models with Widely Available Model Weights」)。

  • 開発者の想定を超えて、誰でも追加学習などで手を加えられる。悪意のある人は追加学習で安全のための仕組みを外し、それを自由に配布できる
  • 開発者は利用者の行動を見ることも、配布した重みを取り消すこともできなくなる
  • 自分の計算機で動かせるので、開発者にデータを渡さずに使える。その一方で、利用や悪用を見張る力は API で提供されるモデルより弱くなる

自社運用を考える組織にとっては、3つ目が「データを外に出さずに済む」という最大の利点です。同時に、商用 API なら提供元も担っていた見張りの役割を、自分たちで引き受けることになる、とも読めます。

自前で運用する側の心構え

米国国立標準技術研究所(NIST)の生成AI向けのリスク管理の手引きは、外部から取り入れる生成AIについて、オープンソースでも商用でも、調達時の確認や構成部品の一覧(SBOM)の要求など、既存のリスク管理の手順を当てはめられると書いています(NIST「AI 600-1: Generative Artificial Intelligence Profile」)。オープンウェイトだから特別な魔法が必要なわけではなく、「どこから入手し、どう確かめ、どう見張るか」を普段のソフトウェアと同じ目線で決めることが出発点になります。

研究で見る「安全性の差」はどこに出るか

📄 論文: 危ない依頼を「そのまま実行してしまう」割合

AURA-Eval: Evaluation Framework for Acting Under Risk Awareness in LLM Agent Trajectories(Ruoxi Shang ほか、2026年9月、arXiv:2609.06783)は、査読前の論文(プレプリント)です。

既存の安全性ベンチマークから集めた157件のエージェントの作業記録をもとに、条件を少しずつ変えた1,249問を作り、20のモデルに「次に何をするか」を答えさせています。実際の環境で動かしたのではなく、途中までの作業記録を同じ条件で見せて、次の一手を比べる方式です。判定は複数のLLMによる採点を人が抜き取りで確かめています。

問題には、安全なやり方で依頼をかなえられる場面と、そのまま実行すると危険でしかない場面の両方があります。危険な行動を取った割合は、Claude Opus 4.6 や GPT-5.4 などのフロンティアモデルが16.9〜23.6%だったのに対し、フロンティア級に分類された1モデルを除くオープンウェイトモデル(Llama、Qwen、Gemma など、いずれも700億パラメータ以下)は36.5〜52.0%でした。差が大きいのは「安全な道がない」場面で、フロンティアモデルは代わりの方法を提案することが多く、オープンウェイトモデルはリスクに気づかないまま実行する傾向が目立ちました。

ただし、フロンティア級でありながら重みも公開されている GLM-5.1 は19.4%で、フロンティアモデルの群と同じ水準でした。また、実行前に人が確認する機会を減らしたり、影響の及ぶ範囲を広げたりした問題では、モデル全体として危険な行動が増えました。運営者にとっては、「オープンウェイトだから危ない」ではなく、選んだモデルの規模と世代、そして人の確認を挟めるかどうかで安全性が大きく動く、という結果として受け取るのがよさそうです。

📄 論文: セキュリティの分析に使ったときの実力差

SCRIPTIOC-BENCH: A Benchmark for Recognizing Actionable Threat Intelligence from Script-Based Malware using LLMs(Hanna Kim ほか、2026年9月、arXiv:2609.06149)は、査読前の論文(プレプリント)です。

人の手で確認した実在の悪性スクリプト634件(Webページや Windows の自動処理で使われる3種類の言語で書かれたもの)を使い、スクリプトを実行せずに読むだけで、接続先のURLやドメイン、IPアドレス、作成されるファイルといった「侵害の痕跡(IOC)」をどこまで正しく取り出せるかを測っています。80億から4,800億パラメータのオープンウェイトモデルと、商用の上位モデルを同じ手順で比べました。

最も成績のよい商用モデルでも、正確さと網羅性をまとめた指標(F1)は65.4止まりで、オープンウェイトの最上位は49.8でした。値が難読化されていて組み立て直す必要がある痕跡ほど、取りこぼしが増えます。一方で、80億パラメータの小さなモデルに文字列処理の道具を使わせることと、この作業向けの追加学習を組み合わせると、出した答えのうち正しいものの割合(適合率)が31%から48%に上がりました。

自前で動かす小さなモデルを分析の補助に使う場合、そのままでは商用の上位モデルと差がある一方、道具と追加学習で差を縮められるということです。いずれにしても、結果は人が確かめる前提で使うべき水準です。

研究で見る「重みが手元にある」ことの表と裏

📄 論文: 安全機能を外す改変を、重みの側で邪魔する

Bait-and-Recover: Poisoning Internal Refusal Signals to Defend LLMs against White-Box Editing Jailbreaks(Tian Gao ほか、2026年9月、arXiv:2609.05794)は、査読前の論文(プレプリント)です。

重みが手元にあると、攻撃者はモデルの内部の計算を観察し、「断る」働きに関わる部分を探して重みを直接書き換えることができます。著者らによれば、この種の改変は追加学習よりはるかに安く、1台のGPUで数分で済み、普段の受け答えはほとんど変わりません。論文は、攻撃者が観察する場所にわざと紛らわしい信号を仕込み、すぐ後ろでその影響を打ち消すことで、正しい改変箇所を見つけにくくする防御を提案しています。

Qwen3 と Gemma 3 の4つのモデル(10億〜120億パラメータ)で試したところ、普段の振る舞いをほとんど変えない範囲に改変を限った条件で、最も効いた改変に対しても危ない依頼を断れた割合(4モデルの平均)は16.25%から71.75%に上がり、一般的な性能評価への影響はわずかでした。ただし著者ら自身が、有害なデータを集めて追加学習する攻撃は防げないこと、改変の自由度を広げると突破されることを限界として挙げています。

運営者にとっての意味は、一度配布された重みは、安全機能を外した版が作られうる前提で扱うことです。入手元がはっきりしない「改良版」の重みを使わない理由が、ここにあります。

📄 論文: 内部の状態を見て、攻撃を受けたことに気づく

MechAudit-40: White-Box Auditing across 40 LLM Attack Mechanisms(Zhen Guo ほか、2026年9月、arXiv:2609.06612)は、査読前の論文(プレプリント)です。

重みが手元にあることは、防御側にとっても利点になります。この論文は、30億〜200億パラメータの5つのオープンウェイトモデルに、8分類・40種類の攻撃を総当たりで試し、そのときのモデル内部の状態を記録して、攻撃を受けたときに共通して表れる変化があるかを調べました。

この変化を手がかりに、モデルごとに正常時の状態で基準を合わせた監視の仕組みは、学習に使っていない種類の攻撃でも81.1%を、誤検知0.70%の設定で見つけました。一方で、内部の状態からは「攻撃が成功したかどうか」はほぼ見分けられませんでした。著者らは、警告を「攻撃にさらされた証拠」として扱い、「侵害された」という判定とはみなさないよう求めています。

内部の状態を読む監視は、重みを自分で動かしているからこそ可能な手段です。ただし研究段階の仕組みで、運用にそのまま入れられる製品ではありません。警告を、ログの確認や処理の一時停止につなげる網のひとつとして位置づけるのが現実的です。

現場でやること

自分の用途で、候補モデルを並べて測る

一般的なベンチマークの順位だけで選ばず、自社で実際に任せる作業を数十件ほど用意し、候補のオープンウェイトモデルと商用モデルを同じ条件で比べます。AURA-Eval の結果からは、「安全なやり方がある依頼」と「断るべき依頼」の両方を混ぜて試すことが大切だと分かります。前者だけで比べると、差が見えにくくなります。

足りない安全性は、モデルの外側で補う

モデルが危ない依頼を見抜けなくても被害が出ないように、使えるツールや権限を絞り、取り消せない操作の前には人の承認を挟みます。AURA-Eval でも、承認の機会を減らすと危険な行動が増えました。エージェントに渡す権限の設計は、近日公開予定の記事「AIエージェントとMCPの権限設計」で詳しく扱います。プロンプトインジェクションへの備えは、LLMエージェントのセキュリティの記事も参考にしてください。

重みの入手元と中身を管理する

重みは開発元の公式な配布先から入手し、配布元が確認用のハッシュ値を示している場合は照らし合わせてから保存します。第三者が手を加えた版は、安全機能が外されていても見た目では分かりません。使う版とライセンス、入手日を記録し、ソフトウェアの部品と同じように一覧で管理しておくと、問題が見つかったときに差し替えやすくなります。

見張る役割を自分で引き受ける

API なら提供元も担っていた利用状況の監視は、自前運用では自分たちの仕事になります。入力と出力、ツールの呼び出しを記録し、定期的に見直す仕組みを最初から用意しておきましょう。内部の状態を使った監視は、将来の選択肢として知っておく程度で十分です。

オープンウェイトモデルを安全に使う鍵は次の3点です

  1. 「オープンウェイトだから危ない」ではなく、規模と世代で測る
    差はモデルの規模や世代で大きく変わります。自分の用途と、断るべき依頼を混ぜた問題で、商用モデルと並べて確かめます。
  2. 足りない分は、モデルの外側の権限と承認で補う
    モデルが見抜けなくても被害が出ないように、ツールと権限を絞り、重要な操作の前に人の確認を挟みます。
  3. 重みは「改変されうる部品」として管理し、見張りは自分で担う
    公式の配布元から入手して版を記録し、利用の記録と見直しの仕組みを最初から組み込みます。

まとめ:オープンウェイトは「差を測って、外側で埋める」前提で使おう!

オープンウェイトモデルには、データを外に出さずに使えるという大きな利点があります。一方で、9月の論文からは、評価した中小規模のオープンウェイトモデルが、危ない依頼をそのまま実行しやすく、セキュリティの分析でも商用の上位モデルに届かない場面があることが見えてきました。ただしその差は、フロンティア級のオープンウェイトモデルでは小さく、道具や追加学習でも縮められます。

重みが手元にあることは、攻撃者が安全機能を外せるという弱みであり、防御側が中を見て監視できるという強みでもあります。自分の用途で差を測り、権限と承認で外側を固め、重みと利用状況を自分で管理する。この3つを押さえれば、「乗り換えたら安全性はどこまで落ちるのか」という不安に、根拠を持って答えられるはずです!

参考文献

タイトルとURLをコピーしました