【AI×セキュリティ】ディープフェイク音声・動画の詐欺|「社長の声で振り込みを指示された」を解く

【AI×セキュリティ】ディープフェイク音声・動画の詐欺|「社長の声で振り込みを指示された」を解く AIセキュリティ

「社長から電話があって、『今日中にこの口座へ振り込んでおいて』と言われた。声も話し方も社長そのもの。断れる自信がない」。経理の担当者からこう相談されたら、どう答えればよいでしょうか。

これまで、なりすましの電話やビデオ会議は「声や顔を知っている相手なら見抜ける」と考えられてきました。ところが今は、AI で特定の人の声をまねたり、映像の顔を差し替えたりすることが手軽にできるようになっています。「オンライン会議に映っている取引先の担当者が、本当に本人なのか分からない」という不安も、もう絵空事ではありません。

この記事では、公的機関の資料と最新の研究論文をもとに、ディープフェイク(AI で作った偽の音声・動画)を使った詐欺の現状と、検知ツールや人の耳がどこまで当てになるのかを整理し、運営者がやるべきことをまとめます。結論を先に言うと、声や顔で本人かどうかを見抜こうとせず、手続きで確かめるのが基本です!

何が起きているのか

メール詐欺に「偽の声・偽の映像」が加わる

IPA の「情報セキュリティ10大脅威 2026」では、「組織」向け脅威の 3 位に「AIの利用をめぐるサイバーリスク」が初めて選ばれました(IPA「情報セキュリティ10大脅威 2026」)。その解説書は、組織編 10 位のビジネスメール詐欺の解説で、弁護士などの権威ある第三者へのなりすましに生成AIなどによる偽電話が使われることがあり、なりすましに AI によるディープフェイクなどの利用も確認されていると書いています(IPA「情報セキュリティ10大脅威 2026」解説書[組織編])。

米国 FBI も 2024 年 12 月の注意喚起で、犯罪者が AI で作った音声(声のクローン)で身近な人や著名人になりすまして支払いを求めたり、会社の経営者や捜査機関などを装ったリアルタイムのビデオ通話用の映像を作ったりしていると警告しています(FBI IC3「Criminals Use Generative Artificial Intelligence to Facilitate Financial Fraud」)。IC3 の 2025 年の年次報告では、AI に関わる情報を含む苦情が 2 万 2,000 件を超え、損失額は 8 億 9,300 万米ドルを上回りました(FBI IC3「2025 IC3 Annual Report」)。同じ報告は、声のクローンで困っている家族を装う詐欺でも 2025 年に 500 万米ドルを超える損失が報告されたとし、この手口が家族以外の親しい人やさまざまな緊急事態を装う形へ広がっていると述べています。

国内でも経営者へのなりすましは続いている

国内では警察庁が 2026 年 2 月 13 日、経営者を名乗るメールで SNS のグループ作成を指示し、そこで法人の口座残高を回答させるなどしたうえで送金させる「ニセ社長詐欺」に注意を呼びかけています(警察庁「法人を対象とした詐欺(ニセ社長詐欺)に注意!」)。この注意喚起自体はメールと SNS の手口ですが、「社長の指示だから」と従わせる構図は、声や映像が偽物になっても変わりません。メール側の対策は生成AIとフィッシング・ビジネスメール詐欺の記事で扱っています。

研究で見る「見抜けるのか」

では、偽の声や映像はツールや人の耳で見抜けるのでしょうか。2025〜2026 年の研究からは、どちらも当てにしにくいという結果が出ています。

📄 論文: 実際に出回った偽物では、検知器の性能が大きく落ちた

Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024(Nuria Alina Chandra ほか、2025年3月、arXiv:2503.02857)は、査読前の論文(プレプリント)です。ここでは 2026 年 5 月に改訂された第 5 版をもとに紹介します。

2024 年に SNS などで実際に出回ったディープフェイクの動画・音声・画像(88 のサイト、52 言語)を集めて、検知器を評価しました。研究用の既存のデータセットでは高い精度をうたうオープンソースの検知器も、この実物の偽物では性能が急落し、性能の指標(AUC)が動画で 50%、音声で 48% 下がりました。商用の検知器はそれより良い成績でしたが、専門の鑑定者の精度にはまだ届いていません。

運営者にとっての意味は、「検知ツールを入れたから安心」とは言えないことです。ツールの判定は参考情報にとどめ、送金のような重要な操作は別の手続きで確かめる前提にします。

📄 論文: 人は偽物を見抜けるようにならず、本物の声まで疑い始めた

Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception(Nicolas M. Müller ほか、2026年5月、arXiv:2605.26136)は、査読前の論文(プレプリント)です。

1,768 人から 35,532 件の判定を集めた、音声ディープフェイクの聴き分け実験です。2021 年の調査と比べると、偽物を偽物と見抜く正解率は全体ではほとんど変わらなかった一方、本物の声を本物と判定できた割合は 72.7% から 64.1% に下がりました。ただし偽物の中でも、商用サービスなど新しい方式で作られた音声は見抜きにくく、全体の数字だけでは安心できません。著者らは、本物の音声を疑う傾向が強まっていることを大きな問題として挙げています。

運営者にとっての意味は、声だけで判断する運用が両方向に危ういことです。偽の社長の声を信じてしまうだけでなく、本物の顧客や取引先の電話を疑って断ってしまうおそれもあります。

📄 論文: IT の専門職でも、新しいツールの合成音声は聞き分けにくい

Tracking the Trend in How Speech Synthesizers Deceive People(Milan Šalko ほか、2026年8月、arXiv:2608.19959)は、SPSC 2026(音声コミュニケーションのセキュリティとプライバシーに関するシンポジウム)採録です。

IT 専門職 82 人に、2019 年・2022 年・2024 年に公開された 3 つの音声合成ツールを選んで、その音声を聞かせ、本物か偽物かを判定してもらいました。「偽物が混ざっている」と事前に伝えていたにもかかわらず、3 つのうち最も新しい 2024 年のツールの音声では、判定の成績(F1 スコア)が約 48% まで落ちました。発話のうち 1 文だけを差し替えた音声では、録音を区切った各部分をすべて正しく判定できた割合という厳密な基準で、正答率は 9% でした。対象は IT 専門職に限られ、選んだツールも 3 つだけですが、少なくともこの条件では人の耳は当てになりませんでした。著者らは、人の聴覚だけには頼れないとして、手続きによる確認や、音声の出どころを示す情報、電子透かしの活用を挙げています。

運営者にとっての意味は、「うちの担当者は IT に詳しいから大丈夫」とは言えないということです。聴き分けの訓練より、確認の手続きに投資するほうが確実です。

📄 論文: AI 音声の電話詐欺は「安く大量に」かけられることが脅威

Evaluating AI Models’ Capability to Automate Voice Phishing Attacks(Fred Heiding ほか、2026年7月、arXiv:2607.09970)は、論文誌 Expert Systems with Applications 掲載です(abs のコメント欄の記載)。

米国の成人 4,100 人を対象に、AI 音声で作った詐欺電話の録音や書き起こしを聞かせ、要求に応じるかを尋ねた調査実験です。5 つの詐欺の型を合わせると 16.5% が「応じる」「応じるかもしれない」と答え、家族が困っているふりをする型では最大 36% にのぼりました。著者らは、今の時点でのリスクの中心は AI の説得力そのものより、人を雇わずに安く大量に電話をかけられるという「自動化の経済性」にあると分析しています。

運営者にとっての意味は、「至急の送金」「設定の変更」を求める電話が今後増えうる前提で、受けた人が一人で判断しない仕組みを作っておくことです。

オンラインの本人確認ではどう考えるか

会員登録や口座開設などでオンラインの本人確認(eKYC)を外部に委託している運営者もいるでしょう。米国 NIST の身元確認のガイドライン SP 800-63A-4 は、遠隔での本人確認に対する新しい攻撃として、生成AIで作ったり加工したりした申請者の顔や本人確認書類の画像・映像(ディープフェイク)を、カメラとサーバの間に差し込む手口を挙げています。カメラの前で本人が実在するかを確かめる仕組みも一定の防御になるものの、それだけではすべては防げないとしています(NIST SP 800-63A-4)。

そのうえで、本物のカメラから撮られた映像かを確かめる技術的な対策(仮想カメラの検出など)や、提出された画像・映像の改ざんの兆候の分析を求め、自動判定の見逃し率を記録して依頼元に示せるようにすること、自動判定を人の確認で補うことを勧めています。委託先を選ぶときは、「偽の映像の差し込みにどう備えているか」「どんな偽物で試験し、見逃し率はどれくらいか」を質問してみるとよいでしょう。

運営者のやること

手続き:声や顔ではなく「決まった手順」で確かめる

一番大切なのは、電話やビデオ会議での指示を、相手の声や顔で信じない手順を決めておくことです。

  • 折り返し確認:送金や口座変更、パスワードのリセットなどを電話で頼まれたら、いったん切って、手元の連絡先台帳にある番号へかけ直す。FBI も、いったん電話を切り、相手の組織の連絡先を自分で調べてかけ直すよう勧めています(FBI IC3「Criminals Use Generative Artificial Intelligence to Facilitate Financial Fraud」)
  • 合言葉:FBI は家族の間で秘密の言葉を決めておくことを勧めています。社内でも、経営層と経理の間で本人確認の質問や合言葉を決めておく方法があります
  • 二人承認:IPA は、金銭の支払いは複数人で審査・承認して単独で判断を完結させないこと、振込依頼や口座変更は事前に取り決めた別ルートで確認し、電話・メール単体では受け付けないことを挙げています(IPA「情報セキュリティ10大脅威 2026」解説書[組織編])

ビデオ会議も同じです。FBI が警告するように、経営者を装うリアルタイムの映像もありえます。会議の場で急な送金や機密情報の共有を求められたら、その場では決めず、会議を終えてから台帳の連絡先で本人に確認する、と決めておきましょう。

ポイントは、これを「怪しいと感じたときだけ」ではなく、いつも必ず行うルールにすることです。本物の社長からの電話でも同じ手順を踏むと決めておけば、担当者は相手を疑う気まずさを感じずに済みます。

教育:「聞き分け」ではなく「手順を守る」練習を

研究が示すとおり、人の耳で偽物を聞き分けるのは困難です。教育では「この声は偽物か」を当てる練習より、「急かされても手順を飛ばさない」「経営者からの指示でも確認してよい」と伝えることに重点を置きます。経営者自身が「自分の指示でも必ず確認すること」と社内に宣言しておくと、現場は動きやすくなります。

公開する声と映像を意識する

FBI は、自分の画像や声のオンライン上の公開を控えることも対策に挙げています。経営者のインタビュー動画や講演の録音をすべて取り下げる必要はありませんが、公開している素材が偽装の材料になりうることは意識しておきましょう。

本人確認を委託している場合は委託先に確認する

eKYC を使っている場合は、前の節のとおり、偽の映像の差し込みへの対策と、自動判定を人が確認する仕組みがあるかを委託先に確認します。

ディープフェイク詐欺対策の鍵は次の3点です

  1. 声や顔で本人かどうかを判断しない
    研究では IT 専門職でも新しいツールの合成音声を聞き分けにくく、検知ツールも実際に出回った偽物では性能が大きく落ちました。
  2. 折り返し・合言葉・二人承認を「いつもの手順」にする
    送金や重要な変更は、手元の台帳の番号へのかけ直しと複数人の承認を、相手が誰であっても必ず行います。
  3. 委託先や公開素材も守りの範囲に入れる
    本人確認を委託しているなら偽の映像への備えを確認し、経営者の声や映像の公開が偽装の材料になりうることも意識します。

まとめ:「見抜く」より「確かめる」仕組みで守ろう!

AI による偽の声や映像は、すでにビジネスメール詐欺などのなりすましに使われ始めています。研究では、検知ツールは実際に出回った偽物で性能が大きく落ち、人の耳は偽物を見抜きにくいうえに本物まで疑うようになっていることが示されました。さらに AI 音声の詐欺電話は、安く大量にかけられることが脅威になっています。

だからこそ、「見抜けるかどうか」に賭けるのではなく、相手が誰であっても同じ手順で確かめる仕組みを作ることが大切です。今日、社長と経理担当の方で「電話で送金を頼まれたら、どの番号にかけ直すか」を決めるところから始めてみてください!

参考文献

タイトルとURLをコピーしました