チャットボットに指示を出す時代から、「AIが人間と同じように画面を見て、マウスとキーボードを動かしてPC作業を代行する」時代へ。Anthropic、OpenAI、Google の各社がこうしたComputer Use(コンピューター操作)の機能を開発者向けに提供し、APIのない古い社内システムの操作までAIに任せる試みが広がっています。
ところが実際の業務に入れようとすると、「操作が遅い」「クリックを間違える」「複数のアプリをまたぐと途中で止まる」「勝手に何かを送信しないか心配」といった壁に当たります。「RPAと何が違うのか」もよく聞かれる疑問です。
この記事では、各社の公式ドキュメントをもとに Computer Use の仕組み・RPAとの違い・安全上の注意を整理し、導入前に押さえておきたい論文4本を紹介します。結論を先に言うと、任せる範囲を絞り、隔離した環境で、取り返しのつかない操作の前には人が確認し、「終わりました」という自己申告を結果で確かめるのが基本です!
Computer Use とは:画面を見て、マウスとキーボードで操作するAI
仕組みは「スクリーンショット→操作→スクリーンショット」の繰り返し
Computer Use は、AIモデルが画面のスクリーンショットを見て、「この座標をクリック」「この文字を入力」といった操作を指示する仕組みです。3社のAPIでは、モデル自身がPCに直接つながるわけではありません。モデルが返した操作の指示を、利用者側のアプリケーションが用意した環境(仮想マシンやコンテナ)で実行し、新しいスクリーンショットを撮ってモデルに返します。これを作業が終わるまで繰り返す流れを、Anthropic は「エージェントループ」と呼んでいます(Anthropic「Computer use tool」)。
Google の Gemini API も、スクリーンショットを送る→モデルがクリックやキー入力の操作を返す→利用者側で実行して新しい画面を送る、という同じ流れを説明しています(Google「Computer use」)。OpenAI は、マウスとキーボードの操作を返させる方法に加えて、操作用のスクリプトをモデルに書かせる方法も示しています(OpenAI「Computer use」)。モデルの外側でループや権限を管理する部分は、エージェント・ハーネスの記事で扱った「ハーネス」にあたります。
なお、作業がWebページの中で完結するなら、ページの構造も読み取れるブラウザ操作用のツールのほうが向いている、と Anthropic は案内しています(Anthropic「Browser use tool」)。
RPA との違い:決められた手順か、その場で判断するか
総務省は RPA を「これまで人間が行ってきた定型的なパソコン操作をソフトウエアのロボットにより自動化するもの」と説明し、画面上の操作を認識する技術とワークフローの実行を組み合わせて、表計算やメールなど複数のアプリケーションを使う業務を自動化するとしています(総務省「RPA(働き方改革:業務自動化による生産性向上)」)。
大まかに言えば、RPA は人が定めたワークフローを実行し、Computer Use では指示文と画面を見たモデルが次の操作を選びます。手順を書き切らなくてよい代わりに、同じ指示でも毎回同じ操作になるとは限りません。
弱点は各社の文書にも書かれています。Anthropic は、人が操作するより遅いこと、クリックする座標やツールの選択を誤る場合があること、なじみの薄いアプリや複数のアプリを同時に扱う場面では信頼性が下がりうることを制限事項に挙げています(Anthropic「Computer use tool」)。Google も、プレビュー段階の機能として誤りやセキュリティ上の弱点を含みうるため、重要な判断や機密データ、取り返しのつかない操作には使わないよう勧めています(Google「Computer use」)。
安全上の注意:権限・確認・隔離
3社の文書が挙げる注意点をまとめると、次の4つです。
- 隔離と最小権限: 専用の仮想マシンやコンテナで、必要最小限の権限で動かす。アクセスできるサイトや操作は許可リストで絞る
- 機密情報を渡さない: ログイン情報などの機密データにモデルが触れないようにする
- 重要な操作の前に人が確認する: 購入、データの送信、削除のように元に戻しにくい操作や、利用規約への同意は利用者に確認させる
- 画面の内容を信用しない: Webページや画像に書かれた指示にモデルが従ってしまうことがある(プロンプトインジェクション)。画面上の文字では権限を与えられない前提で設計する
OpenAI はさらに、ステップ数・時間・費用に上限を設け、モデルの最終回答だけに頼らず実際の結果を確かめるよう求めています。Google の Gemini API は、決済やメール送信などの操作を「確認が必要」「禁止」と判定して返します(Anthropic「Computer use tool」、OpenAI「Computer use」、Google「Computer use」)。プロンプトインジェクションそのものの仕組みと対策は、LLMエージェントのセキュリティの記事で詳しく解説しています。
研究で見る「操作の効率」と「完了の確かめ方」
📄 論文: 細かいクリックをAIに任せず、OSの仕組みに肩代わりさせる
From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents(Yuan Wang ほか、2025年10月投稿・2026年3月改訂、arXiv:2510.04607)は、EuroSys 2026 採録(abs の関連 DOI と本文の記載)です。
対象と条件: 公開ベンチマーク OSWorld の Windows 版から、Word・Excel・PowerPoint の単一アプリの課題27件を使い、Windows 上の Microsoft 365 で GPT-5 と GPT-5-mini に各3回実行させました。比較相手は、Microsoft のエージェントの枠組み UFO-2 を画面操作だけで使う構成です。
人間向けの画面では、目的のボタンにたどり着くまでにメニューを何度も開く必要があり、その一つ一つが失敗の機会になります。この論文は、OSのアクセシビリティ機能を使って、アプリのどのメニューの奥にどの部品があるかを事前に調べて地図にしておき、AIは「この部品をこの状態にする」と宣言するだけで、たどり着き方とクリックは仕組みの側が受け持つ DMI を提案しました。この27課題では、GPT-5 の標準の推論設定で成功率が44.4%から74.1%(相対で67%向上)に上がり、LLMの呼び出し回数は平均8.16回から4.61回に減りました。成功した試行の6割強は合計4回の呼び出しで終わり、うち3回は枠組みの決まった処理なので、作業の中身は1回で済んだことになります。一方で、地図づくりにはアプリごとに約1.5人日の手作業もかかり、アプリの版が変われば作り直しです。
運営者にとっての意味は、1クリックずつ操作させるほど失敗の機会が増えるということです。より大きな単位で操作できる道があれば、そちらを優先する価値があります。
📄 論文: 「本当に終わったか」を別のAIが画面で判定する
“Are We Done Yet?”: A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents(Marta Sumyk ほか、2025年11月、arXiv:2511.20067)は、AAAI 2026 のワークショップ(TrustAgent)採録(abs のコメント欄の記載)です。
対象と条件: macOS の標準アプリ42種について各30件、計1,260件の課題を作り、人手で成否のラベルを付けました。操作役は Claude の Computer Use、OpenAI の Operator、公開モデルの UI-TARS の3種、判定役は GPT-4o・Claude 3.5 Sonnet と公開モデル3種の計5種です。ログインや個人データを要する課題は除いています。
PC操作AIは、終わっていないのに「完了しました」と答えることがあります。そこでこの論文は、最後の画面1枚と指示文だけを画像も読めるAIに見せて完了かどうかを判定させ、未完了なら理由を操作役に返して、その場からやり直させる仕組みを試しました。判定の正解率は組み合わせによって5割台から最大73%で、判定を返して1回やり直させると、成功率は平均で相対27%上がりました(改善幅は組み合わせで異なります)。
運営者にとっての意味は、別の目で結果を確かめると成功率が上がる一方、判定役も最良の組み合わせで4件に1件以上は見誤るということです。重要な作業では人の確認を残します。
研究で見る「いまの限界」と「守り方」
📄 論文: 複数アプリをまたぐ業務は、まだ2割程度しか完了できない
WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments(Jinchao Li ほか、2026年4月、arXiv:2604.27776)は、査読前の論文(プレプリント)です。
対象と条件: 実際の職場ではなく、Windows の仮想マシン上の模擬環境で、表計算・文書作成・メール・ブラウザなど17のアプリを使う181件の課題を作りました。16の職種を想定してLLMで作り、人が見直した課題で、78%が複数のアプリを必要とし、実行できない課題も含みます。評価したのは Gemini 3 の2モデル、GPT-5.2、Claude Sonnet 4.5、Qwen3-VL-Plus と2つのエージェントの枠組みです。
この模擬環境での結果は厳しく、最も良かった構成でも最終的な成功率は約20%で、複数アプリの課題に限るといずれも21%未満でした。手順の長さが同程度の課題を選んで比べても、単一アプリの課題で46%あった成功率が、複数アプリでは14%に落ちています。作業の長さよりも、アプリの切り替えと情報の受け渡しが壁になっているということです。失敗は序盤の中間目標で起きることが多く、実行できない課題を「できない」と認められないことも目立ちました。
運営者にとっての意味は、「ブラウザで集めて、表計算でまとめて、メールで送る」ような業務を丸ごと任せるのはまだ早い、ということです。
📄 論文: AIの操作を、意図と状況に応じてOSの側で止める
Secure and Efficient Access Control for Computer-Use Agents via Context Space(Haochen Gong ほか、2025年9月投稿・2026年1月改訂、arXiv:2509.22256)は、査読前の論文(プレプリント)です。
対象と条件: コマンド操作(AgentBench)、API操作(AgentDojo)、Androidアプリの画面操作(AndroidWorld)の3つのベンチマークで評価しました。PCのデスクトップ画面での評価ではありません。攻撃のテストは、AgentDojo では組み込みのものを、残る2つでは著者らが作った「依頼と食い違う操作」を使っています。
操作のたびにLLMに安全性を判定させる方法には、遅さと判定の不確かさという課題がありました。この論文の CSAgent は、「この操作は、利用者がこういう意図で、こういう状況のときだけ許す」という規則を開発の段階でLLMに作らせておき、実行時はOSのサービスとして素早く照合します。最初に作った規則では、AgentDojo の攻撃はすべて防げた一方、ほかの2つでは一部を通し、作業をこなす力も平均15.58%下がりました。実行時の記録をもとに規則を見直した版では、3つすべての攻撃を防ぎ、作業をこなす力の低下は5.42%、処理時間の増加は1.99%に収まりました。
運営者にとっての意味は、「やってはいけないこと」をモデルの外側の仕組みで止める設計が現実的になりつつあるということです。ただし規則は一度では完成せず、見直しが前提です。
現場でやること
任せるのは「単一アプリの定型作業」から
複数のアプリをまたぐ業務はまだ不安定です。まずは1つのアプリで完結し、失敗しても影響の小さい作業から試しましょう。APIやブラウザ操作用のツールで済む部分はそちらを使います。
専用の環境と最小限の権限で動かす
普段使いのPCでは動かさず、専用の仮想マシンやコンテナを用意します。アクセス先を許可リストで絞り、ログイン情報は渡しません。
取り返しのつかない操作の前に、人が確認する
送信、購入、削除、規約への同意などは、最後のボタンを押す前に人が確認する流れにします。止める規則は、指示文だけでなく実行する側の仕組みにも組み込みます。
「終わりました」を結果で確かめる
ステップ数・時間・費用の上限を設け、途中で止められるようにします。作業後は、ファイルが保存されたかなど結果を確認します。別のAIに画面で判定させる方法も有効です。
Computer Use 導入の鍵は次の3点です
- 任せる範囲を絞る
研究のベンチマークでは、複数アプリをまたぐ課題の成功率はまだ2割程度です。単一アプリの定型作業から始め、APIなどより確実な手段があればそちらを使います。 - 隔離した環境で、重要な操作は人が確認する
専用の環境と最小限の権限で動かし、送信・購入・削除などの前には人の確認をはさみます。 - 自己申告ではなく結果で確かめる
上限を設けて暴走を防ぎ、作業が本当に終わったかを結果で確認します。判定役のAIも見誤る前提で使います。
まとめ:Computer Use は「できること」と「まだできないこと」の見極めが鍵!
Computer Use は、スクリーンショットを見て操作を決めることを繰り返す仕組みで、RPA より柔軟な一方、遅さや誤操作、画面上の悪意ある指示といった弱点を抱えています。研究では、操作の単位を大きくする工夫、別の目で完了を確かめる仕組み、OSの側で操作を止める仕組みが成果を上げていますが、複数アプリをまたぐ課題の成功率はベンチマーク上でまだ2割程度です。
APIのないシステムの操作などを検討している方は、まず「失敗しても困らない単一アプリの作業」を1つ選び、隔離した環境で試してみてください。どこまで任せられるかが、自社の業務で見えてきます!
参考文献
- Anthropic「Computer use tool」(https://platform.claude.com/docs/en/agents-and-tools/tool-use/computer-use-tool)2026-10-01 確認
- Anthropic「Browser use tool」(https://platform.claude.com/docs/en/agents-and-tools/tool-use/browser-use-tool)2026-10-01 確認
- OpenAI「Computer use」(https://developers.openai.com/api/docs/guides/tools-computer-use)2026-10-01 確認
- Google「Computer use」(https://ai.google.dev/gemini-api/docs/computer-use)2026-10-01 確認
- 総務省「RPA(働き方改革:業務自動化による生産性向上)」(https://www.soumu.go.jp/menu_news/s-news/02tsushin02_04000043.html)2026-10-01 確認
- Yuan Wang ほか「From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents」arXiv:2510.04607(https://arxiv.org/abs/2510.04607)、EuroSys 2026 掲載(https://doi.org/10.1145/3767295.3803576)2026-10-01 確認
- Marta Sumyk ほか「”Are We Done Yet?”: A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents」arXiv:2511.20067(https://arxiv.org/abs/2511.20067)2026-10-01 確認
- Jinchao Li ほか「WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments」arXiv:2604.27776(https://arxiv.org/abs/2604.27776)2026-10-01 確認
- Haochen Gong ほか「Secure and Efficient Access Control for Computer-Use Agents via Context Space」arXiv:2509.22256(https://arxiv.org/abs/2509.22256)2026-10-01 確認
2026-10-01 更新: 構成を見直し、論文へのリンクと参考文献を追加し、アクセス制御の論文の防御率と性能への影響、操作の効率化の論文のLLM呼び出し回数の記述の誤りを修正しました

