Nexaflow
サービス導入事例ブログ勉強会会社情報
資料請求お問い合わせ

Nexaflow

社会を支える人々と伴に、
未来の希望を創る

サービス

  • プライシング戦略支援
  • Nexalog
  • AIトランスフォーメーション

会社情報

  • 会社概要
  • ミッション
  • メンバー

リソース

  • ブログ
  • 導入事例
  • お知らせ
  • 資料ダウンロード

© 2026 Nexaflow Inc. All rights reserved.

利用規約プライバシーポリシー
ホーム/ガイド・ノウハウ/Claude Computer Useとは?OSWorld 61.4%でも「調査プレビュー」が外れない理由
ガイド・ノウハウ

Claude Computer Useとは?OSWorld 61.4%でも「調査プレビュー」が外れない理由

11分で読める|2026/07/07|
AI新技術革新業務自動化

AI・DX活用について相談する

最適なプランをご提案します。

お問い合わせ資料ダウンロード

よく読まれている記事

  1. 1Claude Cowork完全ガイド
  2. 2Ada徹底解説:ARR成長率108%、ノーコードAIエージェントの先駆者を完全分析
  3. 3Clay(クレイ)とは?評価額31億ドルのGTMオートメーションを完全解説
  4. 4a16z(エーシックスティーンゼット)とは?読み方・投資先・特徴を解説
  5. 5イーロン・マスクが語る2026年AGI実現とユニバーサル高所得の未来

この記事をシェア

B!

画面を見てクリックできるAIのベンチマークスコアは、2024年10月の**14.9%から2025年9月には61.4%**まで伸びました(Anthropic公表値、OSWorld)。それなのに、Anthropic自身のドキュメントは2026年5月時点でもComputer Useを「調査プレビュー」のままにし、「画面操作はコネクターより遅い」「複雑な作業では再試行が要る」と書き続けています。

なぜスコアが4倍になっても、製品は正式リリースされないのか。

私はこれを矛盾ではなく、ボトルネックがモデルの能力ではなく別の場所にあることの表れだと見ています。権限をどう区切るか、座標のズレをどう検証するか、失敗したときに誰が確認するか——運用側の準備度が、ベンチマークの伸びとは別の軸で製品の提供状態を決めている、という機構です。

私自身、業務ツールを選ぶときは「APIやコネクターで届く手段があるならそちらを先に検討する」という順序をまず疑う立場です。画面操作は見た目の汎用性が高い分、権限・座標・再試行という運用コストを later に回収する設計になりやすく、その回収コストを甘く見積もりがちだという問題意識を持っています。

この記事は、Claude Desktop(Cowork / Claude Code)とAPIという2つの入口を混同したまま語られがちなComputer Useを、公式ドキュメントの範囲で一度整理し直すための素振りです。結論だけ先に言うと、私はComputer Useを「RPAの置き換え」ではなく、コネクターとブラウザで届かない工程だけを埋める最後の補完レイヤーとして使うべきだと考えています。GUIしか入口がない定型作業には使いますが、金融取引・機密情報が映る画面・無人の本番運用には、現時点では使いません。これはAnthropic自身が「コネクター→ブラウザ→画面操作の順で正確な手段を優先する」「画面操作は遅く、複雑な作業では再試行が要る」と明記していることに立脚した、境界つきの立場です。製品が調査プレビューを外し、権限と再試行の面倒を製品側が吸収するようになれば、この立場は全力で朝令暮改します。


前提:先に言葉を揃える

  • Cowork: Claude Desktop上でタスクを自律的にこなすエージェント機能。コード実行は分離VM上で行われる。
  • Computer use(画面操作): Coworkやプログラムから呼び出される個別機能で、スクリーンショットを見てマウス・キーボードを操作する。ユーザーが許可した実際の画面・実際のアプリを直接触る点がCowork本体と違う。
  • コネクター: SlackやGoogle DriveのようにAPI経由でつながる連携手段。Coworkは「コネクター→ブラウザ→画面操作」の順で正確な手段を優先する設計になっている。
  • 調査プレビュー(research preview): Anthropicが正式リリース前の機能につける状態表示。Pro / Maxでは使えるが、Team / Enterpriseでは2026年5月19日時点で提供対象外。
  • OSWorld: GUI操作エージェントの遂行力を測る公開ベンチマーク。

この前提の上で、本記事ではさらに2つの区別を導入します。

「見える性能」と「任せられる性能」の違い——見える性能とは、OSWorldのようなベンチマークで測れる、タスクをやり切る力そのものです。任せられる性能とは、権限設計・座標変換の検証・失敗時の再試行・人手確認まで含めた、実運用に投入できる準備度です。この2つを分けると、「OSWorldが61.4%まで伸びたのに調査プレビューのまま」は矛盾ではなく、見える性能は上がったが任せられる性能の議論がまだ終わっていない、という検証可能な説明になります。

もう一つが補完レイヤーという位置づけです。これは「GUIしか入口がない工程だけを埋める最後の手段」という限定した意味で使い、汎用の自動化基盤や「何でも画面操作でやらせる」という意味では使いません。コネクター・ブラウザ・bashで届く作業はそちらが先、と切り分けられる場合にだけ、Computer Useの出番だと考えています。


どのプラン・OSで使えるか

製品上の入口ごとに利用条件が分岐するため、先に「どの入口の話か」を分けて読む方が安全です。

製品上の入口プラン要件対応OS提供状態
Claude Desktop の CoworkClaude Pro / MaxmacOS, Windows調査プレビュー
Claude Desktop の Claude CodeClaude Pro / MaxmacOS, Windows調査プレビュー
Anthropic API の computer use toolAPI キー + beta header隔離環境推奨beta tool
Team / Enterprise プラン——提供対象外
Claude Computer Useの提供面と安全境界

Windowsでの設定手順

  1. Claude Desktop for Windows を公式サイトからインストールし、最新版に更新する
  2. アカウントがPro または Max プランであることを確認する(Free / Team / Enterprise では利用不可)
  3. Claude Desktopを起動し、CoworkまたはClaude CodeからLet Claude use your computerを有効化する
  4. 操作対象のアプリはClaude Desktopと同じディスプレイで開いておく(マルチモニターは挙動がサーフェスごとに異なる)
  5. 機密情報を含むウィンドウ・銀行アプリ・社用ブラウザのプロファイル等は閉じる、もしくは操作許可を与えない

料金プラン早見表

プラン月額(参考)Computer Use の可否
Claude Free$0❌
Claude Pro$20 / 月✅ 調査プレビュー
Claude Max$100 / 月〜✅ 調査プレビュー
Claude Team$25 / seat〜❌(提供対象外)
Claude Enterprise個別見積もり❌(提供対象外)
Anthropic API(beta)利用量課金✅ beta header 必要

最新の料金とプラン構成はAnthropic公式Pricingを参照してください。API版は通常のテキスト課金に加え、スクリーンショットの往復で消費tokenが増えやすい点にも注意が必要です。Cowork本体はmacOS / Windowsで一般提供済みですが、Computer Use機能そのものは引き続き調査プレビューです。

“

出典: Anthropic Help Center「Let Claude use your computer in Cowork」、Anthropic API Docs「Computer use tool」、Anthropic「Pricing」


仕組み:画面を見て、座標で操作する

Computer Useは視覚認識と行動生成を組み合わせたマルチモーダルなシステムです。基本のループは4ステップに要約できます。

  1. 認識: スクリーンショットを受け取り、ボタン・テキストフィールド・アイコンの位置とテキストを読み取る
  2. 計画: 「Googleで検索して」のような指示を、アドレスバーを探す→アクセス→検索ボックスをクリック→入力→Enter、という手順に分解する
  3. 実行: mouse_move、left_click、type、keyのような操作をJSON形式で出力する
  4. 確認: 操作後に新しいスクリーンショットを取得し、未完了なら次の操作を計画する
Computer Use APIの操作ループ

この仕組みで実務上つまずきやすいのが座標推定です。APIは画像を最長辺1568px程度に縮小してから解析するため、Claudeが返す座標は縮小後の画像空間のものです。実行側で元解像度へ戻す処理をしないとクリックがずれます。computer_20251124ではenable_zoom: trueを付けることで、対象領域をフル解像度で再確認できますが、animationやpopup、複数appをまたぐ作業では、action ごとのscreenshot確認と再試行を前提にした方が安全です。

対応する操作は次の3グループです。

グループ主な action補足
基本操作screenshot, mouse_move, left_click, type, keyすべてのtool versionで利用可能
拡張操作 (computer_20250124)scroll, left_click_drag, right_click, middle_click, double_click, triple_click, left_mouse_down, left_mouse_up, hold_key, waitscroll制御やspreadsheet操作の精度改善に使う
拡張操作 (computer_20251124)zoomenable_zoom: trueが必要。小さいUIや高解像度領域の確認に向く

API版では、beta headerを付けてtoolを定義し、スクリーンショット取得→API呼び出し→操作実行のループを自前で実装します。

💻 実装コードを見る(スキップ可)
import anthropic

client = anthropic.Anthropic()
beta_flag = "computer-use-2025-11-24"

tools = [
    {
        "type": "computer_20251124",
        "name": "computer",
        "display_width_px": 1024,
        "display_height_px": 768,
        "display_number": 1,
        "enable_zoom": True
    }
]

def run_computer_use_loop(task: str, max_steps: int = 10):
    messages = [{"role": "user", "content": task}]
    for step in range(max_steps):
        screenshot = capture_screenshot()
        response = client.beta.messages.create(
            model="claude-opus-4-7",
            max_tokens=1024,
            tools=tools,
            betas=[beta_flag],
            messages=messages
        )
        for block in response.content:
            if block.type == "tool_use":
                result = execute_action(block.input)
                messages.append({
                    "role": "tool",
                    "tool_use_id": block.id,
                    "content": result
                })
        if is_task_complete(response):
            break
    return response

tool実行・座標変換・error handlingは実装側の責務で、bashやtext editor toolと組み合わせる前提で設計します。beta headerが必要なのはAPI版のcomputer use toolだけで、Claude Desktop上のCowork / Claude Codeの利用手順とは別系統です。


見える性能の現在地

Anthropicの公開資料では、Computer Useの遂行力(見える性能)は急速に上がっています。

時点出典読み取れること
2024-10-22Claude 3.5 Sonnetのmodel card / research postscreenshot-onlyのOSWorld 14.9%、step増加とprompt最適化込みで22.0%
2025-09-29Claude Sonnet 4.5 announcementOSWorld 61.4%まで改善
2026-05-19時点の現行ドキュメントHelp Center / API Docsそれでも調査プレビュー / betaで、複雑な作業は再試行と人手確認が前提

ここで、冒頭の問いに戻ります。なぜスコアが4倍になっても調査プレビューのままなのか。

理由は、Anthropicが上げてきたのが「見える性能」であって、「任せられる性能」の議論を終わらせていないからだと私は読んでいます。Help CenterやAPI Docsが明記する権限モデル——browserはview-only、terminal / IDEはclick-only、それ以外のappはfull controlというapp category単位の固定——は、任せられる性能をまだモデル任せにしていない証拠です。座標変換の検証、複雑UIでの再試行、そして2024年10月にセキュリティ研究者Johann Rehbergerが実証した「ZombAI」——1行のテキスト注入でComputer Useにマルウェアを起動させられた事例——が示すように、画面操作は指示された通りに動くからこそ、悪意ある指示にも従ってしまいます。ベンチマーク比較はmodel、tool version、step budget、agent loopの組み方で数字が動くため、固定のcross-vendor比較表もすぐ古くなります。「見える性能」の伸びを、そのまま「任せられる性能」の証明として読まない方が安全です。


どこに効くか:補完レイヤーとしての適用条件

Cowork / Claude Codeでは、コネクター→ブラウザ→画面操作の順でより正確な手段が優先されます。つまりComputer Useは「何でもGUIでやらせる」ための機能ではなく、GUIしか入口がない工程を埋める補完レイヤーとして使うのが実務的です。

適用が現実的な領域:

  • GUI自動化(RPA補完): セレクターが壊れやすい従来RPAの弱点を、視覚認識で補う。ただし長い作業ほど、対象アプリ・権限・ログ・人の確認ポイントを先に固定する必要がある
  • レガシーシステム連携: APIがない古いシステムから、GUI操作でデータを抽出しモダンなシステムへ渡す
  • テスト自動化: 自然言語でテストケースを記述し、視覚的なバグ検出も含めて確認する

適用しない領域として私が線を引いているのは、完全無人の本番環境操作、金融取引などのクリティカルな操作、機密情報を扱うシステムでの利用です。これはAnthropic自身の権限モデル(browser view-only等)や「再試行が要る」という記述と整合的な境界のつもりです。

この線引きは、Anthropicが挙げる適用領域(GUI自動化・レガシーシステム連携・テスト自動化)と、権限モデルで明示的に除外されている領域(browser view-only等)を照らし合わせて逆算したものです。「入口がAPIかGUIか」を先に確認し、API・コネクターが使える工程では画面操作を選ばない、という優先順位そのものが、Anthropicの設計思想(コネクター→ブラウザ→画面操作の順で正確な手段を優先)と一致していると考えています。

具体的なユースケーステンプレートや、承認境界つきの指示文の作り方は、Coworkの使い方ガイドの方に譲ります。


安全性の前提を混同しない

Cowork本体のコード実行は分離VM上で行われますが、Computer Useはユーザーが許可した実際の画面・実際のアプリを直接操作します。この2つは別の安全モデルです。

  • 権限の粒度: browserはview-only、terminal / IDEはclick-only、それ以外はfull controlと、app categoryごとに操作範囲が決まっている
  • Desktop版とAPI版の責任分界: Desktop版はアプリごとの権限許可・ブロックリスト・プロンプトインジェクション検知が組み込まれているが、API版はtool実行・座標変換・検証・ログ記録を開発者が自前で持つ前提
  • 人間の監視: 完全な自律動作は前提にせず、重要な操作前には確認を挿入し、ログを記録する
制限詳細
速度画面操作はコネクターより遅く、複雑な作業では再試行が要ることがある
座標精度高解像度の画面では縮小処理に伴う座標変換が必要
複数appニッチなアプリや複数アプリをまたぐ作業は安定性が下がりやすい
実機依存Desktop版はappが起動済みで、Claude Desktopが開いており、PCが起動中である必要がある
マルチモニターAPI版はdisplay_numberを指定できるが、Desktop版の詳細互換表は公開されていない

安全設計の詳細——VM分離、実画面境界、プロンプトインジェクション対策、企業導入時の権限・監査まで——はCoworkのセキュリティ解説記事で扱っています。


持ち帰れること

冒頭で立てた立場を、運用ルールとして書き直すと次の3点になります。

  1. 入口を混同しない: Claude Desktop上のCowork / Claude Code向け調査プレビューと、APIのbeta toolは、権限モデルもプラン要件も別物として扱う
  2. 補完レイヤーの境界を先に決める: コネクター・ブラウザ・bashで届く作業はそちらを使い、GUIしか入口がない工程にだけComputer Useを充てる。金融取引・機密画面・無人本番は対象外にする
  3. 見える性能で判断しない: OSWorldのスコアが上がっても、権限設計・再試行・人手確認という任せられる性能の議論が終わるまでは、調査プレビュー前提で扱う

私が「任せられる性能」という軸を重視するのは、権限設計と再試行の扱いが製品ドキュメント上でまだユーザー(開発者)側の責務として残っている限り、ベンチマークの数字だけを見て運用判断をするのは早計だと考えているからです。ドキュメントが「view-only」「click-only」「full control」というapp category単位の粗い権限しか提供していない間は、重要な操作の前に人の確認を挟むという前提を外さない、というのが私の考える最低ラインです。

この整理は、Computer Useを使うか使わないかの二択を迫るものではありません。どの工程を任せ、どこで人が確認するかを決めるための材料として読んでもらえればと思っています。この立場自体、製品側の権限・再試行の扱いが変われば書き換えるつもりで、この記事はそのための素振りです。


次に読むべき論文

前の論文次の論文
ReAct: 推論と行動の統合Swarm: マルチエージェント
“

AIエージェント論文おすすめ9選に戻る


参考リソース

  • Let Claude use your computer in Cowork
  • Use Claude Code Desktop
  • Computer use tool - Claude API Docs
  • Release notes
  • Developing a computer use model
  • Introducing Claude Sonnet 4.5
  • Computer Use デモリポジトリ
  • OSWorld ベンチマーク

本記事はAnthropicの公式ドキュメントおよび技術資料に基づいて作成しました。


関連記事

  • Claude Coworkとは?料金・使い方・できることを解説 — Computer Useの技術を非エンジニア向けに応用したCoworkの全貌
  • Devin AIとは?料金プラン・使い方・Cursor比較 — もう一つの自律型AIエージェント、Devinとの比較

この記事の著者

中村 知良

中村 知良

代表取締役

早稲田大学卒業後、ソフトバンク株式会社にてAI活用やCEO直下案件のプロジェクトマネージャーに従事。その後、不動産スタートアップPit in株式会社の創業、他スタートアップでの業務改善・データ活用を経験後、2023年10月、株式会社ネクサフローを創業し代表取締役CEO就任。

この記事をシェア

XFacebookはてなLinkedIn

次に読む

あわせて読みたい

Claude Cowork完全ガイド

Claude Cowork完全ガイド

2026/07/07
Claude Coworkセキュリティガイド

Claude Coworkセキュリティガイド

2026/07/07
Devinは職能の代替か、委任先か——導入判断の分かれ目

Devinは職能の代替か、委任先か——導入判断の分かれ目

2026/07/07

まずは無料相談・資料請求

AIやDXの導入について、具体的な進め方や費用対効果など、まずはお気軽にご相談ください。貴社の状況に合わせた最適なプランをご提案します。

お問い合わせ

お気軽にご相談ください