AIToday
大規模言語モデルTHE DECODER掲載日時: 2026年6月25日 19:002分で読める

Gemini 3.5 Flash、画面操作機能を統合

LINEで送る
Gemini 3.5 Flash、画面操作機能を統合

要点

  • GoogleはGemini 3.5 Flashに画面を見て操作する機能を統合し、開発者がAIエージェントでソフトウェアテストやオフィス自動化といった複雑なタスクを自動化できるようにしました。

  • OSWorldベンチマークで78.4を獲得し、同じく78.4のSonnet 4.6に並びながらも、リーダーのOpus 4.8の83.4には及びません。

  • セキュリティのため敵対的学習と2種類のエンタープライズセーフガードが用意されています。

3つのポイント

  1. 何が起きたか

    GoogleはGemini 3.5 Flashに「Computer Use」機能を直接統合しました。このモデルはコンピュータ、ブラウザ、モバイルデバイスの画面を見て理解し、自分で操作できるようになりました。従来はGemini 2.5の別モデルでのみ利用可能でした。

  2. なぜ重要か

    既存の関数呼び出しやSearch、Mapsなどのツールと組み合わせることで、開発者はソフトウェアテストやオフィス自動化といったタスクに対応するエージェントをブラウザ、モバイル、デスクトップ環境で構築できるようになります。これにより、複雑な作業の自動化がこれまでより容易になるとみられます。

  3. 注目点

    OSWorldベンチマークでGemini 3.5 Flashは78.4を獲得し、Gemini 3 Flash(65.1)およびGPT-5.4 mini(72.1)を上回りました。セキュリティについては、プロンプトインジェクション攻撃を防ぐため、敵対的学習と2種類のエンタープライズセーフガード(機密操作の確認要求と間接的インジェクション検知による自動停止)が用意されています。Gemini APIおよびGemini Enterprise Agent Platformから利用可能です。

この記事についてAIに質問する →

よくある質問

Gemini 3.5 Flashの画面操作機能は従来と何が違いますか?
従来はGemini 2.5の別モデルでのみ利用可能でしたが、今回Gemini 3.5 Flashに直接統合されました。これにより、既存の関数呼び出しやSearch、Mapsなどのツールと組み合わせて、ブラウザ、モバイル、デスクトップ環境で動作するエージェントを構築しやすくなります。
どこから使えますか?
Gemini APIおよびGemini Enterprise Agent Platformから利用できます。BrowserbaseのデモとGitHubリファレンス実装も提供されています。
プロンプトインジェクション攻撃対策はどうなっていますか?
敵対的学習と2種類のオプションのエンタープライズセーフガードが用意されています。1つは機密操作や取り消し不可能な操作に対してユーザー確認を要求し、もう1つは間接的プロンプトインジェクションを検知したときに自動的にタスクを停止します。Googleはサンドボックス化、人間による監視、厳格なアクセス制御も推奨しており、詳細はベストプラクティス文書に記載されています。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • AIの数学証明が分野の核心的価値に挑戦Japan Times Tech · 1時間前
  • AI引用の38.6%が捏造との調査結果Hacker News · 1時間前
  • ラムリサーチ、オレゴン州にAI半導体ラボ着工Top Companies AI · 8時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へReddit、10億ユーザーを目指す