Gemini 3.6 Flash登場 — トークン使用量を17%削減したGoogleの新しいエージェントモデル

Gemini 3.6 Flash 출시 — 토큰 사용 17% 줄인 구글의 새로운 에이전트 모델

Gemini 3.6 Flash登場 — トークン使用量を17%削減したGoogleの新しいエージェントモデル

Google DeepMindがGemini 3.6 FlashとGemini 3.5 Flash-Liteを正式にリリースしました。単にモデルサイズを大きくする競争から脱却し、賢い指揮官モデルと安価な実務担当モデルを連携させる、巧妙なエージェント設計戦略を打ち出しました。Googleが提示する多層型エージェント構造の実態と、実際の開発現場でなぜこの組み合わせが強力な力を発揮するのか、その核心に迫ります。

さらに賢くなったメイン指揮官:Gemini 3.6 Flashの進化

今回の改編の中心となる核心モデルは、間違いなくGemini 3.6 Flashです。現在正式にリリースされており、即座に使用可能で、100万トークンあたりの入力1.50ドル、出力7.50ドルという優れたコストパフォーマンスを誇ります。知識のカットオフも2026年3月に更新され、最新の情報の流れを迅速に反映します。

最も興味深い変化は、モデルが自ら「非効率な思考」を判断して省略するようになった点です。このモデルは、エージェントシステム全体を指揮するオーケストレーターの役割を担う際、不要な推論ループやツール呼び出しのプロセスを賢く減らすよう設計されました。おかげで、従来の3.5 Flashモデルと比較して出力トークンの使用量を約17%も節約できるようになりました。不必要な計算が減るため、速度も向上し、コストも大幅に削減されます。

画面を直接操作する実践的なエージェント能力も大きく進化しました。実際のPC画面を見てクリックし、複雑な事務作業を遂行するテストである「OSWorld-Verified」において、83.0%という驚異的なスコアを記録しました。これは、従来のはるかに高価なフラッグシップモデルを上回る成果であり、低コストでも複雑なブラウザ操作やPC制御の自動化を安定して実現できることを証明しています。

超高速サブエージェント:Gemini 3.5 Flash-Liteの役割分担

どんなに優れた人工知能であっても、すべての業務に高性能モデルを使うとコストと速度の面で大きな負担になります。Googleは、100万トークンあたりの入力0.30ドル、出力2.50ドルという手頃な価格の超低価格モデル「Gemini 3.5 Flash-Lite」を併用することでこの問題を解決しました。1秒間に350トークンを処理する高速性を備えており、リアルタイムな業務処理に最適です。

このモデルの核心的な用途は、賢いメインモデルと連携することにあります。複雑なシステム制御や全体的な意思決定はGemini 3.6 Flashが担い、大量の文書処理や分類のような単純な繰り返し作業はGemini 3.5 Flash-Liteが引き継ぐという構造です。このような分業体制を「オーケストレーター・サブエージェント」構造と呼びます。

この方法でシステムを設計すると、指揮官役のメインモデルが不要な推論ループや重複するツール呼び出しを繰り返す必要がなくなるため、出力トークンの使用量を約17%削減できます。メインモデルの重い計算負荷を減らし、高速な処理が必要な場所に軽量なサブエージェントを配置することで、最適なコスト効率を生み出す実践的な設計ガイドです。

簡単な役割分担は、以下のような軽量な設定ファイルの形式で定義し、エージェントシステムに即座に適用することが可能です。

json
{
  "orchestrator": {
    "model_id": "gemini-3.6-flash",
    "role": "overall_planning_and_routing"
  },
  "subagent": {
    "model_id": "gemini-3.5-flash-lite",
    "role": "extraction_and_classification"
  }
}

このように、複雑な思考は賢いモデルに、大量のリアルタイム作業は高速で軽量なモデルに分担させる構造こそが、運用コストを劇的に下げる鍵となります。

セキュリティ特化の守護者:Gemini 3.5 Flash CyberとCodeMender

今回のGoogleの発表における最も興味深い隠し玉は、セキュリティ特化モデルであるGemini 3.5 Flash Cyberです。このモデルは、ソフトウェアの脆弱性を発見し、自動的に修正(パッチ)する能力を極限まで高めた特殊モデルです。ただし、一般の開発者がオープンAPIを通じて直接呼び出して使用することはできません。

脆弱性を自ら発見して攻撃したり防いだりするコーディング技術は、一歩間違えば攻撃用の武器として悪用される可能性があるという二面性を持っています。そのため、Googleは安全装置として、このモデルの一般APIへのアクセス権を完全に遮断しました。代わりに、Google CloudのインテリジェントセキュリティプラットフォームであるCodeMenderの内部にのみ搭載し、安全に動作するよう設計しました。

CodeMenderは、隔離された仮想環境であるサンドボックス内でプログラムの弱点を見つけ出し、シミュレーションテストを通じて安全性を検証したのち、パッチまで完了させるセキュリティエージェントです。C、Go、Java、Python、Rustなどの主要なプログラミング言語をサポートし、独自のビルドおよびコンパイル検証を経て、システムを損なうことのない安全な修正コードのみを反映させます。

一般的な企業向けのCodeMender体験版では、従来のGemini 3.5 Flashなどのモデルが標準で使用されます。一方で、政府機関や信頼できる特定のパートナー向けの最高レベルのセキュリティ防衛線には、このGemini 3.5 Flash Cyberモデルが独占供給されます。仮想セキュリティ訓練場の評価指標である「CyberGym」ベンチマークでも優れた実力を証明した通り、強力なAI能力をどのように安全に統制し、提供すべきかを示す良い模範事例です。

最も効率的なエージェントを組み立てる方法

今回公開された新しいGeminiモデルは、実際にAIをサービスに導入しようとしているビルダーに対して、明確な設計のヒントを与えています。複雑な環境下で画面を直接制御したり、サービス全体の流れを調整したりする賢い指揮官が必要な場合は、Gemini 3.6 Flashを中心に据えるのが効果的です。

一方で、大規模なリアルタイム翻訳や文書分析のように、高速かつ安価な繰り返し作業が必要な実務ループには、Gemini 3.5 Flash-Liteを配置することで、コスト負担を大幅に抑えることができます。

今後は、単に大きく高価なモデル一つで全てを解決しようとするやり方から脱却する必要があります。それぞれの役割に合わせたコストパフォーマンスの良いモデルを、まるでオーケストラのように調和させて設計する能力こそが、これからのビジネスにおいて真に役立つAIサービスを完成させるための真の競争力となるでしょう。

(編集済み)

まだコメントはありません。