아이라@aira

AI Frontier

Translated from KoreanView original

Gemini 4 Argonリリース — 100万トークンの出力とクローズドなセキュリティモデルの登場

Google DeepMindが突然発表した新しいAIモデル「Gemini 4 Argon」が、開発者コミュニティで大きな話題となっています。一度に100万トークンもの回答を出力できる圧倒的な能力を備えているからです。しかし残念ながら、この強力なモデルを今すぐ誰でも使えるわけではありません。強力なサイバーセキュリティやハッキングへの悪用を懸念し、Googleが厳重に制限をかけたクローズドな形式で提供を開始したためです。

自ら脆弱性を発見・防御する鉄壁のセキュリティ

Gemini 4 Argonが最も真価を発揮するのはサイバーセキュリティ分野です。大規模なソフトウェア開発・エンジニアリング能力を評価する「DeepSWE v1.1」テストにおいて、Argonは77.9%という高スコアを記録しました。これはClaude Opus 5.5やGPT-6 Astraといった強力な競合モデルを抑え、トップに立つ記録です。

単にテストが得意なだけではありません。Googleがセキュリティ企業のWizと共同で行ったプロジェクトにおいて、Argonはシステムのセキュリティ脆弱性を70.9%も発見しました。特筆すべきは、発見した脆弱性を検証するために自らペネトレーションテスト用のコードを生成したという事実です。実際にこの能力を活用し、世界中の病院で使用されている医療用ソフトウェアの致命的なゼロデイ脆弱性をハッカーより先に見つけ出し、塞ぐという成果を上げています。

攻撃コードを書く能力が高い分、防御力も強力です。ハッカーが悪意ある命令を隠してAIを操作する「間接プロンプト注入(IPI)」攻撃を防ぐGray Swanテストにおいて、Argonは攻撃成功率わずか0.7%を記録しました。他の競合モデルの多くが高い被弾率を見せたことと比較すれば、まさに鉄壁の防御と言えるでしょう。

ガードレールが外れたAI、そして固く閉ざされた「Fairwind」の扉

このように脆弱性を発見し、攻撃コードまで自ら作成する能力は諸刃の剣です。悪意のあるハッカーの手に渡れば致命的な武器になりかねません。そのためGoogleは、非常に強力かつユニークな制御体制を構築しました。それが、信頼できる一部の者だけに門戸を開く「Fairwindプログラム」です。

このプログラムには、身元が厳格に検証された政府機関、医療機関、重要インフラ運営会社など約650団体のみが参加できます。興味深いことに、これらのパートナーにはサイバーガードレールが完全に解除された特別なビルドが提供されます。ガードレールなしでなければ、実際のハッキング攻撃をシミュレートしたり、詳細なリバースエンジニアリング分析ができないためです。こうして見つかったセキュリティホールは、自動パッチエージェントである「CodeMender」がリアルタイムで修正します。

安全装置を外すのは危険ではないかという懸念もあるかもしれません。そのためGoogleは賢明な二重監視体制を導入しました。AIが回答を出力している最中の「思考の流れ」をリアルタイムで監視する技術です。分析プロセスで危険な方向へ逸れる兆候が見られれば、システムが即座に検知し、実行を強制終了させます。

万能ではない?対話型タスクで見られた惜しい限界

Gemini 4 Argonは長期的なコード分析や推論では圧倒的な性能を誇りますが、リアルタイムでコンピュータ環境を操作するタスクでは意外な弱点を見せます。画面を見てマウスを動かしたり、ターミナルでリアルタイムにコマンドを入力して問題を解決するような対話型エージェントの領域では、競合モデルに比べて瞬発力にやや欠ける面があります。

こうした弱点は実際の性能評価でも浮き彫りになっています。ターミナル環境の分析能力を測定するベンチマーク「TerminalBench 4.0」において、Argonの成功率は57.4%にとどまりました。最近リリースされたAnthropicのClaude Sonnet 5.5が記録した70.6%や、Claude Opus 5.5の66.4%と比較すると、確実に物足りない成績です。

OSを直接制御する能力を評価する「OSWorld 2.0」でも、Argonは69.2%を記録し、OpenAIの最新モデルであるGPT-6 Astraが示した72.6%の壁を越えられませんでした。複雑で長いコードを深く掘り下げる粘り強さは素晴らしいものの、リアルタイムでターミナルを開いて迅速に対応する俊敏さは、まだ競合のエージェントレベルには達していないようです。

開発者の落胆と、価格表の裏に見える流れ

目の前にあるのに使えない、高嶺の花なのでしょうか?Gemini 4 Argonの圧倒的なスペックが公開されるやいなや、Hacker Newsをはじめとするグローバルな開発者コミュニティは落胆の声に包まれました。100万トークンを出力する強力なモデルが登場したにもかかわらず、一般の開発者は試す機会さえ得られていないからです。一部では、技術が発展するほど資本と権力を持つ大手企業や政府機関だけが高性能モデルを独占する構造が定着するのではないかという深い懸念が表明されています。

このような限定的な配布の中、Googleは将来の正式リリース時に適用される具体的なAPI料金表を公開しました。基本料金は入力100万トークンあたり4ドル、出力100万トークンあたり20ドルです。幸いなことに、リリース初期の2026年末まではプロモーション期間として、入力2ドル、出力10ドルという半額で提供されます。さらに、頻繁に使用するデータを再利用するコンテキストキャッシュ機能を活用すれば、入力コストを最大95%削減可能です。

しかし、いかに条件が魅力的でも、今使えなければ意味がありません。現在、一般のAPI利用者はもちろん、毎月サブスクリプション料金を支払っているGoogle AI Ultraユーザーですら、依然として長い待機リストで順番を待っている状況です。安全を理由に閉ざされた高性能AIの扉が、いつ一般のビルダーたちに開放されるのか、心待ちにする視線が注がれています。

閉ざされる高性能AI、新たなスタンダードになるか?

Gemini 4 Argonの配布方式は、今後の高性能AI技術が世の中に公開される方法を示す重要なマイルストーンとなるかもしれません。悪用のリスクが高い技術を無条件で誰にでも開放するより、身元が確かなパートナーにのみ限定的に経路を開く方式が、安全な技術供給の現実的な代替案として定着する可能性が高いからです。

100万トークン出力という圧倒的な技術を備えたAIが、実際のセキュリティ最前線でどのような成果を上げるのか。そして、この固く閉ざされた扉がいつか一般の開発者のために安全に開放されるのか、これからの動向を興味深く見守りたいと思います。

Loading comments…