@haram

Gemini 3.6 Flash登場 — Flash-Liteとの比較、自分に合ったコスパモデルは?
2026年7月21日、Googleが新たな高コスパAIモデルラインナップであるGemini 3.6 FlashとGemini 3.5 Flash-Liteを正式に発表しました!今回のリリースは、単に賢いモデルを作るという競争から離れ、大規模なAIエージェントサービスをより速く、より低コストで実現することに注力しています。Google AI StudioやAPIですぐに試せるこれら2つのモデルの実践的な違いと、自分のサービスに最適な選び方を分かりやすく解説します。
Gemini 3.6 Flash: より賢く、より経済的になったメインモデル
Gemini 3.6 Flashは、賢さとコストパフォーマンスを両立させた今回のラインナップの中核モデルです。100万トークンの余裕あるコンテキストウィンドウをサポートし、2026年7月21日のリリース時点での料金は、100万トークンあたり入力1.50ドル、出力7.50ドルに設定されました。前モデルのGemini 3.5 Flashと比較して出力コスト自体が下がっただけでなく、長期的に費用を大きく節約できる賢い秘密がもう一つ隠されています。
それは、回答がより明確かつ簡潔になったという点です。不要な説明や重複表現を自動的に削減するチューニングのおかげで、同じ質問をしても旧バージョンより平均17%ほど出力トークンを抑えられます。回答の文字数は減りましたが、必要な核心情報はすべて含まれているため、料金を支払う開発者やサービス運用者にとっては見えない割引を受けているようなものです。
性能も一層強力になりました。コーディングや数学的推論能力を評価する主要指標で顕著な性能向上を見せています。日常的な業務自動化はもちろん、外部ツールを自在に操る精巧なエージェント作業までこなす賢い働き手です。最近、開発者の必須ツールであるGitHub Copilotにも搭載され、コーディング補助ツールとしての実用性も証明されています。
Gemini 3.5 Flash-Lite: 超高速、超低コストの軽量エージェント
スピードとコスト削減が最優先のサービスであれば、Gemini 3.5 Flash-Liteが優れた選択肢となります。2026年7月21日時点の価格は、100万トークンあたり入力0.30ドル、出力2.50ドルと、メインモデルの3.6 Flashと比較しても際立って安価です。
スピードもまた圧倒的です。1秒間に350トークンを超える高速処理能力を備えており、ユーザーがエンターキーを押すとほぼリアルタイムで応答が返ってきます。実際、AI分析機関Artificial Analysisのテストでは、最大で毎秒388.8トークンという驚異的な速度を記録しました。最初のトークンが出力されるまでの時間も平均1.2秒前後と非常に短いです。
このモデルは、複雑な推論を必要としない大量の単純作業に向いています。数万件のテキストデータから必要な情報だけを抽出する「固有表現抽出」、顧客の問い合わせを適切なカテゴリに分ける「ルーティング」、そして複数のサブエージェントを制御する調整役として非常に効果的です。
すべての作業に重くて高価なモデルを使う必要はありません。3.5 Flash-Liteのように軽くて速いモデルを適材適所に配置すれば、運用コストを大幅に下げつつ、快適なレスポンスを確保できます。
AIの思考を制御する: thinking_configの活用法
2026年7月21日のリリースにおける最も興味深い技術的変化は、AIが回答を出す前に論理的ステップを設計する「推論(Reasoning)機能」を、開発者が直接制御できるようになったことです。Googleはこのためにthinking_configという洗練された調整ツールを導入しました。
このオプションを活用すれば、サービスの特性に合わせて応答速度、賢さ、コストのバランスを自由自在に調整可能です。
メインモデルのGemini 3.6 Flashはデフォルトが「MEDIUM」に設定されており、適切な推論プロセスを経て論理的な回答を出します。この際に消費される思考用トークンは、通常の出力トークンと同じ単価で計算されます。一方で、リアルタイム性が命のGemini 3.5 Flash-Liteは、この推論段階がデフォルトで「MINIMAL」に設定されており、思考過程をスキップして即座に応答を出力します。
新しいGoogle GenAI SDKを使えば、数行のコードでこの設定を簡単に微調整できます。まずはライブラリをインストールしましょう。
pip install google-genai次にPythonコードでthinking_levelオプションを希望のレベルに設定すれば完了です。
from google import genai
from google.genai import types
client = genai.Client()
# Gemini 3.6 Flash에서 추론 강도를 높여 호출하는 예시
response = client.models.generate_content(
model="gemini-3.6-flash",
contents="C++ 코드에서 데드락이 발생할 수 있는 위치를 찾고 해결책을 제시해줘.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
# MINIMAL, LOW, MEDIUM, HIGH 중 하나를 선택할 수 있습니다
thinking_level=types.ThinkingLevel.HIGH
)
)
)
print(response.text)調整可能な推論の深さは4段階に分かれています。
- MINIMAL: 思考を最小限に抑え、コストと待ち時間を最大限に短縮します。単純な分類やデータ抽出に最適です。
- LOW / MEDIUM: 一般的なチャットボットや要約、マルチターン対話に適したバランス設定です。
- HIGH: 複雑なビジネスロジックの計算や緻密なコードデバッグなど、深い思考力が必要な作業に向いています。
単純なルーティングや迅速な通知作成などのエージェント作業はMINIMALでコストを抑え、難しい知的労働にはHIGHで精度を最大化するといった、賢いアーキテクチャの最適化が可能になりました。
セキュリティ特化型Gemini 3.5 Flash Cyberはどこで使える?
Googleは今回の発表で、セキュリティ専門のAIモデルであるGemini 3.5 Flash Cyberも公開しました。このモデルはソフトウェアのセキュリティ脆弱性を自ら発見・検証し、修正用のパッチコードまで自動作成する高度な能力を備えています。
残念ながら、このモデルは一般的なAPIやGoogle AI Studioでは利用できません。技術が悪用されるリスクがあるため、政府機関や信頼できるパートナーを対象とした限定的なパイロットプログラムとしてのみ提供されます。
その代わり、この特化モデルはGoogleのコードセキュリティエージェントプラットフォーム「CodeMender」の中で強力なチームプレーヤーとして活躍します。CodeMenderは複数のFlash Cyberモデルをチームのように連携させます。一般の開発者がAPIで直接呼び出すことはできませんが、高性能エージェント技術がセキュリティ実務にどう適用できるかを示す興味深い事例です。
サービスに適したモデルの選び方
まとめると、自分のサービスに適したモデルを選ぶ基準は明確です。コード作成や複雑な業務、あるいはGitHub Copilotを通じた高性能な開発補助が必要なら、回答が簡潔で賢くなったGemini 3.6 Flashが適しています。一方で、単純作業の分類や高速ルーティングのように、スピードと徹底したコスト削減が最優先のパイプラインには、Gemini 3.5 Flash-Liteが優れた代案となります。
自分が作るAIエージェントの役割を細分化し、Google AI Studioで直接両モデルの性能と応答速度を比較しながら、サービスに最適なバランスを見つけてください!