Gemini 3.6 Flash・3.5 Flash-Lite 公開、出力トークン 17% 削減・350 トークン/秒達成
30秒で把握
- 1Gemini 3.6 Flash・3.5 Flash-Lite 公開、出力トークン 17% 削減・3.5 Flash-Lite は 350 トークン/秒達成
- 23.6 Flash はコード品質 (DeepSWE 49% vs 37%)・知識作業 (GDPval-AA v2 1421 vs 1349) で向上、出力コストも低減
- 3本日から Gemini API・Gemini Enterprise・Gemini app で利用可能、エージェント型ワークフローのコスト削減と遅延短縮を実現
要約
Google DeepMind は Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber の 3 つの新モデルを公開した。3.6 Flash は 3.5 Flash 比で出力トークン使用量を 17% 削減し、DeepSWE ベンチで最大 65% 削減を実現しながら出力トークン当たりのコストを低下させた。3.5 Flash-Lite は Artificial Analysis Index で 350 出力トークン/秒を達成し、3.1 Flash-Lite 比で Terminal-Bench 2.1 で 54% (前世代 31%) を記録し、SWE-Bench Pro では 54.2% で 3 Flash (49.6%) を上回る。3.6 Flash は $1.50/1M 入力トークン・$7.50/1M 出力トークンで提供され、3.5 Flash-Lite は $0.3/1M 入力・$2.5/1M 出力で、両モデルは本日より Gemini API・Gemini Enterprise で利用可能。3.5 Flash Cyber は CodeMender で政府・信頼できるパートナー向けに限定パイロット配布予定。
あなたへの影響
エージェント型アプリケーション (自動化ワークフロー・コード解析・ドキュメント処理) を本番運用するチームは、3.6 Flash の低コスト高効率と 3.5 Flash-Lite の高スループット (350 トークン/秒) を組み合わせることで、従来より小さなモデルで同等性能を実現でき、API 利用料金と推論時間の両者を圧縮できる可能性がある。
推奨:価格改定と性能ベンチの詳細を確認し、既存 3.5 Flash ワークフローの検証と段階的移行を検討すべき。