articleニュース
Gemini 3.5 Flash、Terminal-Bench 2.1で76.2%を達成 — 他フロンティアモデルより4倍高速・コスト半額以下
Google I/O 2026で発表されたGemini 3.5 Flashがコーディングベンチマーク「Terminal-Bench 2.1」で76.2%(前世代Gemini 3.1 Pro比+5.9pt)を達成。他フロンティアモデルより4倍高速で、コストは半額以下とされる。
概要
※本記事は公開情報をもとに編集部が再構成したサマリです。一次情報は出典欄をご参照ください。
Googleは2026年5月19日のGoogle I/O 2026でGemini 3.5 Flashを正式発表した。コーディングおよびエージェント型タスクに最適化された軽量フロンティアモデルで、コーディングベンチマーク「Terminal-Bench 2.1」で76.2%(前世代Gemini 3.1 Pro比+5.9pt)を達成。出力トークンあたりの速度は他フロンティアモデルの4倍、コストは半額以下とGoogleは主張している。
事実のポイント
- 発表日:2026年5月19日(Google I/O 2026)
- Terminal-Bench 2.1(コーディングベンチマーク):76.2%(前世代Gemini 3.1 Proの70.3%から+5.9pt)
- GDPval-AA(実世界エージェントベンチマーク):1656 Elo
- MCP Atlas:83.6%
- MMMU-Pro(マルチモーダル理解):83.6%(GPT-5.5の81.2%を上回る)
- ARC-AGI-2ではGPT-5.5(84.6%)に対し72.1%と劣後
- API料金:入力150万トークンあたり1.50ドル、出力100万トークンあたり9ドル
- Gemini 3.5 Proは同時内部利用開始だが、広範な一般提供は2026年6月以降予定
用語・背景の補足
Terminal-Bench: コーディングエージェントの実力を評価するベンチマーク。実際の開発タスク(ターミナル操作・コード修正・デバッグ等)を自律的にこなせるかを測定する。バージョン2.1は2026年のフロンティアモデル評価に広く用いられている。
エージェントベンチマーク(GDPval-AA等): AIが複数ステップのタスクを自律的に達成できるかを評価する指標。「コードを書く→テスト実行→エラー修正→完了」のような連続タスクを対象にする。
Flash vs. Pro: Googleのモデルラインナップでは「Flash」が速度・コスト重視の軽量モデル、「Pro」が精度重視の高性能モデルを指す慣例がある。Gemini 3.5 FlashはPro級のコーディング性能を軽量モデルで実現したと位置づけられる。
注意点
- ベンチマーク数値はGoogle公式発表値であり、第三者による独立評価と乖離がある可能性がある
- 「4倍高速・半額以下」の比較対象となる「他フロンティアモデル」の具体的な組み合わせは公式発表の詳細を要確認
- Gemini 3.5 Pro(より高性能版)の一般提供は2026年6月以降の予定
編集部見解
(追記予定)
info 公開情報をもとに編集部が再構成したサマリです。一次情報・追加情報は出典欄をご参照ください。