articleニュース

Gemini 3.5 Flash、Terminal-Bench 2.1で76.2%を達成 — 他フロンティアモデルより4倍高速・コスト半額以下

I/O 2026で発表された 3.5 Flashがコーディング「Terminal-Bench 2.1」で76.2%(前世代Gemini 3.1 Pro比+5.9pt)を達成。他フロンティアより4倍高速で、コストは半額以下とされる。

概要

※本記事は公開情報をもとに編集部が再構成したサマリです。一次情報は出典欄をご参照ください。

は2026年5月19日のGoogle I/O 2026で 3.5 Flashを正式発表した。コーディングおよび型タスクに最適化された軽量フロンティアで、コーディング「Terminal-Bench 2.1」で76.2%(前世代Gemini 3.1 Pro比+5.9pt)を達成。出力あたりの速度は他フロンティアモデルの4倍、コストは半額以下とGoogleは主張している。

事実のポイント

  • 発表日:2026年5月19日(Google I/O 2026)
  • Terminal-Bench 2.1(コーディングベンチマーク):76.2%(前世代Gemini 3.1 Proの70.3%から+5.9pt)
  • GDPval-AA(実世界エージェントベンチマーク):1656 Elo
  • Atlas:83.6%
  • MMMU-Pro(理解):83.6%(の81.2%を上回る)
  • ARC--2ではGPT-5.5(84.6%)に対し72.1%と劣後
  • 料金:入力150万トークンあたり1.50ドル、出力100万トークンあたり9ドル
  • Gemini 3.5 Proは同時内部利用開始だが、広範な一般提供は2026年6月以降予定

用語・背景の補足

Terminal-Bench: コーディングエージェントの実力を評価するベンチマーク。実際の開発タスク(ターミナル操作・コード修正・デバッグ等)を自律的にこなせるかを測定する。バージョン2.1は2026年のフロンティアモデル評価に広く用いられている。

エージェントベンチマーク(GDPval-AA等): AIが複数ステップのタスクを自律的に達成できるかを評価する指標。「コードを書く→テスト実行→エラー修正→完了」のような連続タスクを対象にする。

Flash vs. Pro: Googleのモデルラインナップでは「Flash」が速度・コスト重視の軽量モデル、「Pro」が精度重視の高性能モデルを指す慣例がある。Gemini 3.5 FlashはPro級のコーディング性能を軽量モデルで実現したと位置づけられる。

注意点

  • ベンチマーク数値はGoogle公式発表値であり、第三者による独立評価と乖離がある可能性がある
  • 「4倍高速・半額以下」の比較対象となる「他フロンティアモデル」の具体的な組み合わせは公式発表の詳細を要確認
  • Gemini 3.5 Pro(より高性能版)の一般提供は2026年6月以降の予定

編集部見解

(追記予定)

info 公開情報をもとに編集部が再構成したサマリです。一次情報・追加情報は出典欄をご参照ください。

出典

arrow_backニュース・トピックス一覧へ Autais

5つのご相談入口

目的に合った入口からお気軽にどうぞ。すべてカジュアル相談OKです。