Gemini 4 Argonが出力100万トークンに到達、Artificial Analysisの53点はOpus 5.5の58点に届かず一般提供の時期は未公表

机に積み上げられた大量の印刷書類のイメージ
目次

この記事のポイント

  • いつ:Google DeepMind が2026年9月30日(米国時間)に「Gemini 4 Argon」を発表した。日本では10月1日付で報じられた。
  • 何が:出力トークン上限が従来の6万4,000から100万に拡大した(約15.6倍で、「約16倍」と表現する媒体もある)。API の導入価格(期間限定の初期価格)は100万トークンあたり入力2ドル、出力10ドル。
  • 誰に:今日使えるのは、Fairwind Program の審査を通った組織と Google 社内チームだけ。一般には使えず、一般向けの自己サインアップ窓口も公開されていない。日本での提供条件と時期は未公表。
  • なぜ重要:100万という数字は確かだが、第三者指数ではOpus 5.5の58点に対しArgonは53点で、首位ではない。タスクあたりの平均出力はAstraの2倍超(6万2,000対2万7,000)で、長出力は課金されるトークンが増える向きでもある。
  • 読者は何をすべきか:今は発注や乗り換えの判断をせず、提供時期の公表を待つ。公表のベンチマーク表は自社比較の数字として、第三者指数と併せて読む。

出力上限は6万4,000から100万トークンへ、約15.6倍。導入価格は入力2ドル・出力10ドル

Google DeepMind は9月30日(米国時間)、Gemini 4 ファミリー初のモデル「Gemini 4 Argon」を発表した(9to5Google、CNBC)。

Gemini 3.1 Pro 以来、7か月超ぶりのフロンティアモデルで、直前は Flash 系が続いていた。なお「Gemini 4 Pro」は公式名ではなくコミュニティの通称とされる(ITmedia NEWS)。

用途として挙げられているのは、実環境のソフトウェア開発、法務や金融といった企業の知識業務、サイバーセキュリティ防御など、長時間にわたる複雑なワークフローである(MarkTechPost)。

最大の変更点は出力トークン上限である。トークンとは AI が文章を扱う最小単位で、出力上限は1回の応答で書き出せる量の天井にあたる。

従来の6万4,000から100万に広がり、計算上は約15.6倍にあたる。約16倍と表現する媒体もある(AI Watch)。

API の導入価格(期間限定の初期価格)は100万トークンあたり入力2ドル、出力10ドルと報じられている(VentureBeat、マイナビ)。

Google公表値では多くの項目で首位、FrontierSWE v2など判明した3項目では下回る

Google 公表とされるベンチマークは自社比較の数字である。勝ち越し数は媒体によって異なる形で伝えられており、両者の対応関係は確認できていない。

日本語媒体のpasqualepillitteriは「18項目中12項目で OpenAI の GPT-6 Astra と Anthropic の Claude Opus 5.5 を上回る」と報じ、英語媒体のDataCampとdev.toは「19項目中13項目で首位」(Anthropic の Claude Fable 5.1 を含む3モデル比較)と伝えている。

負けた項目の完全な内訳は報じられておらず、判明しているのは下表のうち「下回る」3行にとどまる。

ベンチマーク Argon 比較対象の値 結果
DeepSWE v1.1 77.9% Opus 5.5 74.2%/Astra 74.1% 上回る
GraphWalks BFS F1(25万6,000〜100万トークン) 84.2% Astra 71.8%/Opus 5.5 66.8% 上回る
Harvey Legal Agent Benchmark(法務タスク) 19.6% Astra 5.4%/Opus 5.5 3.8% 上回る
FrontierSWE v2 55.0% Astra 65.5%/Opus 5.5 62.3% 下回る
Terminal-Bench Science 0.1 57.6% Astra 68.1% 下回る
Terminal-bench 4.0 57.4% Opus 5.5 66.4% 下回る

注記:Google 公表値・自社比較。「上回る」3行は代表例の抜粋で、「下回る」3行は判明分のすべてである。勝敗の比率は全体と一致しない。「比較対象の値」は行ごとに比較相手が異なる。各指標の定義は未取得。出典は、上回る3項目が テクノエッジ、DataCamp、OfficeChai、下回る3項目が DataCamp、TrendingTopics、The Rundown。

Artificial Analysisでは53点、Opus 5.5の58点を下回り「差は縮めたが明確なリードではない」

第三者の指数では順位が変わる。Artificial Analysis の Intelligence Index は複数のベンチマークを合成した第三者の総合指標で、Argon は53点だった。Astra と Claude Fable 5.1 が同点で並び、Opus 5.5 は58点で上回る(Artificial Analysis)。

首位ではないが、3社の上位モデルが53点から58点の幅に収まっているとも読める。

The Decoder は見出しで「差は縮めたが明確なリードではない」と評している(The Decoder)。前節の表は自社比較の数字なので、第三者指数と併せて見たい。

タスクあたりの平均出力は Astra の2倍超(6万2,000対2万7,000)、ただし出力上限100万の約6%

同じ分析では、1タスクあたりの平均出力が Argon で6万2,000トークン、Astra で2万7,000トークンだった(Artificial Analysis、TrendingTopics)。出力トークン量の比は約2.3倍で、課金されるトークンが増える向きでもある。

課金が増える向きとはいえ、本稿の算術では、その平均6万2,000トークンは出力上限100万の約6%にあたる。ただし平均出力は1タスクあたりの合計量、上限は1回の応答の天井で、測る単位は揃っていない。それでも、上限の拡大は「書ける長さの天井が上がった」という意味であり、Artificial Analysis の計測の範囲では、平均がその天井に近づいているわけではない。

導入期間の終了後の価格は入力4ドル、出力20ドルになると二次ブログなどが報じているが、公式未確認で、導入期間の終了日も未公表である。金額の感覚としては、1タスクの出力6万2,000トークン分が導入価格で0.62ドルにあたる。

項目 導入価格 導入期間の終了後の価格(報道・公式未確認)
入力100万トークンあたり 2ドル 4ドル
出力100万トークンあたり 10ドル 20ドル
1タスクの出力6万2,000トークン分の目安 0.62ドル 1.24ドル

注記:最下行は本稿の算術(62,000トークン×出力単価)で、出力分のみの目安であり入力分は含まない。導入期間の終了後の値は、報道ベースの単価(公式未確認)を前提にした参考値。実測ではない。

一般には使えず、今日使えるのは Fairwind の審査を通った組織と Google 社内チームだけ

提供順は、Fairwind Program 経由で審査を通ったサイバー防御者、次に有料 API 顧客と Google AI Ultra 契約者、最後に開発者・企業・一般とされる。このうち第1段は発表と同時に始まっており、対象には Google 社内チームも含まれる(SC World、DataCamp)。Google は「できるだけ早く」とするだけで、第2段以降の時期は示していない(VentureBeat、The New Stack)。

段階 対象 時期
1 Fairwind Program の審査通過者(サイバー防御者)、Google 社内チーム 提供中(Fairwind は審査制)
2 有料 API 顧客、Google AI Ultra 契約者 未公表
3 開発者・企業・一般 未公表

Fairwind は、サイバー防御向けの Gemini 3.8 Flash Cyber とともに9月2日に新設された審査制のプログラムで、一般向けの自己サインアップ窓口は公開されていない(SiliconANGLE、DeepMind)。参加組織は650超でMFA必須との報道もあるが、少数の媒体にとどまる。

仕組みはCyber版の限定提供を扱った既刊で書いた。ただし既刊では汎用の Gemini 3.8 Flash が今日から使えたのに対し、今回は汎用側も一般には未提供という違いがある。

提供が始まるまでに見ておく3点

発注や乗り換えの判断は、次の3点が出てからで遅くない。

  • 提供時期:第2段(API 顧客・Ultra 契約者)以降の時期が公表されたら、自分がどの段に入るかを確認する
  • 日本での条件:日本語対応と提供条件は、複数の日本語媒体が未公表と記載しており、公表を待つ
  • 導入期間の終了日:報じられている4ドル・20ドルへの切り替え時期が公表されたら、前節の表の単価を差し替えて見積もる

まとめ

確かなのは、出力上限が6万4,000から100万トークンへ広がったことである。首位かどうか(第三者指数では53点対58点)、課金がどう増えるか、いつ使えるかの3点には留保が付く。

続報で判断が動くのは、有料 API 顧客と Google AI Ultra 契約者への提供時期が公表された時である。見積もりに使う単価は、導入価格のままか、終了日の公表を待って差し替えることになる。

今日使えるのは Fairwind の審査を通った組織と Google 社内チームだけで、一般には使えない。それまでは Google 公表値を自社比較の数字として読み、第三者指数と併せて見ておきたい。

編集後記

100万トークンという数字に目が行きますが、平均出力が上限の約6%にとどまる点のほうが、私には実感に近い印象です。第三者指数の Artificial Analysis で Argon が53点と、Opus 5.5 の58点に届かなかったのは、少し意外でした。一般にはまだ使えないので、数字を眺めるだけなのが少しもどかしいですね。

— CODE. 編集部

Photo: 2H Media on Unsplash

シェアいただけると励みになります!m(_ _)m
  • URLをコピーしました!
目次