Gemini 4 Argonの比較表では、19行のうち13行でArgonが単独首位に立ちました。ところが、その13行は出所が3通りに分かれ、測り方に差のある行も含まれます。同じ「首位」でも、重みはそろっているのでしょうか。表の数字だけでは見えない、渡し方の設計も気になります。
Googleは2026年9月30日(米国時間)、新たなフロンティアモデル「Gemini 4 Argon」を発表した。ソフトウェア開発、法務・金融などの知的業務、サイバー防御に強みを持つとし、出力トークンの上限を従来の6万4000から100万に引き上げた。GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5との比較表では、DeepSWE v1.1で77.9%を示した。
提供はFairwind Program経由の信頼できるサイバー防御者から始め、サイバー向けのガードレールを外して渡す。有料API利用者とGoogle AI Ultra契約者にも広げる計画だ。導入価格は100万トークンあたり入力2ドル、出力10ドルで、導入期間後は4ドルと20ドルになる。
From:
Gemini 4 Argon: our next era of frontier intelligence
【編集部解説】
Gemini 4 Argonの発表でまず目に入るのは、比較表です。GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5と並べた19行のうち、Argonが単独で首位なのは13行、同率が1行、他社が上なのは5行でした。ここでの首位はこの4モデルの中での順位で、たとえばHarvey’s Legal Agent BenchmarkはVals AIの一覧全体では73モデル中5位です(10月1日時点)。
この表を読みやすくしているのは、Google自身が評価方法を別紙で開示している点です。Argonの値は、原則として最高の思考設定のpass@1で、多数決や並列の推論を使わない単一試行で測られています。例外も明記されており、小規模な評価は複数回の平均、OSWorld-2.0は単一試行を3回行った最大値です。他社の値には、各社の自己申告、公開リーダーボード、Googleによる自社測定が混在します。
首位13行を出所で分けると、表の読み方が見えてきます。7行は、Vals AI、Zapier、Surgeが出所の行です(Vals Index、AutomationBench、Vals Finance Agent v2、Harvey’s Legal Agent Benchmark、Vibe Code Bench、RiemannBench、Chartography)。3行は、Googleが全モデルを自社測定した行です(LABBench 2とGraphWalksの2条件)。
残る3行は、測り方に差が含まれています。DeepSWE v1.1では、Argonの値だけがGoogleの自社測定(mini-swe agentというハーネス)で、Astraは公開リーダーボード、Fable 5.1とOpus 5.5は各社のシステムカードの値です。LVBenchは動画から取り出すフレーム数が、Geminiで1秒に1枚、Astraで800枚、Fable 5.1で300枚、Opus 5.5で600枚と異なり、Googleは各社のAPIの制約によると説明しています。Agent’s Last Examは、Argonが安全フィルターを有効にして5時間の枠で測り、Fable 5.1の値は公開リーダーボードにないため空欄です。
首位でない5行も、表に残されています(FrontierSWE v2、Terminal-bench 4.0、PostTrainBench、Terminal-Bench Science 0.1、OSWorld-2.0)。Terminal-Bench Science 0.1のArgonの値は自社測定で、検証のタイムアウトを6倍にしています。他社の値は公式リーダーボードから採られています。条件を開示し、首位でない行も並べる表は、読む側が自分の用途に引き寄せて使えます。
実務の選定に使うなら、行の合計より、自分の仕事に近い行を探すのが近道です。長大な入力を扱う仕事なら、GraphWalksの256kから1Mトークンの条件で、Argonが84.2%、次点のAstraが71.8%と12.4ポイント開きました。画面操作ならOSWorld-2.0のオフライン部分集合でAstraが72.6%、Argonが69.2%です。ターミナル操作を中心にするTerminal-bench 4.0では、Opus 5.5の66.4%が最も高く、Argonは57.4%でした。
差の大きさも行ごとに違います。Vals Indexは68.9%対67.0%、Chartographyは71.6%対71.0%と、2ポイント未満の行もあります。
もうひとつ読み違えやすいのが「100万トークン」です。これは入力できる長さではなく、1回の応答で出力できる上限で、従来の6万4000トークンから引き上げられました。Googleは、数十万トークン規模を1回の流れで生成できる余裕が、難しい問題を一度に解くための推論の深さにつながると説明しています。
社内の事例は具体的です。libgav1では、既存のRust版を土台に3万2000行のSIMDコードをプロファイルに基づく実験で置き換え、同じ映像出力のまま既存のRust版の2.7倍の速さを得たとGoogleは説明しています。データセンターのメモリ最適化は、展開されれば300TiB超を解放できる見込みで、総削減は500TiBから1PiBと見積もられています。Zirconカーネルを含む最大80万行超のRust移行は、本番展開に先立って、自動と手動の監査、エミュレーション試験、レビューを受けている最中です。量子コンピューターの研究では、アルゴリズムの部品に必要な資源(量子ビット×ゲート数)の最適化で、ある例では数分で公表済みの基準を40%上回ったとGoogleは説明しています。
サイバー防御の数字は2種類に分かれます。1つは公開リーダーボードのCWE-bench v1です。Argon、GPT-6 Astra、Grok 4.7が68%で並び、Claude Opus 5.5が67%、Claude Fable 5.1が58%でした。同率の3者は同じ順位(T1)を共有し、並び順はpass@4で決まる方式で、図ではGrok 4.7、Argon、Astraの順に並びます。Googleは「同率首位」と表現しています。使われたハーネスはモデルごとに異なり、ArgonはAntigravity、AstraはCodex、Grok 4.7はopencode、Opus 5.5とFable 5.1はClaude Codeです。
もう1つは、Googleの社内評価と、Google傘下のWizが持つ社内試験です。20言語のソースコードから脆弱性を探す課題で、Argonは85.8%、前世代のGemini 3.8 Flash Cyberは71.0%でした。ソースコードなしでWebアプリの脆弱性を実証できるかを測るWizの試験では、70.9%と58.2%です(方法論は前者を再現率と説明し、図はどちらもpass@1と記しています)。比較の相手はGoogle自身の前世代で、他社のモデルは並んでいません。この2つは前世代からの伸びを示す数字です。なお図の縦軸は20%から始まるため、棒の長さの比は数値の比と一致しません。Wizの「Scan for Good」では、世界の病院が使う医療ソフトに、従来のフロンティアモデルが見逃していた重大な脆弱性をArgonが見つけたとGoogleは説明しています(Googleの説明による1件の事例です)。
安全面では、AIが読み込む文書やWebページに仕込まれた指示でAIを乗っ取る、間接プロンプトインジェクションへの強さが示されました。Gray Swanの評価で、攻撃者に15回の試行機会を与えた場合(k=15)の攻撃成功率(低いほどよい)は、Argonが0.7%、Claude Opus 5.5とClaude Fable 5.1が1.0%、Claude Opus 5が4.6%、Gemini 3.8 Flashが5.5%、GPT-6 Astraが8.5%でした。上位3つが1%前後に並んだことは、エージェントに外部の情報を読ませる運用にとって心強い材料です。0.3ポイントの差で優劣は言い切れません。
提供の順序にも、今回の特徴があります。3.8 Flash Cyberは一般向けの3.8 Flashと同じ日に発表され、サイバー版だけがFairwindに限られました。今回は、新たなフロンティアモデルのArgonそのものが、まず防御者と信頼できるテスターへの先行提供から始まり、一般向けはあとから続きます。次の提供先は有料APIの利用者とGoogle AI Ultraの契約者で、時期は「できるだけ早く」とされています。Fairwindの審査や利用条件は、3.8 Flash Cyberの記事で整理しています。
防御者とGoogle社内には、サイバー向けのガードレールを外した状態で渡すとされています。ガードレールを外した先行提供と、止める仕組みの整備が、同じ発表の中で並んで語られていることが、今回の設計の特徴だと読んでいます。発表は、モデルの思考の過程と行動を監視して必要なら実行を止める対策のほか、危険な訓練や評価の前に環境を隔離して封じる強化、米政府の任意の事前アクセス手続きへの参加も挙げています。
日本の読者にとっては、現時点では一般提供されておらず、Fairwind経由の防御者や信頼できるテスターへの先行提供が進んでいる段階です。それ以外の開発者や企業は、一般向けの提供を待つことになります。待つあいだにできる準備は、19行から自分の仕事に近い行を選び、同じ種類の課題を手元に用意しておくことです。価格は導入期間のあいだ、100万トークンあたり入力2ドル・出力10ドルで、期間後は4ドルと20ドルに倍になります。導入期間の終わりの日付はまだ示されていないため、試算は期間後の価格でも成り立つか見ておくと見通しが立ちます。
次に読みたいのは、防御者が先に使えるこの期間に、どんな脆弱性がどれだけ直されたかの報告です。Wizの事例が最初の1件だとすれば、件数と中身が積み上がったとき、この表の数字は、実際の守りの成果で裏づけられていきます。
【用語解説】
pass@1/pass@4
試行1回で課題に成功した割合がpass@1。4回の試行のうち1回でも成功した割合がpass@4。
ハーネス
モデルにツールの呼び出しやコードの実行・検証をさせる周辺の仕組み。同じモデルでも、ハーネスが変わると成績が変わりうる。
システムカード
開発企業がモデルの公開時に出す、性能評価や安全対策をまとめた文書。
公開リーダーボード
各モデルの成績を測定して並べた、公開の順位表。
間接プロンプトインジェクション
AIが読み込む文書やWebページに悪意ある指示を仕込み、AIの行動を乗っ取る攻撃。
ガードレール
モデルが有害な要求に応じないようにする安全対策。ここではサイバー分野の拒否や制限の仕組みを指す。
CWE-bench v1
Collinear AIが作る防御向けの評価。実在のコードベースから脆弱性を見つけて修正する120課題を、決定的な検証と3つの判定で採点する。
DeepSWE v1.1
実世界の長い手順にわたるソフトウェア開発タスクで、モデルの性能を測る評価。
GraphWalks
グラフをたどる課題(幅優先探索)をF1で採点する長文脈の評価。Googleは128kトークンまでと、256kから1Mトークンの2つに分けて測っている。
Vals Index
Vals AIによる総合指標。金融、コーディング、法務、税務の仕事を、米国のGDPへの寄与度で重みづけして測る。
再現率
本来見つけるべきもののうち、実際に見つけられた割合。
SIMD
1つの命令で複数のデータをまとめて処理する並列演算の方式。
TiB/PiB
2進接頭辞によるデータ量の単位。1PiBは1024TiB。
Zircon
Googleの基本ソフト「Fuchsia」のカーネル(中核部分)。
【参考リンク】
Google DeepMind「Gemini」(外部)
Google DeepMindが提供するGeminiモデルの公式紹介ページ。各モデルの位置づけや性能の概要を掲載している。
Fairwind Program(外部)
重要インフラを担う防御側に、先進的なモデルへの早期アクセスを提供するプログラム。参加には審査があり、再配布は認められない。
Wiz(外部)
Google傘下のセキュリティ企業。Argonの評価に使われた侵入試験と、無償の公共インフラ支援Scan for Goodを手がける。
Vals AI(外部)
Vals IndexやHarvey’s Legal Agent Benchmarkなどの評価結果を公開しているVals AIの公式サイト。
Collinear AI(外部)
CWE-benchを作る企業。コーディングや企業ツールの利用などを対象に、検証可能な強化学習環境と訓練データを手がける。
Google Antigravity(外部)
Googleのエージェント型開発基盤。ArgonはCWE-benchで、このAntigravityのハーネスを使って測られた。
【参考記事】
Gemini 4 Argon Model evaluation: Approach, methodology & results|Google(外部)
Googleが公開した評価方法の資料。思考設定、他社値の出所、ベンチマークごとの測定条件を行単位で記し、結果表も載せている。
CWE-bench: a cybersecurity benchmark by Collinear AI|Collinear AI(外部)
CWE-bench v1の順位表。同率は順位を共有し、pass@4で並び順を決める。モデルごとのハーネスや1回あたりの費用も載っている。
Gemini 4 Argon Benchmarks, Cost and Capabilities|Vals AI(外部)
Vals AIが測ったArgonの成績。10月1日時点でVals Indexは68.90%で1位、Harveyは19.58%で5位。
Harvey’s Legal Agent Benchmark Leaderboard and Methodology|Vals AI(外部)
Vals AIが保有する検証用データで測った法務評価。10月1日時点でMuse Spark 1.2が25.42%で首位。
【関連記事】
Gemini 3.8 Flash発表|サイバー版は650組織に限定
Gemini 3.8 Flashと同日に出たサイバー版は、Fairwind経由の限られた組織にだけ提供された。審査や利用条件を整理している。
Gemini、評価中に実在3社へ到達|Googleが報道後に認める
評価中のGeminiが実在3社のシステムへ到達した事案を、Googleが報道後に認めた経緯と、各社の開示基準の違いを整理している。
Claude Opus 5.5|「40%安い」はどの設定で成り立つか
Opus 5.5の「40%安い」が成り立つ設定を検討し、max設定では1タスクの費用がOpus 5と同水準だった独立計測を紹介している。
【編集部後記】
ガードレールを外したモデルを守るのは、モデルの内側だけではないようです。Fairwindの公式ページには、参加組織がArgonに触れさせてよい相手を、社内のサイバー防御、インシデント対応、ペネトレーションテストの各チームに限る条件が載っています。利用者ごとの認証や使用記録も求められ、アクセスの再配布や転売は認められていません。
モデルの安全対策と、使う側の約束事。両方がそろって「渡せる」状態になるのだとすれば、一般提供のとき、この約束事の代わりに何が働くのでしょうか。


















