Grok 4.7のスコアは先月と比較できない 公式が明記した理由

[最終更新]

Googleで優先するソースとして追加するボタン

1か月前に69.9%と報じたスコアが、今回の資料では40.4%になっていました。同じGrok 4.6の数字です。SpaceXAIが9月21日に公開したGrok 4.7の発表資料には、その理由も書かれています。物差しのほうが、先に作り直されていました。


SpaceXAIは2026年9月21日、AIモデル「Grok 4.7」を公開した。4.6より大きいベースモデルを用い、数時間規模のタスク中心の強化学習を長く回したという。コンテキストは50万トークン。価格は入力100万トークンあたり2ドル、出力6ドルからで4.6から据え置き、20万トークン超は別料金となる。

公式の比較表ではCursorBench 4.0が46.3%、Harveyの法務エージェントベンチマークが19.6%で、GPT-5.6 SolやFable 5.1を上回る項目と下回る項目がある。安全面ではLatchBioのバイオセーフティ評価が62.4%、HackerBench v0.3での危険な二重用途プロンプトの通過率が3.3%。Cursor、Grok Build、APIで同日提供。

From: 文献リンクIntroducing Grok 4.7

【編集部解説】

「69.9%」と「40.4%」は、どちらも同じモデルの点数

1か月あまり前、Grok 4.6の発表を紹介した記事では、CursorBenchのスコアを69.9%と書きました。今回のGrok 4.7の発表資料を開くと、同じGrok 4.6が40.4%と書かれています。

モデル名は同じです。確実に変わったと言えるのは、物差しのほうです。

SpaceXAIはモデルカードにこう明記しています。CursorBench 4.0は長時間かかるタスクを追加したため、そのスコアはCursorBench 3.2とは比較できない、と。同じGrok 4.6であっても、v3.2の69.9%と4.0の40.4%を並べて性能差を論じることはできません。

Terminal-Benchも同様です。v3.0から4.0へ上がる際に、CPU・メモリ・時間の配分が調整され、エージェントには最大8時間が与えられました。不安定なタスクが修正され、飽和したタスクも取り除かれています。Grok 4.6はv3.0で26%、4.0で20.3%ですが、この低下だけでモデルが後退したとは判断できません。

版が変わったときの数字の上下は、モデルの良し悪しとは別のところで起きます。AI業界の1か月は、ベンチマークの一世代に相当するようになりました。

スコアの正体は、モデル名ではない

版の表記が同じベンチマークでも、値は動きます。DeepSWE v1.1でのGrok 4.6は、8月の発表では65.9%、今回の発表では65.2%です。一方、AA-Briefcaseは今回「v1.1」と明記されており、8月の1577とはそもそも単純に比較できません。

モデルカードは、各ベンチマークの実施者を一つずつ明記しています。DeepSWEはDatacurve、Terminal-BenchはHarbor、FrontierSWEはProximal Labs、法務ベンチマークはVals AI、SWE-MarathonはAbundant AI。そしてハーネス(モデルを動かす外側の仕組み)も、mini-SWE-agent、Grok Build、Proximusと評価ごとに違います。

つまり、スコアという言葉で呼んでいるものの正体は、モデル名ではなく「あるチェックポイント × あるハーネス × ある努力設定 × ある実施者」という組み合わせの出力です。どこか一つが動けば、数字も動きます。

Grok 4.7には、low・medium・high・xhighという4段階の推論強度があり、既定はhighです。発表ページの比較表にある「Grok 4.7 xHigh」は、既定より一段上の設定を指します。

EEBenchを例に取ると、発表ページの表はGrok 4.7のxhighとGrok 4.6のhighを並べ、64.0%対53.0%としています。モデルカードにはGrok 4.6のxhigh(60.0%)も載っていて、設定を揃えると66.0%対60.0%になります。なおEEBenchのGrok 4.7の値は、発表ページが64.0%、モデルカードが66.0%と分かれているため、両方を書いておきます。

このスコアの横にある小さな文字を読む習慣が、これからのAI選びでは効いてきます。

何が実際に変わったのか

物差しの話を脇に置いて、モデルそのものを見ます。

Grok 4.7は、Grok 4.6より大きい新しいベースモデルです。強化学習を長く、難しいタスク構成で回し、数時間かかる問題に重みを置いたとされています。自分の作業を検証する力と、長いコンテキストを扱う力が改善されたという説明です。

公表値では、長時間タスク寄りの評価で大きな伸びが出ています。Terminal-Bench 4.0はGrok 4.6のhighが20.3%、Grok 4.7のxhighが38.0%。こちらは設定が揃っていません。設定を揃えた比較なら、数時間規模のタスク20問で測るSWE-Marathon v1.1が、同じhighで31.9%から46.0%へ上がっています。

一方、Fable 5.1がTerminal-Bench 4.0で57.9%、CursorBench 4.0で51.8%と上を行く項目もあります。SpaceXAIはその表を、自社の発表ページにそのまま載せています。

売り文句は性能の首位ではなく、価格対性能です。入力2ドル・出力6ドルは4.6から据え置きで、GPT-5.6 Solの4ドル・20ドル、Fable 5.1の10ドル・50ドルと並べたときの位置が、今回の主張になっています。ただしこの価格は20万プロンプトトークンまでの標準料金で、それを超えると入力4ドル・出力12ドルに上がります。長時間のエージェント作業を想定するなら、ここは先に確認しておきたいところです。

日本の仕事の現場に直接関わる点を一つ。Grok 4.7は、Microsoft Word・PowerPoint・Excel向けGrokアドインの既定モデルです。API、Grok Build、Cursor全プランに加えて、この3つが初日から入っています。同じ中身で出力が2倍速い「Fast」版もありますが、こちらはCursorとGrok Buildに限られ、公開APIでは提供されません。一方でweb版、モバイルアプリ、X上のGrokといった消費者向けの窓口は「後日」とされました。仕事の道具としての提供が、先に来ています。

知識の期限は、資料によって表記が違います。開発者ドキュメントは2026年5月、モデルカードは事前学習データを6月まで、補助訓練では8月までに生成されたデータを使ったとしています。両者の差を説明する記述は見当たりません。新しい話題を扱うときは、Web検索やX検索を併用するのが安全です。

安全性を、売り物の側に置いた

ここからが、今回いちばん性格の変わった部分です。

7月には、Grok Build CLIがAIの読んだファイルとは別に、Gitで追跡されたファイルとコミット履歴を外部へ送信していた問題も伝えました。その2か月後の発表で、SpaceXAIは安全性を売り物の側に置いてきました。

Grok 4.7は「まったく新しいセーフガードの構成」で作られ、拒否と脱獄耐性では自社史上もっとも強い、と説明されています。本文29ページのモデルカードが、その根拠を並べています。

HackerBench v0.3は、SpaceXAIの社内ベンチマークです。危険な依頼と、拒否してはいけない正当なセキュリティ業務の依頼を混ぜ、両方を測ります。危険・二重用途への応諾はGrok 4.7が3.31%、Grok 4.6が5.93%、Grok 4.5が7.8%。同じ表でGPT-5.6 Solは35.7%です。そして正当な依頼の誤拒否は0.31%。

断るだけなら簡単で、難しいのは「断りながら、断りすぎない」ことです。この二つを同じ表に並べている点は、評価されていい設計です。なお発表ページにある3.3%は設定の記載がありませんが、カードの数値との対応からhigh設定とみられます。xhighでは4.02%です。

LatchBioのバイオセーフティ評価は62.4%。正当な研究依頼と、現実的なシナリオの中に危険を隠した依頼を混ぜて測るBioSecBench-Refusalという評価です。Grok 4.6が45.6%、GPT-6 Astraが25.5%、Opus 5が31.8%でした。

そしてSpaceXAIは、サイバーセキュリティのパートナー企業に、招待制でGrok 4.7のレッドチーム能力を開放し始めました。米国時間9月2日にGoogleがGemini 3.8 Flash Cyberを、Fairwind Programで承認された防御側の組織に限って提供したのと、形としては同じ方向です。攻撃にも使える能力を、防御側にだけ配る。この設計が、業界の作法として固まりつつあります。

下がった数字が、そのまま載っている

このモデルカードでいちばん目を引いたのは、高いスコアではありませんでした。下がった数字が、そのまま載っていることです。

実験手順の誤りを指摘させるProtocolQAは79.6%から70.4%へ。ウイルス学の実務問題を扱うVCTは67.4%から63.0%へ。LAB-Bench、BixBench、WMDP-Bioも下がっています。

モデルカードは理由をこう説明します。これは拒否訓練を強めた結果ではなく、より安全な強化学習環境と、訓練データの選び方が反映されたものだ、と。断れるようにして数字を下げたのではない、という説明です。

もう一つ。自傷と危機対応の評価で、不合格の割合が0.84%から1.05%へ上がっています。この指標には、有害な助言だけでなく、断ったうえで支援先を案内しなかった場合や、危機の意図を読み取れなかった場合も含まれます。全体が良くなったと言いたい発表の中で、この数字は載せなくても誰も気づかなかったはずのものです。

そして、モデルカードの冒頭近くにこの一文があります。黙って知能を下げたり、他のモデルへ切り替えたりすることはない。

同じモデルカードの比較表では、Anthropicのモデルに「with fallback」という評価条件の注記が付いています。この注記が具体的に何を指すのかは、資料からは読み取れません。ここでも、数字だけでなく、その横にある評価条件を確認する必要があります。

Grok 4.5が7月、4.6が8月12日、そして4.7が9月21日。2か月半で3世代です。

この速度では、先月のスコアを今月の数字とそのまま並べられない場合があります。読者の側に残る習慣は、たぶん一つだけです。数字そのものより、数字の横に書かれた版番号と設定名を見る。今回SpaceXAIは、それを確かめるための材料を本文29ページ分、公開しました。

物差しは、モデルの進歩や評価そのものの課題に合わせて作り直されていきます。だからこそ、数字は版番号と条件から切り離せません。

【関連記事】

Grok 4.6をSpaceXAIが公開|長時間エージェントへ競争軸が移る
本稿で物差しの比較対象とした前世代モデルの解説。CursorBench v3.2で69.9%と報じた、当時の記事そのものである。

Grok Build CLI、リポジトリデータを外部送信|通信解析で判明したデータ管理の問題
Grok Build CLIがGitの追跡ファイルとコミット履歴を外部送信していた問題。本稿の安全性の節で触れた経緯を詳しく扱う。

Gemini 3.8 Flash発表|サイバー版は650組織に限定
Googleがサイバー特化版を防御側の組織に限って配った事例。本稿で並べた、能力を限定して配布する設計の先行例にあたる。

【編集部後記】

Grok 4.7には、中身は同じで出力が2倍速い「Fast」という版があります。使えるのはCursorとGrok Buildだけで、公開APIにはありません。料金も2倍です。

同じモデル名でも、どこで動かすかで速さと値段が変わる。本文で書いた「版番号と設定名を見る」という話は、提供チャネルにもそのまま当てはまりました。名前で買えるものが、年々少なくなっています。


【用語解説】

CursorBench
コーディング支援ツールCursorの実作業を模した評価。今回の4.0は長時間タスクを追加しており、3.2とはスコアを比較できないと公式が明記している。

Terminal-Bench
端末上でエージェントに実務を解かせる評価。4.0では計算資源と時間の配分が調整され、最大8時間が与えられた。飽和したタスクは除かれている。

DeepSWE
実在のソフトウェア不具合を、エージェントが自力で修正できるかを測る評価。提出されたパッチを別の検証環境に適用して採点する。

EEBench
電子回路設計の課題を解かせる評価。

SWE-Marathon
数時間規模のソフトウェア開発課題20問で構成される評価。

ハーネス
モデルを動かす外側の仕組み。ファイル操作やツール実行の手順を定めるため、同じモデルでもハーネスが違えばスコアが変わる。

推論強度(reasoning effort)
回答前にどれだけ考えさせるかの設定。Grok 4.7はlow・medium・high・xhighの4段階で、既定はhigh。xhighは時間と費用をかけて深く考えさせる最上位の設定である。

チェックポイント
学習途中で保存されたモデルの実体。同じ製品名でも、提供されているチェックポイントが同一とは限らない。

HackerBench
SpaceXAIの社内評価。危険な依頼への応諾率と、正当なセキュリティ業務を誤って断る率を同時に測る。

二重用途(dual-use)
防御にも攻撃にも使える技術や情報のこと。

BioSecBench-Refusal
LatchBioが公開する評価。正当な生物学研究の依頼と、危険を隠した依頼を混ぜ、見分けられるかを測る。

ProtocolQA
実験手順書に混入した誤りを指摘させる評価。

VCT
ウイルス学の実務的な判断力を問う評価。

モデルカード
モデルの訓練方法、評価結果、安全性の測定結果をまとめた開発元の公開文書。

【参考リンク】

SpaceXAI(外部)
Grokシリーズを開発するSpaceXの人工知能部門。2026年2月にSpaceXがxAIを買収し、7月に現在の社名となった。

Grok 4.7 開発者ドキュメント(外部)
モデル名、コンテキスト長、価格、推論強度、提供リージョンなど、API利用時の仕様を掲載する。料金は20万トークンを境に変わる。

Grok 4.7 モデルカード(外部)
本文29ページ。各ベンチマークの実施者とハーネス、推論強度に加え、発表ページには載っていない安全性評価の生データを収録している。

Cursor(外部)
AIコーディングエディター。Grok 4.7は全プランで利用でき、比較表の先頭に置かれたCursorBenchの提供元でもある。

Latch Biosecurity(外部)
フロンティアAIの生物学的リスクを評価する事業者。記事に出てくるBioSecBench-Refusalを公開し、独立した評価を実施している。

Vals AI|Harvey Legal Agent Benchmark(外部)
法務エージェント評価Harvey Legal Agent Benchmarkの実施主体。各社モデルの結果を項目ごとに公開している。

【参考記事】

SpaceXAI Releases Grok 4.7 for Coding and Knowledge Work(外部)
発表内容を時系列で整理した記事。HackerBench v0.3の3.3%という数値や、Grok 4.6との関係まで押さえている。

SpaceX launches Grok 4.7 with long-horizon processing, safety upgrades(外部)
ベースモデルと強化学習の関係を技術的に解説する。Fable 5.1やGPT-6 Astraとの勝敗を、項目ごとに整理している。

SpaceXAI releases Grok 4.7 for coding and knowledge work(外部)
主要ベンチマークの数値を一覧で列挙した記事。提供チャネルの広がりと、SpaceXAI自身の投稿にも触れており、全体像をつかみやすい。

Grok 4.7 Is Coming Soon: 2.1T Model, SpaceX Training, and the Release Window(外部)
発表前の記事。公表済みの事実と未公表の推測を明確に分けており、2.1兆パラメータ説がどこから出た話なのかを確認できる資料である。

xAI Weekly: Grok 4.7 Targets September 12 Launch(外部)
発表前の週次まとめ。8月22日から3〜4週間、そして10日へと予告が動いた経緯が、日付つきで記録されている。読み物としても面白い。

Googleで優先するソースとして追加するボタン
投稿者アバター
山本 達也 代表社員
合同会社デジタルの窓口 代表。ウェブ解析士。生成AI・サイバーセキュリティ・ 宇宙開発領域を中心に執筆。

おすすめ記事