Sonnet 5.5は、Terminal-Bench 4.0でOpus 5.5を上回りました。ただし、70.6%を出すのにかかった費用は、1試行あたり約12.5ドル。Opus 5.5が66.4%を出した設定の約1.7倍です。単価はSonnetのほうが半分なのに、なぜでしょうか。
Anthropicは2026年9月28日、Claude 5.5ファミリーの第2弾となるClaude Sonnet 5.5を公開した。Sonnet 5より30%以上速く、多くの作業で1タスクあたり最大30%安いとする。単価は入力100万トークン2ドル、出力10ドルで据え置いた。
Terminal-Bench 4.0では70.6%を記録し、Sonnet 5の10.3%、Opus 5.5の66.4%を上回った。System Cardによると、70.6%は最大のeffortであるmaxの値で、Opus 5.5の値はxhighで測ったものである。Anthropicは、複雑で判断が要る仕事ではOpus 5.5が明確に強いとしている。
From:
Introducing Claude Sonnet 5.5
【編集部解説】
Sonnet 5.5の「70.6%」は、最大の設定(max)まで費用をかけたときの値です。この数字を条件とセットで読むことが、今回の発表をいちばん役立つ形で受け取る近道だと私は考えます。
70.6%が出た設定
Terminal-Bench 4.0は、コマンドライン上で複数の手順からなる実務的な作業を、AIがどこまで完了できるかを測るベンチマークです。66のタスクで構成され、計算生物学や物理シミュレーション、CAD、形式証明、GPUの性能改善など、科学や先端工学に近い課題が中心になっています。
Anthropicが公開したSystem Card(モデルの評価報告書)によると、70.6%は、Claude Codeを最大のeffort(思考の深さの設定)で動かし、インターネットにつながない環境で66タスクを各5回、計330試行した平均です。セーフガード(危険な依頼を検知する仕組み)は有効なまま測られていて、検知された依頼は原則として代わりのモデルが受け持ちます。その割合は、依頼の1.2%、試行の1.5%で、1回の試行だけは、応答せずに止まりました。
Opus 5.5と並べると
発表ページの表では、Sonnet 5.5の70.6%がOpus 5.5の66.4%を上回っています。ここで押さえたいのは、66.4%がOpus 5.5の最高スコアであるxhighの値だという点です。Opus 5.5をmaxで測ると64.8%で、System Cardはxhighとの差を誤差の範囲内としています。maxどうしで並べれば70.6%対64.8%、Sonnet 5.5のほうが5.8ポイント高い結果です。
標準誤差(測定のばらつきの目安)は、試行を独立とみなすと、Sonnet 5.5が±2.5ポイント、Opus 5.5が±2.6ポイントです。この2つを独立と仮定して合成すると、70.6%と66.4%の差の標準誤差は約3.6ポイントになります。ただし、同じ課題を使う2つの結果の差は、この数字だけでは優劣を断定できません。maxどうしの5.8ポイントの差も同じです。両モデルとも、セーフガードで検知された依頼が代わりのモデルに回る点は同じで、その割合はOpus 5.5のほうが高く、試行の10%に及びます。Anthropic自身も、判断を積み重ねる複雑で答えの決まっていない仕事では、Opus 5.5が明確に強いと書いています。
そのうえで、Sonnetというシリーズが、Opus 5.5の最高値と肩を並べる水準に届いたことは大きな一歩です。Sonnet 5の10.3%からは60ポイント以上の伸びで、Sonnet 5と5.5のあいだでeffortの各段階の思考量が調整し直されている点も踏まえて読むと、より正確に受け取れます。
費用の軸で見ると
発表ページには、effortごとのスコアと1試行あたりの費用を描いたグラフがあります。グラフの目盛りから読み取ると、Sonnet 5.5はLowで約20%(約0.76ドル)、Mediumで約29%(約0.83ドル)、Highで約43%(約1.9ドル)、Xhighで約62%(約5.3ドル)、Maxで70.6%(約12.5ドル)です。同じグラフのOpus 5.5は、Mediumで約58%(約2.9ドル)、xhighで66.4%(約7.3ドル)、maxで約65%(約11.2ドル)にあたります。
まず目を引くのは、下の段の働きです。Sonnet 5.5のMediumは、Sonnet 5の最高点(約10%、約12ドル)を、3倍近いスコアで、費用は10分の1未満で上回ります。Anthropicの発表ページにある、MediumでSonnet 5の最高点を大きく上回るという説明と、グラフは合っています。
一方で、費用を横軸にそろえると、約8ドルまではOpus 5.5の線がSonnet 5.5の線の上にあります。Mediumどうしなら、約29%と約58%で、費用は約0.83ドルと約2.9ドルです。70.6%は、グラフ上でもっとも費用のかかる点で、Opus 5.5のxhighの約1.7倍にあたります。Anthropicが、低めのeffortでOpus 5.5を補うモデルと位置づけているのは、この費用の軸を指しているのだと私は読みます。
既定の設定で使うと
Sonnet 5.5の既定は、Claude Codeとアプリがmedium、Claude PlatformのAPIがhighです。Opus 5.5は、Claude APIではmediumが既定です。グラフで読むと、APIの既定どうしなら、Sonnet 5.5のHigh(約43%、約1.9ドル)とOpus 5.5のMedium(約58%、約2.9ドル)が向き合います。
Anthropicの開発者向け資料は、Sonnet 5.5の出発点として、エージェント的なコーディングでは、指示のはっきりした作業ならmedium、難しい作業や長い作業ならhighを勧めています。xhighとmaxは、自分の評価で品質の向上を確かめられたときに使う位置づけです。maxはトークンの使い方に制約を設けない設定で、70.6%はその設定での値です。
上の段の効き方は、仕事によって違う
上の設定に進んだときの伸びは、タスクによって大きく違います。
CursorBench 4.0(Cursor社が独立に測定)では、Sonnet 5.5はmediumの39.2%から、highの47.8%、xhighの53.1%、maxの55.5%へ、段を上がるたびに伸びます。医師の電子カルテ作業を模した評価(PhysicianBench)でも同じ傾向で、highの47.6%からxhighの56.4%、maxの63.2%へ伸びる一方、1問あたりの所要時間もhighの2分未満から、xhighの約4分、maxの約14分半へ延びます。一方、一般的な健康の質問に答えるHealthBenchでは、回答の長さを補正したスコアの差が5段階のeffortで0.7ポイント以内で(補正前のスコアが最も高いのはmaxです)、回答時間もxhighまでは8〜13秒、maxで約36秒でした。effortの効き方は、タスクの種類によって変わります。
FrontierCode Mainでは、xhighの52.1%に対してmaxは46.2%でした。Anthropicは、maxではClaude Codeのコードレビュー機能でサブエージェントに作業を分ける場面が増え、Cognitionが調べた2件では、それがタイムアウトや範囲外の編集につながったと説明しています。
GDPval-AAとAA-Briefcaseでは、上の段の価値がもう1つの形で現れます。xhighはmaxよりスコアが119ポイント(1725対1844)、65ポイント(1746対1811)下がる代わりに、出力トークンが約67%、約61%少なくなります。どこまでのスコアを、どれだけの費用で買うかを選べる余地が、それだけ広いということです。
「最大30%安い」の条件
Anthropicは、単価をSonnet 5と同じ(入力100万トークンあたり2ドル、出力10ドル)に据え置いたうえで、同じ仕事に使うトークンが減るため、自社テストでは1タスクあたり最大30%安くなったとしています。この数字は、effortの設定を明記しない社内テストの結果です。Terminal-Bench 4.0のグラフでは、Sonnet 5の最高点とSonnet 5.5のMaxの1試行あたり費用は、どちらも12ドル前後で近く、最上位どうしで30%の差は見えません。30%は「最大」の数字なので、自分の仕事とeffortの組み合わせで測っておくと安心です。
移行で押さえる点
Sonnet 5から移す場合、モデル名の書き換えだけでは済みません。思考の無効化(thinking: disabled)と、tool_choiceによるツールの強制指定(tool・any)は、どちらもエラーになります。思考を最小にしたいときは新しいbetween_toolsを使いますが、これが使えるのはlow・medium・highまでで、xhighとmaxでは使えません。70.6%を出した設定に上げるなら、思考はアダプティブ(自動調整)で動かす前提になります。
Anthropicのアプリでは、高リスクのサイバー関連の依頼が分類器にブロックされると、Sonnet 5に自動で切り替わります。Claude APIでは、開発者がサーバー側フォールバックを有効にした場合に働き、他の基盤では挙動が異なることがあります。正当なセキュリティ業務向けには、Cyber Verification Programが近くSonnet 5.5にも広がる予定です。
Amazon Bedrockでは、ツールの入力形式を保証するstrict tool useが使えないため、ツールの強制指定は「自動」に置き換え、呼び出しのタイミングの指示と入力の検証をアプリ側で持つ形になります。
日本の現場にとっての意味
Sonnet 5.5は、Claude APIに加えて、Amazon Web Services、Google Cloud、Microsoft Azureで同時に使えるようになりました。クラウド経由の利用を前提とする日本企業にも、検証の選択肢が生まれました。利用できる基盤やリージョンは、個別の確認が必要です。
見直す価値がある点は2つです。1つは、70.6%を目安に選ぶのではなく、自分の仕事1件を完了させる費用と成功率を、effortを変えて測ることです。Mediumで足りる仕事と、Highやxhighまで上げて効く仕事があることは、今回の各ベンチマークが示しています。もう1つは、モデルの選び方を「Opusか、Sonnetか」の二択で考えないことです。Anthropicは、指示がはっきりした日々の仕事はSonnet 5.5、複雑で判断が要る仕事はOpus 5.5という使い分けを示しており、高頻度・低コスト向けのHaiku 5.5も数週間内に加わる予定です。
これから開くもの
今回の発表は、1つの点数だけでなく、effortごとのスコアと費用の曲線まで並べて示したことが特徴です。点ではなく曲線で選ぶ。Sonnet 5.5が開くのは、その使い方だと私は見ています。
【関連記事】
Claude Opus 5.5|「40%安い」はどの設定で成り立つか
Opus 5.5の発表回。「40%安い」が成り立つeffortの条件と、移行時に変わる設定を、数値をもとに読み解いた記事。
Anthropic「Claude Sonnet 5」発表、上位Opus 4.8に肉薄—安く一日中動かせる自律エージェントの実力とは
直前世代Sonnet 5の発表回。中位モデルとしての位置づけと、上位のOpusとの関係、性能の伸びを詳しく確認できる記事。
Claude Opus 5、脆弱性は「見つける」が「悪用」の手前で止まる─Anthropicが引いた線
サイバーセーフガードの線引きを扱った回。高リスクなサイバー依頼を止める仕組みと、そのフォールバックの背景を補足できる記事。
【編集部後記】
Toolathlon-Verifiedの表で、Sonnet 5.5の平均ターン数は31.6でした。ツールを使う実務タスクの評価で、比較表のClaudeモデルではもっとも多く、Opus 5.5は26.9です。本文には入れなかった数字です。
パートナー企業の声には、少ない手数で終わったという報告が並びます。少なく済む仕事と、粘り強く回り続ける仕事。同じモデルの2つの顔のうち、自分のタスクではどちらが出るのか。effortを変えて、1件ずつ数えてみたくなります。
【用語解説】
Terminal-Bench 4.0
コマンドライン上で複数の手順からなる実務的な作業を、AIが完了できるかを測るベンチマーク。66のタスクで構成され、計算生物学や物理シミュレーション、CADなど、科学や先端工学に近い課題が中心である。
effort
Claudeが応答に使うトークンの量を調整する設定。low・medium・high・xhigh・maxの5段階があり、上げるほど長く考え、費用も増えやすい。Anthropicの設定名である。
System Card
Anthropicがモデルの公開時に出す評価報告書。能力の評価、安全性の評価、アライメント(人間の意図との整合)の評価などをまとめる。
標準誤差
測定した平均値のばらつきの目安。値が小さいほど、同じ測定を繰り返したときの平均値の揺れが小さいことを表す。
セーフガード/フォールバック
セーフガードは、危険な依頼を検知して止める仕組み。フォールバックは、検知された依頼を代わりのモデルが受け持つ仕組みで、Sonnet 5.5ではサイバー関連の依頼がSonnet 5に回る仕組みがある。
FrontierCode
AIが書いたコードの変更が、人の手直しなしでマージされ得るかを測るベンチマーク。範囲外の変更は、有益でも減点される。Cognitionが開発した。
CursorBench
Cursor社が、実際の利用から作った作業でコーディングエージェントを評価するベンチマーク。同社の製品環境で通しで実施される。
GDPval-AA
Artificial Analysisが実施する、実務タスクの評価。44職種・9産業の220タスクを扱い、結果はElo方式の点数で示される。
AA-Briefcase
複数週にわたる案件と大量の資料を扱う、長期の知的作業を測るベンチマーク。GDPval-AAと同じくArtificial Analysisが実施する。
PhysicianBench
医師の業務課題100件を、電子カルテ(EHR)を操作しながら解く公開ベンチマーク。
HealthBench
OpenAIが開発した、健康分野の質問への回答を評価するベンチマーク。回答の長さに応じてスコアを補正する方式が併用される。
between_tools
Sonnet 5.5の思考設定の1つ。最初の思考をせず、ツール呼び出しの合間にだけ考える。low・medium・highでのみ使える。
Cyber Verification Program
サイバー防御などの正当な業務向けに、セーフガードの制限を緩めたモデルを提供するプログラム。申請制で、Sonnet 5.5への拡大が予定されている。
【参考リンク】
Claude Sonnet 5.5 System Card(Anthropic)(外部)
Sonnet 5.5の評価報告書。Terminal-Bench 4.0の測定条件や、effortごとのスコアと費用の図を確認できる。
Migrating to Claude Sonnet 5.5(Claude Platform Docs)(外部)
Sonnet 5.5への移行ガイド。エラーになる設定や、思考の設定between_toolsの制約、フォールバックの扱いを確認できる。
Effort(Claude Platform Docs)(外部)
effortの公式文書。5段階の定義と、Sonnet 5.5について勧める出発点、思考設定との関係、変更時の注意を確認できる。
Anthropic(公式サイト)(外部)
Claudeを開発する米国のAI企業。安全性の研究と製品開発を一体で進め、モデルの発表や評価報告書を自社サイトで公開している。
Claude Sonnet(Anthropic)(外部)
AnthropicのClaudeのうち、中位のSonnetシリーズを紹介する公式ページ。位置づけや提供状況を確認できる。
Claude Code(外部)
Anthropicのコーディングエージェント。コマンドラインやデスクトップアプリなどから、開発作業を任せることができる。
Cursor(外部)
AIエージェントに開発作業を任せるコーディングツール。実際の利用から作ったベンチマークCursorBenchの開発元である。
Cognition(外部)
自律型ソフトウェアエンジニアDevinを運営する企業。マージ可能なコードを測るベンチマークFrontierCodeの開発元。
Claude on AWS(Anthropic)(外部)
AWS上でClaudeを利用する方法を案内する、Anthropicのパートナーページ。Amazon Bedrockでの提供も確認できる。
Claude on Google Cloud(Anthropic)(外部)
Google CloudでClaudeを利用する方法を案内する、Anthropicのパートナーページ。提供形態や始め方を確認できる。
Claude in Microsoft Foundry(Anthropic)(外部)
Microsoft FoundryでClaudeを利用する方法を案内する、Anthropicのパートナーページ。提供形態や始め方が分かる。
【参考記事】
Building with Claude Sonnet 5.5(claude.dev)(外部)
Sonnet 5.5とOpus 5.5の使い分け、価格、移行時の変更点、effortの調整方法をまとめた開発者向けガイド。
Anthropic’s Claude Sonnet 5.5 nearly matches Opus 5.5 on benchmarks while costing up to 30 percent less per task(The Decoder)(外部)
Terminal-Bench 4.0で10.3%から70.6%に伸びた点と、FrontierCodeでMaxが下がる点を伝えた記事。
Claude Sonnet 5.5 vs Opus 5.5: Prices, Token Use and Benchmarks(Kingy AI)(外部)
70.6%がmax、66.4%がxhighの値であることと、effortごとの費用を、Opus 5.5と比べて整理した記事。


















