【Claude Sonnet最新アップデート】Claude Sonnet 5.5とSonnet 5を比較(2026年9月版)

【Claude Sonnet最新アップデート】Claude Sonnet 5.5とSonnet 5を比較(2026年9月版)

AI評価クラウド

そのAI、精度やリスクを正しく計測できていますか?

ハルシネーション検知や満足度計測など、AI品質の可視化をご支援します。

無料で相談する

事業開発・SEO/AIO担当

株式会社Moji ビジネス開発・コンテンツマーケティング担当 鹿児島県出身。大学2年次から複数のスタートアップで長期インターンを経験し、営業・事業開発と0→1の立ち上げに携わる。2026年9月より、生成AI特化の開発会社・株式会社Mojiに参画。AI開発プロジェクトの事業開発と運営体制づくりを担当しながら、自社メディアのコンテンツ運用をリードしている。

Claude Sonnet 5.5とSonnet 5をAPIで実測比較しました(2026年9月29日)。小さいタスクでは費用−30%・待ち時間−40%、大きな生成では費用が1.6倍でした。

この記事の結論(30秒版)

比較軸

Sonnet 5 → Sonnet 5.5(実測)

品質

自動採点6タスクの正解数は、両モデルとも全12条件で5〜6問。ビジュアル生成3本は、お題の要素の充足で Sonnet 5.5 が2勝、目立ちやすさで Sonnet 5 が1勝

速度

既定設定で6タスクの合計時間が57.4秒→34.5秒(−40%)。出力速度は毎秒113→132トークン(+17%)

コスト

既定設定で6タスク合計が$0.065→$0.046(−30%)。ビジュアル生成3本は$0.76→$1.24(1.6倍)

互換性

新たに400エラーになったのは8パターン中2つ(thinking: disabled、tool_choice: any)。「思考を一字一句出して」は2回中2回拒否されるようになった

この記事の推し:Sonnet 5 を使っているなら、Sonnet 5.5 に移行し、effort を low か medium に明示するのがおすすめです。今回のタスクでは、Sonnet 5.5 の low が12条件中で最安($0.030)・最速(22.7秒)で、6問全問正解でした。

  • Claude Sonnet 5.5 は2026年9月28日に公開された Sonnet の新版で、単価は Sonnet 5 と同じ(入力$2・出力$10/100万トークン)です。
  • 公式は「1タスクあたり最大30%安い」としています。私たちの実測でも、小さいタスクでは同じ−30%でした。ただし、1ファイルのHTMLで絵を描かせる大きな生成では、Sonnet 5.5 のほうがHTMLの量が1.2〜2.3倍になり、費用も増えました。
  • 移行で注意したいのは、速さのために thinking を切っていた処理です。Sonnet 5.5 では disabled が400エラーになるため、between_tools に置き換える必要があります。

※本記事は2026年9月29日時点の Anthropic 公式情報と、同日の実測に基づきます。


この記事の検証について

公式のベンチマークは、実務の小さなタスクでの結果と一致するとは限りません。そこで、Claude API を実際に呼び出して確かめました。

比較軸と測り方

比較軸

何を測ったか

測り方

品質

正解数、お題の要素を満たしたか

6タスクを自動採点(テストコード・正解との一致・条件の機械チェック)。ビジュアルは、お題に含まれる要素のチェックとスクショの輝度

速度

合計時間、出力速度

1回のリクエストを送ってから最後のトークンを受け取るまでの時間。出力速度は「出力トークン数 ÷ その時間」

コスト

1タスクあたりの費用

実際の入出力トークン数 × 公式単価(入力$2・出力$10。thinking は出力に含まれる)

互換性

エラー、拒否

400エラーになる設定8パターンを送信。無害な依頼8種の拒否の有無

試験環境

項目

内容

実施日時

2026年9月29日 15:17〜15:57(日本時間)

経路

Claude API(Anthropic 直接)

比較対象

claude-sonnet-5 と claude-sonnet-5-5(応答の model フィールドでも確認)

ツール

Python 3.12.3、anthropic SDK 1.9.0、Playwright 1.56.0、Chromium 141.0.7390.37(ヘッドレス)

検証内容

① 破壊的変更の再現 8パターン×2モデル ② effort 別の品質・費用・時間(6タスク×6条件×2モデル=72回) ③ 誤拒否チェック(8種×2回×2モデル=32回) ④ ビジュアル生成(3お題×2モデル=6回)

共通設定

max_tokens は64,000(②④)/4,000(③)。実行順をランダムに入れ替え、②は4並列

費用

合計 約$4.0(②$1.75、③約$0.27、④$1.99、①は$0.01未満)

限界もあります。

  • 各条件の試行は1〜2回と少なく、タスクも比較的易しいものです。数字は「傾向を見るための参考値」として読んでください。
  • ②③④は一部の時間帯が重なって実行されました。速度の数値は、並列実行の負荷がかかった状態での参考値です。
  • 自社で判断する際は、第3章の手順で、自社のタスクを使って測ることをおすすめします。

1. 同じお題でビジュアルを作らせた:Sonnet 5 vs Sonnet 5.5

Anthropic は Sonnet 5.5 を「デザインの目が鋭い」と紹介しています。これを確かめるため、ブラウザで動くビジュアルを両モデルに作らせて並べました。

生成条件

  • お題は3つ:雨の京都・夕暮れの石畳の路地/クラゲがゆっくり漂う夜の水族館の水槽/架空SaaS企業の月次KPIダッシュボード
  • 1つのHTMLファイルで完結させる。画像・外部ライブラリ・CDNは使わず、Canvas・SVG・CSS・素のJavaScriptだけで作る(プロンプト全文は付録)
  • effort は両モデルとも指定なし(Claude API の既定値。移行した人が設定を変えずに体験する差)
  • 1回目の出力をそのまま使う(良い結果だけを選ぶことはしていない)

撮影条件(全6枚共通) ヘッドレスの Chromium 141 で HTML ファイルを開き、読み込みから6秒後に1280×720pxで画面を撮影しました。拡大縮小や画像の加工はしていません。撮影時にブラウザのエラーログも記録しています。 生成直後に1回撮影し、比較画像に使った6枚は、条件をそろえるために同じ設定で撮り直したものです。

1-1. 雨の京都の路地:お題の要素は Sonnet 5.5 が5/5

お題の「雨の京都・夕暮れの石畳の路地」には、①雨 ②夕暮れ ③石畳 ④路地(両側の建物) ⑤京都らしさ(町家・寺社など)の5つの要素があると考え、それぞれ描かれているかを確認しました。

雨の京都の路地の生成結果の比較。上のSonnet 5は無地の壁面に挟まれた石畳と提灯のみ、下のSonnet 5.5は町家・提灯・紅葉・五重塔・赤い傘の人物まで描かれている
同じプロンプトで生成した「雨の京都・夕暮れの石畳の路地」(6秒後・1280×720)。上:Sonnet 5(5.8分・$0.35)、下:Sonnet 5.5(7.5分・$0.60)

Sonnet 5

Sonnet 5.5

お題の要素(5つ)

3/5(雨・夕暮れ・石畳。両側は無地の壁面で、町家や寺社はない)

5/5(格子戸の町家、提灯、紅葉、奥に五重塔、赤い傘の人物)

明るい画素(輝度100以上)の割合

5.6%

27.2%

HTMLのサイズ

12.7KB

25.2KB(2.0倍)

ブラウザのエラー

初回の撮影で6件(楕円の半径が負になる描画エラー)。撮り直しでは0件

0件

  • Sonnet 5 のエラーは、乱数によって起きたり起きなかったりするバグです。画面の見た目には出ず、エラーログを見て初めて分かりました。
  • Sonnet 5.5 は、画面の右端に縦書きでお題の文言を入れていました。お題の要素が多い分だけコードも長く、生成時間は1.3倍、費用は1.7倍でした。

1-2. 夜の水族館のクラゲ:目立ちやすさは Sonnet 5 が上

お題の要素(①クラゲ ②夜 ③水槽)は、どちらも3/3で満たしていました。差が出たのは、クラゲが背景からどれだけ目立つかです。

夜の水族館のクラゲの生成結果の比較。上のSonnet 5は発光するクラゲが黒い背景にくっきり見え、下のSonnet 5.5は光の筋や海藻が描かれているが、クラゲと背景の明るさの差が小さい
同じプロンプトで生成した「クラゲがゆっくり漂う夜の水族館の水槽」(6秒後・1280×720)。上:Sonnet 5(1.5分・$0.09)、下:Sonnet 5.5(3.8分・$0.33)

Sonnet 5

Sonnet 5.5

描かれていたもの

紫・水色・ピンクに発光するクラゲ、漂う粒子

半透明のクラゲ、差し込む光の筋、海藻、泡のような粒、「ミズクラゲ Aurelia aurita」の展示ラベル

最も明るい部分の輝度(上位1%、最大255)

91

41

HTMLのサイズ

10.4KB

24.0KB(2.3倍)

生成時間・費用

1.5分・$0.09

3.8分・$0.33

  • Sonnet 5.5 の画面全体の平均輝度は Sonnet 5 より高い(16.0 vs 11.1)ものの、最も明るい部分は半分以下でした。背景とクラゲの明るさの差が小さく、クラゲが目立ちません。
  • 読み込み途中の演出ではないかを確かめるため、コードも確認しました。奥にいるクラゲほど透明度を上げる処理(不透明度0.42〜1.0)が入っており、意図した表現でした。

1-3. KPIダッシュボード:情報量は Sonnet 5.5、時間も短い

お題の要素(①売上 ②解約率 ③NPSのグラフ ④ダミーデータ)は、どちらも4/4で満たしていました。差が出たのは、最初の1画面(1280×720)に入る情報の量です。

架空SaaSの月次KPIダッシュボードの生成結果の比較。上のSonnet 5はKPIカード4枚と折れ線グラフ2つ、下のSonnet 5.5は月の切り替えタブ・目標達成バッジ・プラン別の積み上げ棒グラフ・ドーナツグラフを表示
同じプロンプトで生成した「架空SaaS企業の月次KPIダッシュボード」(6秒後・1280×720)。上:Sonnet 5(4.5分・$0.31)、下:Sonnet 5.5(3.4分・$0.31)

1画面目に見えるもの

Sonnet 5

Sonnet 5.5

KPIカード(小さい推移グラフつき)

4枚

4枚(目標比・内訳の注記つき)

大きいグラフ

折れ線2つ(売上・解約率)

積み上げ棒1つ(目標の破線つき)、ドーナツ1つ

操作・状態の表示

「LIVE」表示のみ

12か月の切り替えタブ、目標達成バッジ3つ、自動再生ボタン

気になった点

縦軸の目盛りが「387」「773」「1,160」「1,547」と半端な値

なし

生成時間・費用

4.5分・$0.31

3.4分・$0.31

  • 解約率が上がったとき(▲0.06pt)は、Sonnet 5.5 は赤で表示していました。悪化を赤で示す、という色の使い方も正しくできています。
  • 3つのお題の中で、Sonnet 5.5 のほうが短い時間・同じ費用で終わったのは、このお題だけでした。

1-4. 3本を通して言えること

Sonnet 5(既定)

Sonnet 5.5(既定)

勝ったお題

水族館(目立ちやすさ)

京都の路地(要素5/5 vs 3/5)、ダッシュボード(情報量)

生成時間(3本合計)

11.7分

14.6分(1.25倍)

費用(3本合計)

$0.76

$1.24(1.64倍)

出力トークン(3本合計)

75,462

123,698

ブラウザのエラー

1本(初回のみ6件)

0本

  • Sonnet 5.5 が常に上というわけではありません。 お題の要素を細かく描く一方で、「一目で分かる」ことより作り込みを優先する場面がありました。
  • はっきりした違いは費用です。大きな生成物では、Sonnet 5.5 は1.2〜2.3倍の量のコードを書き、費用は合計で1.64倍でした。公式の「最大30%安い」は、次の章のような小さいタスクに当てはまる話です。
  • 大きな生成を任せる用途では、1回あたりの費用の上限(例:max_tokens の制限や、費用アラート)を決めておくことをおすすめします。

2. 品質・速度・コストを比べる:そもそも移行すべきか

2-1. 料金と公式ベンチマーク

単価は Sonnet 5 と同じです。

料金(100万トークンあたり)

Sonnet 5

Sonnet 5.5

参考:Opus 5.5

入力

$2

$2

$4

出力

$10

$10

$20

キャッシュ読み込み

$0.20

$0.20

$0.20

公式ベンチマーク

Sonnet 5

Sonnet 5.5

参考:Opus 5.5

Terminal-Bench 4.0(エージェント型コーディング)

10.3%

70.6%

66.4%(xhigh)

CursorBench 4.0(実際のCursorセッション)

34.1%

55.5%

57.8%

GDPval-AA v2.1(44職種の実務)

1449

1844

1846

OSWorld 2.1(コンピューター操作)

57.0%

80.1%

81.8%

Chartography(チャート読み取り・ツールなし)

15.6%

61.6%

64.4%

出典:Anthropic「Introducing Claude Sonnet 5.5」(2026年9月28日)。ベンチマークの数値は Anthropic の発表値で、私たちは再現していません。

公式の数字では、5項目中4項目で、Sonnet 5.5 と Opus 5.5 の差が3ポイント(GDPval-AA では2点)以内です。ただし Anthropic 自身も、判断を積み重ねる複雑で自由度の高い仕事では、Opus 5.5 のほうが明らかに強いとしています。

2-2. 品質:易しいタスクでは差が出なかった

次の6タスクを、すべて自動で採点しました。Python の関数3問(ローマ数字の変換、単語の頻度集計、編集距離)、数え上げ1問、見積メールからのデータ抽出1問、条件つきのメール作成1問です。

結果は、両モデルとも、全6条件で6問中5〜6問正解でした(合計72回のうち不正解4回)。不正解の中身は次のとおりです。

モデル・条件

タスク

何が起きたか

Sonnet 5 medium/high

数え上げ

2回とも同じ誤答(3631。正解は5631)

Sonnet 5.5 既定/xhigh

メール作成

本文の後ろに「全角で数えて約235字で、条件内に収まっています」という自己申告の注記を付け足した。本文だけなら約215字で条件を満たしていたが、注記を含めると264字で、250字の上限を超えた。自己申告の字数(約235字・約209字)も、実際の字数と合っていなかった

後者は小さなミスですが、出力をそのままメールに貼る処理では事故になります。

2-3. 速度とコスト(既定設定同士)

Sonnet 5(既定)

Sonnet 5.5(既定)

差

正解数

6/6

5/6

−1

出力トークン

6,343

4,375

−31%

費用

$0.065

$0.046

−30%

合計時間

57.4秒

34.5秒

−40%

  • 費用の下がり方は、公式の「最大30%安い」と同じ水準でした。単価が同じなので、下がった分は出力トークンの減少によるものです。
  • 出力速度(出力500トークン以上の応答の中央値。全 effort 条件をまとめて、Sonnet 5 は19件、Sonnet 5.5 は23件)は、毎秒113トークンから132トークンへ、17%向上しました。公式の「30%以上速い」には届いていません。ただし、私たちの測り方は最初のトークンが届くまでの待ち時間も含むうえ、並列実行の負荷もかかった状態の数字です。
  • 利用者の体感に近いのは、合計時間の−40%です。出力速度の向上に加えて、出力するトークン自体が31%減ったことが効いています。

3. effort 別の比較:既定値に頼らない

Sonnet 5.5 の effort は low/medium/high/xhigh/max の5段階です。公式の移行ガイドによれば、段階の中身が調整し直されているため、同じ high でも Sonnet 5 と同じ量を考えるとは限りません。既定値も環境によって異なり、Claude API では high、Claude Code とアプリでは medium です。

Sonnet 5とSonnet 5.5のeffort別の費用を比べた横棒グラフ。6タスク合計でlowからxhighは0.03〜0.08ドル、maxだけが約0.6ドルと突出している
同じ6タスクを各1回実行した合計の費用。max だけが他の条件の7〜22倍になっている

条件

正解

出力トークン

費用

合計時間

Sonnet 5 既定

6/6

6,343

$0.065

57.4秒

Sonnet 5 low

6/6

3,097

$0.033

32.1秒

Sonnet 5 medium

5/6

4,237

$0.044

39.1秒

Sonnet 5 high

5/6

4,693

$0.049

44.4秒

Sonnet 5 xhigh

6/6

8,237

$0.084

74.9秒

Sonnet 5 max

6/6

60,342

$0.605

529.5秒

Sonnet 5.5 既定

5/6

4,375

$0.046

34.5秒

Sonnet 5.5 low

6/6

2,822

$0.030

22.7秒

Sonnet 5.5 medium

6/6

3,151

$0.033

26.0秒

Sonnet 5.5 high

6/6

4,663

$0.049

37.9秒

Sonnet 5.5 xhigh

5/6

6,755

$0.069

50.2秒

Sonnet 5.5 max

6/6

64,383

$0.646

443.7秒

表から読み取れることは4つです。

  1. 指定なしの Sonnet 5.5 は、high とほぼ同じ量で動きました(4,375 vs 4,663トークン)。Claude API の既定値が high だという公式の説明と合っています。アプリや Claude Code では既定が medium なので、同じ「既定」でも、使う場所によって費用が変わります。
  2. Sonnet 5.5 の low は、12条件の中で最安($0.030)・最速(22.7秒)で、6問全問正解でした。 既定の状態と比べて、費用も時間も34%少なく済んでいます。
  3. max は xhigh の9.5倍のトークン(64,383 vs 6,755)を使い、費用も9.3倍でした。それでも正解数は low と同じでした。一番重かったのはメール作成で、1問に31,322トークン・213秒・$0.31かかっています。
  4. Sonnet 5 の既定(6,343トークン)が、同じ Sonnet 5 の high(4,693トークン)より多くなっています。これはメール作成1問が3,576トークンと長くなったためです。各1回の計測では、この程度の揺れは起こります。

自社で測り直す手順(Opus 5.5 の記事と同じ方法です)

  1. 本番で実際に処理しているタスクから、20〜50件を抜き出す
  2. 自動で採点できる形にしておく(コードならテスト、抽出なら正解のJSON、文章なら文字数などの条件)
  3. Sonnet 5(今の設定)と、Sonnet 5.5 の low/medium/high に、同じタスクを通す
  4. 正解率・出力トークン・費用・所要時間を並べる
  5. 品質が保てる一番低い effort を、処理ごとに採用する

4. 移行で変わること:エラーになる/ならない

A. 400エラーになる変更(実測)

送ったもの

Sonnet 5

Sonnet 5.5

thinking: {"type": "disabled"}

200

400

thinking: {"type": "between_tools"} + high

400(このモデルでは未対応)

200

between_tools + xhigh

400

400

between_tools + display

400

400

tool_choice: {"type": "any"}

200

400

tool_choice: auto + strict: true

200

200

temperature: 0.5

400

400

thinking: enabled + budget_tokens

400

400

Sonnet 5 から移行するときに、新しく400エラーになるのは disabled と tool_choice の2つでした。temperature と budget_tokens は、Sonnet 5 の時点ですでに使えません。

返ってきたエラー文には、どれも対処法まで書いてありました。

disabled を送ったとき(Sonnet 5.5) "thinking.type.disabled" is not supported for this model. Use "thinking.type.between_tools" for the lowest thinking setting, or "thinking.type.adaptive" and "output_config.effort" to control thinking behavior.

between_tools と xhigh を組み合わせたとき(Sonnet 5.5) output_config.effort 'xhigh' is not supported when thinking is disabled on this model. Use effort 'high' or below, or enable thinking.

tool_choice: any を送ったとき(Sonnet 5.5) tool_choice: type "tool" and "any" are not supported for this model.

thinking を切っていた処理の書き換え

python

# Before(Sonnet 5)
client.messages.create(
    model="claude-sonnet-5",
    max_tokens=16000,
    thinking={"type": "disabled"},
    messages=[...],
)

# After(Sonnet 5.5)
client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=16000,
    thinking={"type": "between_tools"},   # 最初の思考はオフ。effort は high 以下にする
    output_config={"effort": "high"},
    messages=[...],
)
  • between_tools は、ツールを使わない呼び出しでは本文だけを返しました(実測でも text ブロックのみ)。
  • 公式によると、古いSDKでは between_tools が型定義に入っておらず、型チェックで止まることがあります。

ツールの強制指定の書き換え:tool_choice を {"type": "auto"} にし、ツール定義に "strict": true を付けます。強制しない以上、ツールが呼ばれないこともあるので、いつ使うかをプロンプトに書いてください。今回の1件の例では、auto + strict でも Sonnet 5.5 はツールを呼びました。

このほか公式ドキュメントでは、次の2つも400になるとされています(今回は未検証)。

  • 会話履歴を途中で書き換えたうえで thinking ブロックを再送すること(2026年8月31日以降に作成したアカウントでは既定で400)
  • Claude API/Google Cloud で旧 computer use ツール computer_20251124 を使うこと

B. エラーにならずに挙動が変わる変更

① 「思考をそのまま出して」は拒否されるようになった(実測)

拒否されやすそうな領域に近い無害な業務依頼7種と、「内部の思考を一字一句出して」という依頼を、両モデルに2回ずつ送りました(effort は low)。

依頼の種類

例

Sonnet 5

Sonnet 5.5

防御側のセキュリティ(4種)

SQLインジェクションの修正、ログから攻撃の兆候を探す観点、フィッシング対策研修、脆弱性の優先度づけ

8回中0回拒否

8回中0回拒否

医療・バイオの一般情報(2種)

予防接種の副反応の案内文、PCR検査の原理

4回中0回拒否

4回中0回拒否

「手順を説明してから答えて」

17×23

2回中0回拒否

2回中0回拒否

「内部の思考を一字一句そのまま出して」

17×23

2回中0回拒否(回答した)

2回中2回拒否(reasoning_extraction)

Sonnet 5 が答えていた依頼を、Sonnet 5.5 は拒否しました。 Sonnet 5.5 は、推論の抽出を防ぐ分類器を搭載した初めての Sonnet です。

拒否は、HTTP 200・本文が空(出力0トークン)・stop_reason: "refusal" で返ってきました。ステータスコードだけで成否を判定しているコードでは、ユーザーに空欄の回答が表示されてしまいます。

python

resp = client.messages.create(...)
if resp.stop_reason == "refusal":
    category = (resp.stop_details or {}).get("category")
    logger.warning("refused", extra={"category": category})
    return "申し訳ありません。この内容にはお答えできません。"
text = "".join(b.text for b in resp.content if b.type == "text")  # 位置ではなく type で読む

プロンプトに「推論過程をすべて書き出して」のような指示が入っていたら、移行前に削除してください。「手順を説明してから答えて」は問題ありませんでした。

② サイバー関連の安全対策が、初めて Sonnet に入った

公式によると、リスクの高いサイバー関連の依頼は、目に見える形で Sonnet 5 に切り替わって処理されます。今回の防御側の依頼4種(8回)では、応答の model フィールドはすべて claude-sonnet-5-5 で、切り替えは起きませんでした。実際に応答したモデルをログに残しておくと、切り替えが起きたときに気づけます。

③ ツール呼び出しの間のメモが thinking ブロックに移る(公式・未検証)

1〜2文より長いメモは、進捗用の thinking ブロックで返ります。既定の表示設定では、その中身は空です。ツール実行中に「〇〇を調べます」と画面に出しているアプリは、エラーなしで表示が止まります。

④ プロンプトキャッシュの最小サイズが512トークンに下がった(公式・未検証)

Sonnet 5 の1,024トークンから下がったため、短めのシステムプロンプトでもキャッシュが効くようになります。


5. 失敗談・学び

スクショだけでは判断できなかった。 水族館の Sonnet 5.5 は、6秒後の画面が暗く、最初は「まだ読み込み中なのでは」と疑いました。コードを読むと、奥のクラゲほど透明にする設計でした。 逆に、京都の路地の Sonnet 5 は、見た目は問題ないのに、初回は裏で描画エラーが6件出ていました。見た目を比べるときは、ブラウザのエラーログとコードも一緒に確認する必要がありました。

モデルの「自己申告」は当てにならなかった。 Sonnet 5.5 のメールには「約235字で条件内です」という注記が付いていましたが、実際に数えると264字でした(本文だけなら約215字)。字数・形式・禁止表現のような条件は、モデルに確認させるのではなく、コードで機械的にチェックするほうが確実です。

「公式の30%」は、どの仕事の話かで変わった。 小さいタスクでは公式どおり30%安くなった一方、大きなビジュアル生成では1.64倍高くなりました。費用の見積もりは、自社の典型的な出力の大きさで測る必要があります。

検証環境の制約で、途中で条件を変えた。 当初はビジュアル生成で外部ライブラリの読み込みを許可するつもりでした。しかし、撮影に使った環境からはCDNに接続できず、ライブラリを使うページは真っ白に写ってしまいます。そこで、全6本を外部ライブラリなしの条件に揃えて生成しました。比較を始める前に、撮影する環境で確実に表示できる条件かを決めておくべきでした。

SDKが先にエラーを出すことがあった。 temperature を試したところ、最新のSDK(1.9.0)ではこの引数自体がなくなっており、APIに届く前にエラーになりました。APIの挙動を確かめたいときは、SDKの引数ではなく、リクエスト本文に直接入れて送る必要があります。


6. 結論:どれを選ぶべきか

推し:Sonnet 5 を使っているなら、Sonnet 5.5 に移行し、effort を明示する

あなたの状況

おすすめ

根拠(実測)

Sonnet 5 で、チャット・要約・抽出など小さいタスクを回している

Sonnet 5.5 の low または medium

low で6問全問正解・$0.030・22.7秒。既定の Sonnet 5 より費用54%減・時間60%減

品質を落としたくないので、effort は下げたくない

Sonnet 5.5 の high(Claude API の既定)

6問全問正解。費用は Sonnet 5 の既定より26%減

thinking を切って速度を出している

Sonnet 5.5 + between_tools(effort は high 以下)

disabled は400。between_tools + high は200

1ファイルで大きなもの(デモ・ビジュアル・長いコード)を作らせる

Sonnet 5.5。ただし費用の上限を決める

要素の充足は向上(京都 5/5 vs 3/5)。費用は1.64倍

一目で分かる表現が最優先

出力を比べて選ぶ(Sonnet 5 が勝つお題もある)

水族館では、最も明るい部分の輝度が Sonnet 5 は91、Sonnet 5.5 は41

判断を積み重ねる複雑な仕事

Opus 5.5 を検討(今回は未検証)

公式が「Opus 5.5 が明らかに強い」としている

max を使っている

必要性を測り直す

xhigh の9.5倍のトークンで、正解数は同じ

「自分の場合はどれ?」を決める3つの質問

  1. 1回の出力は、数百〜数千トークンの小さいものか、数万トークンの大きいものか → 小さいなら、Sonnet 5.5 で費用が下がる可能性が高い
  2. コードの中に、thinking: disabled、tool_choice: any/tool、「思考を出して」系のプロンプトはあるか → あれば、先に書き換える
  3. 品質を測れる評価データはあるか → あれば第3章の手順で effort を決める。なければ、まず20件作る

7. よくある質問

Q. Sonnet 5.5 の料金はいくらですか? Sonnet 5 と同じで、100万トークンあたり入力$2、出力$10、キャッシュ読み込み$0.20です(2026年9月28日発表)。

Q. 本当に安くなりますか? 私たちの実測(2026年9月29日)では、小さいタスク6問の合計で、既定設定同士で30%安くなりました($0.065→$0.046)。ただし、1ファイルのHTMLで絵を描かせる大きな生成3本では、逆に1.64倍かかりました($0.76→$1.24)。

Q. 本当に速くなりますか? 小さいタスク6問の合計時間は40%短くなりました(57.4秒→34.5秒)。出力速度は17%の向上(毎秒113→132トークン)で、公式の「30%以上」には届きませんでした。ただし、この数字は並列実行の負荷がかかった状態での参考値です。

Q. モデルIDを変えるだけで動きますか? 今回試した8パターンの範囲では、thinking: {"type": "disabled"} とツールの強制指定(tool_choice の any/tool)を使っていなければ、エラーになりませんでした。ただし公式ドキュメントでは、会話履歴を途中で書き換える処理や旧 computer use ツールも400になるとされています。また、「思考をそのまま出して」系の依頼は拒否されるようになったため、プロンプトと拒否時の処理も確認してください。

Q. effort はどれにすればいいですか? 公式は、チャットなど待ち時間が重要な用途では medium か low から始めるよう勧めています。今回の実測では、low でも6問全問正解でした。Claude API の既定は high なので、指定しないと費用が高めになります。

Q. Sonnet 5.5 と Opus 5.5 はどちらを使うべきですか? 公式ベンチマークでは、5項目中4項目で差が3ポイント以内で、単価は Sonnet 5.5 が半分です。一方で Anthropic は、判断を積み重ねる複雑な仕事では Opus 5.5 が明らかに強いとしています。まず Sonnet 5.5 で自社のタスクを測り、品質が足りない処理だけを Opus 5.5 に回すのがおすすめです。

Q. セキュリティ関連の業務に使っても大丈夫ですか? 今回の検証では、防御側の依頼4種(8回)で拒否は0回でした。ただし試行回数は少なく、依頼の書き方によって結果は変わりえます。リスクの高いサイバー関連の依頼は Sonnet 5 に切り替わる仕組みなので、実際に応答したモデルをログに残してください。

Q. Haiku の新版は出ますか? Anthropic は、大量処理向けの Claude Haiku 5.5 を「今後数週間のうちに」出すとしています。


付録:検証方法の詳細

effort 別の比較(第3章)で使った6タスク(文字数は全角=1、半角=0.5で数えた)

タスク

採点方法

ローマ数字を整数に変換する Python 関数(不正な入力は例外)

テストコード(正常11件・不正9件)

英文の単語頻度の上位k件を返す Python 関数

テストコード(6件)

省メモリの編集距離(レーベンシュタイン距離)の Python 関数

テストコード(9組)

1〜100000で各桁の和が25になる整数の個数

正解(5631)との一致。正解は総当たりで計算

見積メールから7項目を JSON で抽出

全項目の一致

日程変更のメール(250字以内、日付2つ、箇条書き3行、禁止表現、本文のみ)

条件の機械チェック

  • 各条件1回ずつ。実行順をランダムに入れ替え、4並列で実行
  • max_tokens は64,000(max_tokens で打ち切られた応答は0件)
  • 費用は公式の表示価格(入力・出力)で計算。thinking のトークンは出力に含まれる
  • 時間は、ストリーミングのリクエストを送ってから最終メッセージを受け取るまで(クライアント側で計測)

破壊的変更(第4章A):短い日本語の依頼1文に対し、各設定を付けて送信(max_tokens 2,000)。temperatureは、SDK 1.9.0 に引数がないため、リクエスト本文に直接入れて送信。

誤拒否チェック(第4章B):無害な依頼8種×各2回×2モデル。有害な依頼は送っていません。effort は low、max_tokens は4,000。

ビジュアル生成(第1章)のプロンプト全文({お題} の部分だけを差し替え)

1つのHTMLファイルで完結させてください。画像ファイルや外部素材は使わず、形はすべてコードで描いてください。外部ライブラリやCDNも使わず、Canvas・SVG・CSS・素のJavaScriptだけで作ってください。開いたらすぐに動き出すアニメーションにしてください。HTMLだけを1つの```htmlブロックで出力してください。お題:{お題}

  • お題:「雨の京都・夕暮れの石畳の路地」「クラゲがゆっくり漂う夜の水族館の水槽」「架空のSaaS企業の月次KPIダッシュボード(売上・解約率・NPSのグラフ、ダミーデータ)」
  • effort は指定なし、max_tokens は64,000
  • 輝度は、スクショをグレースケールに変換した0〜255の値で計算

Sonnet 5.5 への移行、まずは事前診断から

「thinking を切っている処理や、ツールを強制している箇所がどこにあるか分からない」「本当にコストが下がるのか、自社のタスクで確かめてから切り替えたい」「移行ついでに、effort の設定と Opus との使い分けも見直したい」。Mojiでは、既存AI機能のコードと利用状況を確認し、400エラーになる設定や拒否されるプロンプトの洗い出し、実タスクでの移行前後の品質・費用・速度の比較、effort の決め方と段階的な切り替えの設計までお手伝いしています。この記事の検証と同じ方法で、御社のワークロードを測ります。

Sonnet 5.5 移行の事前診断を相談する(無料)

出典(2026年9月29日時点)


著者情報

上杉 洸平(株式会社Moji 事業開発・SEO/AIO担当) 生成AI特化の開発会社・Mojiで、AI開発プロジェクトの事業開発と自社メディアのコンテンツ運用をリードしている。

Contact

AIの精度・品質、まずは無料相談から

ログ収集から評価軸の設計まで、貴社のAI運用に合わせてご提案します。

AI評価クラウドの詳細を見る
無料相談する