ベンチマーク2026年2月17日

Claude Sonnet 4.6がSWE-benchで79.6%を達成、Opus 4.6との差はわずか1.2%

新しいSonnetモデルがコーディングベンチマークでフラッグシップに迫り、ミッドティア価格で業界をリードするパフォーマンスを達成。

SonnetがフラッグシップTerritoryに到達

Claude Sonnet 4.6のSWE-bench Verifiedでの79.6%スコアは、Opus 4.6の80.8%の攻撃圏内に置き、わずか1.2ポイントの差です。

歴史的コンテキスト

Sonnetクラスモデルの急速な向上:

モデルSWE-bench Verified日付
Sonnet 3.549.0%2024年6月
Sonnet 472.7%2025年3月
Sonnet 4.577.2%2025年9月
Sonnet 4.679.6%2026年2月

20ヶ月でSonnetのSWE-benchパフォーマンスは30ポイント以上向上しました。

競合環境

モデルSWE-bench Verified価格(入力/出力)
Opus 4.680.8%$15/$75
Sonnet 4.679.6%$3/$15
GPT-5.2約76%$1.75/$14
Codex 5.356.8%*$10/$30

*Codexは異なるベンチマーク変種(SWE-Bench Pro)を使用

ギャップが意味すること

ほとんどの開発タスクでは、79.6%対80.8%は統計的に重要ではありません:

  • どちらも約5問に4問の実際のバグを正しく解決
  • 個々の実行のばらつきがギャップを超える
  • コストの差(5倍)が能力の差(1.2%)をはるかに超える

開発者の視点

「Sonnet対Opusを1週間A/Bテストしました。自分のコードベースで違いはわかりません。でも請求書の違いははっきりわかります。」— シニアエンジニア、YCスタートアップ

Opus 4.6が優れている場面

ほぼ同等でも、Opus 4.6は以下では優位に立ちます:

  • 新しいアルゴリズムの設計
  • 多くの依存関係を持つマルチステップリファクタリング
  • 博士レベルの科学的なコード
  • 最大精度要件(規制、財務)

Claude 5とAI業界に関する最新のアップデートとお知らせ

OtterMindで使用