ベンチマーク2026年2月17日
Claude Sonnet 4.6がSWE-benchで79.6%を達成、Opus 4.6との差はわずか1.2%
新しいSonnetモデルがコーディングベンチマークでフラッグシップに迫り、ミッドティア価格で業界をリードするパフォーマンスを達成。
SonnetがフラッグシップTerritoryに到達
Claude Sonnet 4.6のSWE-bench Verifiedでの79.6%スコアは、Opus 4.6の80.8%の攻撃圏内に置き、わずか1.2ポイントの差です。
歴史的コンテキスト
Sonnetクラスモデルの急速な向上:
| モデル | SWE-bench Verified | 日付 |
| Sonnet 3.5 | 49.0% | 2024年6月 |
| Sonnet 4 | 72.7% | 2025年3月 |
| Sonnet 4.5 | 77.2% | 2025年9月 |
| Sonnet 4.6 | 79.6% | 2026年2月 |
20ヶ月でSonnetのSWE-benchパフォーマンスは30ポイント以上向上しました。
競合環境
| モデル | SWE-bench Verified | 価格(入力/出力) |
| Opus 4.6 | 80.8% | $15/$75 |
| Sonnet 4.6 | 79.6% | $3/$15 |
| GPT-5.2 | 約76% | $1.75/$14 |
| Codex 5.3 | 56.8%* | $10/$30 |
*Codexは異なるベンチマーク変種(SWE-Bench Pro)を使用
ギャップが意味すること
ほとんどの開発タスクでは、79.6%対80.8%は統計的に重要ではありません:
- どちらも約5問に4問の実際のバグを正しく解決
- 個々の実行のばらつきがギャップを超える
- コストの差(5倍)が能力の差(1.2%)をはるかに超える
開発者の視点
「Sonnet対Opusを1週間A/Bテストしました。自分のコードベースで違いはわかりません。でも請求書の違いははっきりわかります。」— シニアエンジニア、YCスタートアップ
Opus 4.6が優れている場面
ほぼ同等でも、Opus 4.6は以下では優位に立ちます:
- 新しいアルゴリズムの設計
- 多くの依存関係を持つマルチステップリファクタリング
- 博士レベルの科学的なコード
- 最大精度要件(規制、財務)