分析2026年2月17日
ユーザーがヘッドツーヘッドテストでClaude Sonnet 4.6をOpus 4.5より好む
Anthropicがユーザーの59%が前フラッグシップのOpus 4.5よりSonnet 4.6を好んだことを明かし、指示への追従が改善されたと指摘。
ミッドティアモデルが前フラッグシップを上回る
Anthropicが「世代的な飛躍」と呼ぶテストで、ユーザーテストはClaude Sonnet 4.6が前フラッグシップのOpus 4.5を好感度テストで上回ることを示しています。
テスト結果
Sonnet 4.6対Sonnet 4.5: 70%がSonnet 4.6を好んだ Sonnet 4.6対Opus 4.5: 59%がSonnet 4.6を好んだユーザーがSonnet 4.6を好む理由
定性的なフィードバックが3つの要因を強調しています:
1. より良い指示への追従
「Sonnet 4.6は私が頼んだことを実際に行います。Opusは私のリクエストを望まない方向に「改善」することがよくありました。」
2. 少ないハルシネーション
「間違った答えに自信がなくなりました。Sonnet 4.6が何か知らない場合、作り話をするのではなく、そう言います。」
3. 過剰エンジニアリングの削減
「簡単な関数を頼んだら、簡単な関数が返ってきました。依存性注入と抽象インターフェースを持つフレームワークではありません。」
ベンチマークのコンテキスト
| 指標 | Sonnet 4.6 | Opus 4.5 |
| SWE-bench | 79.6% | 77.2% |
| OSWorld | 72.5% | 61.4% |
| GDPval-AA | 1633 Elo | 約1550 |
エンタープライズの反応
「第2四半期にOpus 4.5の展開を計画していました。この結果で再考しています。ユーザーがより好まないものになぜ5倍を払うのですか?」— エンタープライズSaaS会社CTO