分析2026年2月17日

ユーザーがヘッドツーヘッドテストでClaude Sonnet 4.6をOpus 4.5より好む

Anthropicがユーザーの59%が前フラッグシップのOpus 4.5よりSonnet 4.6を好んだことを明かし、指示への追従が改善されたと指摘。

ミッドティアモデルが前フラッグシップを上回る

Anthropicが「世代的な飛躍」と呼ぶテストで、ユーザーテストはClaude Sonnet 4.6が前フラッグシップのOpus 4.5を好感度テストで上回ることを示しています。

テスト結果

Sonnet 4.6対Sonnet 4.5: 70%がSonnet 4.6を好んだ Sonnet 4.6対Opus 4.5: 59%がSonnet 4.6を好んだ

ユーザーがSonnet 4.6を好む理由

定性的なフィードバックが3つの要因を強調しています:

1. より良い指示への追従

「Sonnet 4.6は私が頼んだことを実際に行います。Opusは私のリクエストを望まない方向に「改善」することがよくありました。」

2. 少ないハルシネーション

「間違った答えに自信がなくなりました。Sonnet 4.6が何か知らない場合、作り話をするのではなく、そう言います。」

3. 過剰エンジニアリングの削減

「簡単な関数を頼んだら、簡単な関数が返ってきました。依存性注入と抽象インターフェースを持つフレームワークではありません。」

ベンチマークのコンテキスト

指標Sonnet 4.6Opus 4.5
SWE-bench79.6%77.2%
OSWorld72.5%61.4%
GDPval-AA1633 Elo約1550

エンタープライズの反応

「第2四半期にOpus 4.5の展開を計画していました。この結果で再考しています。ユーザーがより好まないものになぜ5倍を払うのですか?」— エンタープライズSaaS会社CTO

Claude 5とAI業界に関する最新のアップデートとお知らせ

OtterMindで使用