分析2026年2月12日
ベンチマーク戦争:Claude Opus 4.6対Codex 5.3 - 本当に勝つのは?
AnthropicのOpus 4.6とOpenAIのCodex 5.3の2026年2月ベンチマーク競争の深い分析。
2026年2月ベンチマーク戦争
AnthropicとOpenAIはどちらも2026年2月5日に主要なコーディングモデルをリリースしました。
ヘッドツーヘッド結果
| ベンチマーク | Opus 4.6 | Codex 5.3 | 勝者 |
| SWE-bench | 82.1% | 76.8% | Opus 4.6 |
| Terminal-Bench | 68.4% | 77.3% | Codex 5.3 |
| GPQA Diamond | 88.5% | 81.9% | Opus 4.6 |
本当の勝者
どちらのモデルも全シナリオで優位に立つわけではありません。Opus 4.6は複雑な推論に優れており、Codex 5.3は速度とターミナルタスクでリードしています。