速報2026年2月9日
Claude Opus 4.5リリース:SWE-benchスコア80.9%で人間・AIモデル全てを凌駕
AnthropicがSWE-benchスコア80.9%のClaude Opus 4.5をリリース。ソフトウェアエンジニアリングタスクで初めて人間レベルのパフォーマンスを超える。
速報:Claude Opus 4.5が全人類のコーダーを凌駕
AnthropicのClaude Opus 4.5が前例のない偉業を達成しました:SWE-bench Verifiedで80.9%。これはAIモデルだけでなく、人間のソフトウェアエンジニアをも超えた史上初の出来事です。AI開発における歴史的なマイルストーンです。
ベンチマークパフォーマンス
Claude Opus 4.5は主要なコーディングベンチマーク全てで圧倒的な結果を示しました:
SWE-bench Verified: 80.9%(GPT-5.1の74.2%、Gemini 3 Proの71.8%を上回る) HumanEval: 97.3%(ほぼ完璧なコード生成) MBPP: 96.1%(Pythonプログラミングタスク) コーディング速度: 平均レスポンスタイム3.2秒競合比較
| モデル | SWE-bench | 入力価格 | 出力価格 |
| Claude Opus 4.5 | 80.9% | $15/Mトークン | $75/Mトークン |
| GPT-5.1 | 74.2% | $10/Mトークン | $30/Mトークン |
| Gemini 3 Pro | 71.8% | $7/Mトークン | $21/Mトークン |
| Claude Sonnet 4.5 | 73.5% | $3/Mトークン | $15/Mトークン |
技術的イノベーション
トークン効率: 新しい圧縮アルゴリズムにより、品質を維持しながら入力要件を30%削減。 effortパラメータ: 調整可能な推論強度により、タスクの複雑さに応じてコストとパフォーマンスのバランスを開発者が制御可能。 多言語の卓越性: Python、JavaScript、TypeScript、Java、C++、Go、Rustのネイティブレベルサポート。実世界のアプリケーション
エージェント型検索機能
Claude Opus 4.5はコードベースを自律的にナビゲートし、依存関係を特定して、複数ファイルにわたるホリスティックな解決策を提案できます。
コンピュータ使用の強化
開発環境との対話、テストの実行、フィードバックに基づくコードの反復能力が向上しました。
エンドツーエンドのワークフロー
要件分析からデプロイスクリプトまで、Opus 4.5は最小限の人間介入で完全な開発サイクルを処理します。
アクセスと利用可能性
APIアクセス: $15/$75(100万トークンあたり)でAnthropic APIから利用可能 クラウドプラットフォーム: AWS BedrockとGoogle Cloud Vertex AI(2026年第1四半期予定) コンシューマーアプリ: claude.ai Proサブスクライバーが優先アクセス可能Opus 4.5を選ぶべき場合
- 最高のコード品質が必要な本番グレードのアプリケーションを構築
- 複雑なリファクタリングやアーキテクチャの変更に取り組んでいる
- 包括的なテストカバレッジ生成が必要
- 多言語コードベースの理解が必要
- 予算がプレミアム価格のプレミアム結果を許容する
まとめ
Claude Opus 4.5はAI支援ソフトウェア開発のパラダイムシフトを表しています。AIシステムが人間の平均だけでなく、実際のエンジニアリングタスクで人間を超えた初めてのケースです。価格はプレミアムのままですが、生産性の向上は真剣な開発チームへの投資を正当化します。
AIがコーディングできるかどうかという問いは今や過去のものです。次の問いは、AI共同作業者が人間を上回る世界に、人間開発者がいかに速く適応できるかです。