リークされたClaude 5ベンチマークがClaude 4.5比25%のパフォーマンス向上を示唆
非公式のベンチマークリークがClaude 5はSWE-benchで92%、HumanEvalで99.1%を達成し、AIコーディング能力の新記録を樹立する可能性を示す。
速報:非公式のClaude 5ベンチマークが浮上
匿名の情報源が「Claude 5.0 Opus(プレビュー)」とラベル付けされた未発表モデルの内部Anthropicベンチマーク結果とみられるものをリークしました。その数字は驚異的です。
リークされたベンチマーク結果
SWE-bench Verified:92.3%
現在のリーダー(Claude 4.5 Opus): 80.9% 改善: +11.4ポイント(+14%相対)これはSWE-benchで90%を突破した最初のAIモデルとなり、理論上の最大値95%(ベンチマーク内の一部のGitHubイシューは人間でも情報が不十分)に近づきます。
HumanEval:99.1%
現在のリーダー(Codex 5.3 Ultra): 98.1% 改善: +1.0ポイント標準的なプログラミングタスクで事実上完璧なコード生成。
MBPP(Pythonプログラミング):98.7%
現在のリーダー(Claude 4.5 Opus): 96.1% 改善: +2.6ポイントLiveCodeBench(実世界コーディング):89.4%
現在のリーダー(Claude 4.5 Opus): 78.2% 改善: +11.2ポイントGPQA Diamond(科学的推論):87.3%
現在のリーダー(GPT-5.1): 81.9% 改善: +5.4ポイント真偽の検証分析
信憑性を支持する証拠
1. Anthropicの研究軌跡との一致Constitutional AIと拡張推論に関する最近の論文がこの範囲の能力の向上を示唆。
2. ベンチマーク手法が既知の標準と一致リークされたデータには、Anthropicの公開手法に一致する適切な統計的信頼区間と評価プロトコルが含まれている。
3. 複数の独立した情報源異なるチャネル(Twitter、Discord、Reddit)からの少なくとも3つの独立したリークが同一の数字を示しており、単一のソース文書を示唆。
信憑性に反する証拠
1. 公式確認なしAnthropicはこれらのベンチマークを認めていない(未発表モデルでは予想通り)。
2. 不自然に丸い数字一部のスコア(92.3%、89.4%)はもっともらしく見せるために捏造されたかもしれない。
私たちの評価: 65%の確率で本物SWE-bench 92%が実際に意味すること
現在の状態(Claude 4.5が80.9%)
実際のGitHubイシューの5件中4件を自律的に解決できる。
予測状態(Claude 5が92%)
以下を含む10件中9件の実際のイシューを解決できる:
- 複雑なマルチファイルのリファクタリング
- 微妙な並行性バグ
- アルゴリズムの変更が必要なパフォーマンス最適化
- マイクロサービス間の統合問題
実際の影響
時間節約: シニアエンジニアが日常的なバグ修正に費やす時間が約40%削減 コード品質: AIの提案に必要な人間の修正が少なくなる アクセシビリティ: ジュニア開発者がAIの支援でシニアレベルのタスクに取り組める技術分析:どのように可能か?
Anthropicの最近の研究に基づき、予測される改善には以下が含まれます:
1. 拡張されたChain-of-Thought推論
仮説: Claude 5はコードを生成する前に最大5万トークンの内部推論を使用する可能性(Claude 4.5の5,000トークンと比較)。 影響: より優れたアーキテクチャ計画、少ない論理エラー2. トレーニングデータ品質の改善
仮説: 100スター以上で活発にメンテナンスされているGitHubリポジトリのみを含むフィルタリングされたトレーニングセット。3. 拡大されたコンテキストウィンドウ
噂: 50万トークンのコンテキスト(Claude 4.5の20万トークンから増加) 影響: 大規模なコードベース全体を理解・修正できるまとめ
これらのベンチマークが本物であれば、Claude 5はAI支援ソフトウェア開発における記録を樹立する可能性があります。92%のSWE-benchスコアは、AIシステムが人間の平均的な開発者よりも一貫して優れた結果を達成できることを意味します。
しかし確認されるまで、これらの数字は将来起こりうることの誘惑的な垣間見えとして扱うべきです。Anthropicが発表を行う際、何を測定するかに注意してください。