速報2026年2月10日

Codex 5.3リリース:Terminal-Bench 77.3%、SWE-Bench Pro 56.8%を達成

OpenAIが2026年2月5日にGPT-5.3-Codexをリリース。ターミナルおよびコーディングベンチマークで画期的なパフォーマンスを発揮する、これまでで最も優れたエージェント型コーディングモデル。

OpenAIが最も高性能なコーディングモデルを発売

2026年2月5日、OpenAIはGPT-5.3-Codexをリリースし、「これまでで最も高性能なエージェント型コーディングモデル」と説明しました。このモデルは、前モデルより25%高速でありながら、最先端のコーディング性能と汎用推論能力の両方を向上させています。

ベンチマークパフォーマンス

Terminal-Bench 2.0: 77.3% - ターミナル駆動タスクで全モデルをリード SWE-Bench Pro(公開): 4つのプログラミング言語で56.8%の精度 OSWorld-Verified: 64.7% - 強力なコンピュータ使用能力 速度: GPT-5.2-Codexより25%高速化、トークン効率も改善

技術的イノベーション

セルフブートストラップ開発

注目すべきことに、GPT-5.3-Codexは自身の開発に貢献しました。Codexチームは初期バージョンを使用して:

  • 自身のトレーニングプロセスをデバッグ
  • デプロイインフラストラクチャを管理
  • テスト結果を診断・修正
  • 推論パフォーマンスを最適化

強化された機能

エージェント型コーディング: 最小限の人間介入で自律的なマルチステップタスク実行 ターミナルマスタリー: 以前のモデルを超えるネイティブレベルのコマンドライン熟達度 マルチ言語サポート: Python、JavaScript、TypeScript、Java、C++、Go、Rustでのプロダクショングレードのコード生成 トークン効率: 品質を維持しながらより少ない出力トークンを使用 - APIコストを削減

セキュリティと安全性

GPT-5.3-Codexは、特にサイバーセキュリティ能力について、Preparedness Frameworkの下で「High」として扱われる初のOpenAIモデルです。強化されたセーフガードが悪意のあるコード生成を防止しつつ、正当なセキュリティ研究機能を維持します。

利用可能状況と価格

ChatGPTユーザー: ChatGPT Plus、Team、Enterpriseプランで利用可能 APIアクセス: 100万トークンあたり入力$10/出力$30 プラットフォーム統合: ChatGPTアプリ、CLI、IDE拡張機能、Webインターフェース クラウドプロバイダー: AWS BedrockおよびAzure OpenAI Service(2026年第1四半期)

パフォーマンス比較

モデルTerminal-BenchSWE-Bench Pro速度価格(入力)
Codex 5.377.3%56.8%1.8秒$10/M
Claude Opus 4.668.4%54.2%3.2秒$15/M
Gemini 3 Pro64.1%48.3%2.4秒$7/M

開発者の反応

アーリーアダプターはCodex 5.3が以下に優れていると報告:

  • バックエンドサービス開発
  • ターミナル自動化とDevOpsタスク
  • 大量コード生成
  • 高速イテレーションによるバグ修正

一部の開発者はClaude Codeが依然として以下でリードしていると指摘:

  • 深いアーキテクチャ推論
  • 長コンテキストのコードベース理解
  • UI/UXデザインの提案

Codex 5.3を選ぶべき場合

  • ワークフローで速度が重要
  • 主にターミナル/CLIツールを使用
  • コスト効率の良い大量生成が必要
  • バックエンドサービスとAPIの構築
  • 初回で信頼性の高いバグフリーコードが必要

まとめ

GPT-5.3-Codexは、特にターミナル駆動型および自律エージェントワークフローにおいて、AIコーディング能力の大きな飛躍を表しています。パフォーマンス、速度、競争力のある価格の組み合わせにより、開発チームにとって魅力的な選択肢となっています。

このモデルが自身の構築を支援できたことは、AIシステムが自身の開発に積極的に参加する時代に入りつつあることを示しており、深い意味を持つパラダイムシフトです。

Claude 5とAI業界に関する最新のアップデートとお知らせ

OtterMindで使用