5.3 Codex vs 5.4の違いを実務別に料金・速度まで比較

5.3 Codex vs 5.4の違いを実務別に料金・速度まで比較

「5.3 codex vs 5.4」で迷うときは、数字の新しさだけでなく、長い実装を任せるのか、画面操作や複数の道具を含む作業なのかで考えるのが近道です。2026年9月4日のCodex 0.153.4ではAstraのモデル選択表示と既定値が更新されました。この記事では、GPT-5.3-CodexとGPT-5.4の公式説明、速度、推論、料金、利用場面を比べ、今日の作業に合う選択を整理します。

結論powered by Claude

「5.3 codex vs 5.4」でまず押さえるべきは、GPT-5.3-Codexはコーディング中心の設計で、GPT-5.4はその能力を引き継ぎながら画面操作や一般的な仕事まで扱うモデルだという関係です。OpenAIはGPT-5.3-Codexの公式発表で、長時間のソフトウェア作業や、作業中に指示を変えられる対話性を説明しています。

GPT-5.4はCodexにも展開された汎用モデルで、SWE-Bench ProではGPT-5.3-Codexを上回り、画面操作やツール利用の評価でも強みを示します。GPT-5.4の公式発表には、コーディング、コンピューター操作、ツール検索、長い文脈を扱う機能の説明があります。

結論は、長いコード変更とターミナル中心なら5.3、コードと画面・資料・複数ツールをまたぐなら5.4です。ただし、実際に見えるモデルはプランや利用場所で異なります。Codex 0.153.4でモデル選択の表示と既定値が変わったため、名前だけで判断せず、選択画面と利用条件を最後に確認してください。

目次 (31)

5.3 codex vs 5.4は「世代」より役割で比較する

「5.3」と「5.4」を単純な新旧の差として読むと、判断を誤りやすくなります。GPT-5.3-Codexは、ソフトウェア開発を長く続けるエージェントとして訓練されたモデルです。一方のGPT-5.4は、GPT-5.3-Codexのコーディング能力を取り込みつつ、文書、調査、画面操作、外部ツールを含む一般的な仕事へ対象を広げたモデルです。つまり、5.4が常に5.3の置き換えになるというより、作業の範囲が広がったことで得意な場面が変わったと理解するのが自然です。

さらに、モデル名とCodexのアプリやCLIの版番号は別物です。9月4日に公開されたCodex 0.153.4のリリースノートでは、バンドルされたモデル選択画面でAstraを表示し、明示的な指定がない場合の既定値も更新したと説明されています。これはGPT-5.3やGPT-5.4の性能比較とは別の、道具側の更新です。モデル選びでは、まず何を選んでいるのかを「モデル」「Codexの版」「利用プラン」の三つに分けて確認します。

観点 GPT-5.3-Codex GPT-5.4
主な立ち位置 エージェント型のソフトウェア開発 コーディングを含む汎用的な仕事
得意な作業 大きな修正、調査、テスト、長い実装 コード、画面操作、文書、複数の道具
比較で目立つ点 Terminal-Bench 2.0で高い結果 SWE-Bench Pro、OSWorld、ツール利用で強い結果
選び始める場所 リポジトリ中心の課題 コード以外の確認も同じ作業に含む課題

この表は優劣を一行で決めるためのものではありません。同じリポジトリを扱う場合でも、コードの変更だけで終わるのか、ブラウザーやデスクトップ画面を確認するのかで最適な候補は変わります。比較記事やベンチマークの数字を読むときも、数値の大小より先に、自分の作業に近い評価がどれかを確かめることが大切です。

GPT-5.3-Codexの特徴

GPT-5.3-Codexの公式発表では、実際のソフトウェア開発に近い課題、長く続く調査やツール利用、複雑な実行を一つのモデルで扱う方向が示されています。コードを書くことだけでなく、リポジトリを読み、変更方針を考え、テストやレビューまで進める一連の作業に向く設計です。作業中に人が方針を修正し、次に見るファイルや確認したい条件を伝えられる点も、単発の補完機能とは異なります。

APIのモデルページでは、GPT-5.3-Codexはエージェント型のコーディング作業向けと説明され、推論の強さをlow、medium、high、xhighから選べます。400,000トークンの文脈長と、128,000トークンの最大出力も案内されています。実際のCodex利用ではアカウントや提供場所による違いがあるため、数字をそのまま全利用者の保証と考えず、GPT-5.3-CodexのAPIモデルページを利用直前に確認してください。

コードベース全体を読む仕事に向く

複数のディレクトリにまたがる変更、既存の設計に合わせた修正、失敗したテストの原因調査では、最初の指示から最後の確認までコードの話が続きます。このような課題では、モデルがリポジトリの構造や既存の命名を保ちながら、変更箇所を絞っていくことが重要です。GPT-5.3-Codexはこのようなソフトウェア開発の流れに重点が置かれているため、画面上の見栄えよりも、依存関係、テスト、互換性を順番に確認させたい場面で候補にしやすいモデルです。

ただし、文脈長が大きいからといって、最初から全ファイルを渡す必要はありません。対象の入口、関連する設定、再現手順、失敗ログを順に示したほうが、変更の理由を追いやすくなります。コードベースが大きいほど、モデルの能力だけでなく、何を対象にするかを人が決めることが結果を左右します。

対話で方針を修正しやすい

長い実装では、最初の見立てが途中で変わることがあります。例えば、予定していたライブラリを使えない、古いブラウザーも対象にする必要がある、既存のテストが期待する仕様と新しい要件に食い違う、といった状況です。GPT-5.3-Codexを使う場合は、作業を止めて理由を説明させ、変更してよい範囲と維持すべき範囲を明示することで、最終的な差分を人が追いやすくなります。

この対話性は、何でも任せればよいという意味ではありません。データ移行、認証、課金、公開設定など影響が大きい領域では、変更前後の条件を人が確定し、モデルにはその条件に沿った候補と確認材料を出してもらいます。5.3を選ぶときほど、作業の終了条件と人が確認する箇所を先に書いておくと、長い作業が広がりすぎません。

GPT-5.4の特徴

GPT-5.4の公式発表は、GPT-5.3-Codexのコーディング能力を取り込みながら、知識作業、コンピューター操作、外部ツールの利用を一つのモデルで扱う方向を示しています。Codexでは長い文脈を試せる機能も案内され、コードの編集だけでなく、画面を見て結果を確かめる、文書を読み替える、複数の道具から必要なものを探すといった作業を同じ流れに置けます。

GPT-5.4の強みは、コードの正しさだけを競う場面ではなく、目的に届くまでに複数の種類の判断が必要な場面で表れます。例えば、画面の状態を確認して修正箇所を決め、関連するコードを変更し、最後に見た目とテストの両方を確認する作業です。反対に、純粋なコード変更でTerminal-Bench型の操作が中心なら、5.3の結果や応答の癖が合う可能性もあります。

画面操作やツール利用が混ざる仕事

開発では、コードを書いた後にブラウザーで表示を確認したり、デスクトップアプリの状態を見たり、資料の内容を参照して実装を調整したりします。このとき、コード生成モデルと画面確認の道具を頭の中で別々に管理するより、入力と結果を一つの文脈で扱えるモデルのほうが説明の往復を減らせます。GPT-5.4はコンピューター操作とツール利用を含む評価に重点があり、こうした混合型の作業を第一候補にしやすい設計です。

OpenAIの発表では、GPT-5.4はツールを必要なときに探す仕組みも紹介されています。利用する道具が増えるほど、毎回すべての説明を最初から与える負担は大きくなります。もちろん、道具を使えることと、正しい順番で使うことは別です。画面操作を含む課題では、変更前の状態、触ってよい範囲、確認する結果を人が明確にし、モデルが何を見て判断したかを追えるようにします。

長い文脈を扱うときの注意

GPT-5.4はCodexで最大1Mトークンの文脈を試せる機能が案内されていますが、長く入れられることと、長く入れるほど良いことは同じではありません。不要なログや古い仕様が増えると、重要な条件が埋もれ、モデルが判断を迷わせることがあります。対象を分け、現在の仕様、再現条件、変更してはいけない箇所を先頭にまとめるほうが、実際の作業では安定しやすいでしょう。

また、OpenAIの説明では、標準の文脈長を超える利用が通常より大きく利用量に影響する条件も示されています。大きな文脈を使えるからといって、すべての課題を一度に渡すのではなく、何を一つの作業単位にするかを決めてから選んでください。文脈の広さは、整理の手間をなくす機能ではなく、整理した情報を保持する余地と考えるのが安全です。

公式ベンチマークで見る違い

GPT-5.4の公式発表に掲載された比較では、GPT-5.4とGPT-5.3-Codexの得意分野が一つの数字に収まりません。SWE-Bench ProはGPT-5.4が57.7%、GPT-5.3-Codexが56.8%です。Terminal-Bench 2.0ではGPT-5.4が75.1%、GPT-5.3-Codexが77.3%で、ターミナル中心の評価では5.3が上回ります。OSWorld-Verifiedは75.0%対74.0%、Toolathlonは54.6%対51.9%、BrowseCompは82.7%対77.3%で、画面操作やツール利用を含む評価では5.4の数字が目立ちます。

評価 GPT-5.4 GPT-5.3-Codex 読み方
SWE-Bench Pro 57.7% 56.8% 実際のソフトウェア開発に近い課題
Terminal-Bench 2.0 75.1% 77.3% ターミナル操作を重く見る課題
OSWorld-Verified 75.0% 74.0% 画面を見てコンピューターを操作する課題
Toolathlon 54.6% 51.9% 複数の道具を使う課題
BrowseComp 82.7% 77.3% 情報を探して答えをまとめる課題

数値は同じ条件で測った比較材料ですが、日々のリポジトリ、言語、テスト、指示の出し方まで同じになるわけではありません。特に、評価の種類が違えば優位なモデルも変わります。5.3 codex vs 5.4の答えを一つに固定するのではなく、自分の作業を「コードの修正」「ターミナルでの調査」「画面の確認」「情報の整理」のどれに近いかへ分解して考えます。

コーディングだけなら数値を一つに決めない

コードの変更を評価する場合でも、実装の正しさ、変更量、テストの通過、既存仕様との整合性は別の軸です。SWE-Bench Proで少し高い結果が出たからといって、すべてのリポジトリで5.4が速いとは限りません。Terminal-Benchで高い5.3が、画面上の細かな配置や資料の読み取りでも同じように快適とは限りません。まず課題の中心を一つ選び、その中心に近い評価を重く見ます。

例えば、型エラーを直してテストを通す作業なら、変更が小さく正確であることを優先します。複数のモジュールを読み、将来の拡張も踏まえて整理する作業なら、推論の強さと文脈の扱いやすさを見ます。数字の差が小さいときは、応答の読みやすさや、指示を修正した後の追従性を実際の小さな課題で確かめるほうが実用的です。

画面操作・調査まで含めるなら5.4

コードを書いたあとにブラウザーの表示、デスクトップの状態、文書の内容、外部資料の差分まで確認するなら、評価の中心はコード生成だけではありません。画面を読み、次の操作を選び、結果を受けてコードを直す一連の流れが必要です。この条件では、GPT-5.4のOSWorld-VerifiedやToolathlon、BrowseCompの数字が、5.3との役割の違いを考える材料になります。

ただし、画面操作が含まれるから無条件に5.4という意味でもありません。操作対象が単純で、コードの変更範囲が大きく、端末での調査が大半なら5.3が合うことがあります。仕事の中で最も時間を使う箇所と、失敗するとやり直しが大きい箇所を見つけ、その二つに強い候補から試してください。

実務別の選び方

モデルを選ぶ前に、作業を「変更対象」「確認方法」「時間と費用」の三つへ分けると、5.3と5.4の差を具体化できます。単に新しい方を使うのではなく、今回の仕事で一番困る失敗が何かを決めます。コードの誤りならテストやレビュー、画面の誤りなら表示確認、調査の誤りなら出典の確認が基準になります。

この三つを先に書いておくと、モデルの印象ではなく作業の条件で選べます。途中で候補を変える場合も、何が合わなかったのかを速度、正確さ、画面理解、確認のしやすさに分けて残せます。次の手順では、その判断を小さな課題へ落とし込みます。

Step 1: 変更対象がコード中心かを決める

最初に、モデルへ渡す主な材料を並べます。リポジトリのファイル、テスト結果、エラーログが中心で、結果も差分とテストで判断できるなら、GPT-5.3-Codexから試す理由があります。設計に沿った変更を長く続けたいときは、作業の区切りごとに人が確認し、対象外のファイルを増やさないようにします。コード以外の材料が少ないほど、コーディングに寄ったモデルの特徴を評価しやすくなります。

Step 2: 画面や資料を扱うかを確認する

ブラウザー、デスクトップ画面、表計算、文書、外部資料などを見てからコードを直すなら、作業の入口がコードだけではありません。画面の状態や資料の条件を一つの流れで扱いたい場合は、GPT-5.4を優先候補にします。画面を見せるだけで終わらず、どの状態を正しいとするか、どこまで変更してよいか、最終的に人が何を確認するかを先に決めると、モデルの幅広い能力を評価しやすくなります。

Step 3: 速度と費用の許容幅を置く

急いで画面を細かく直す作業では、応答の待ち時間が体験を左右します。一方、複雑な変更で何度もやり直すと、最初の応答が少し速いことより、正しい方向へ進むことのほうが大切です。APIを使う場合は入力、キャッシュされた入力、出力の単価を別々に見ます。Codexの利用枠で使う場合はAPIの単価をそのまま当てはめず、契約中のプラン、表示される上限、利用量の扱いを確認します。

Step 4: 同じ課題で小さく試す

大きな機能開発をいきなり比較に使うと、モデルの差と課題の不確実さが混ざります。まずは再現できる不具合、単一画面の小さな変更、既存テストの追加など、結果を確認しやすい課題を選びます。同じ入力、同じ対象範囲、同じ確認条件で5.3と5.4を試し、変更の正しさ、差分の広がり、確認に要した時間、追加の指示回数を記録します。そこで見えた差を、より大きな仕事へ広げるのが現実的です。

Codexでモデルを選ぶときの確認点

Codexで迷う原因の一つは、表示される名前と実際の利用条件が同じ場所に並ばないことです。選択画面にモデル名が見えても、契約、地域、利用場所、アプリやCLIの版によって選べる候補が変わることがあります。さらに、既定値が更新されると、明示的にモデルを指定していなかった作業の結果が変わる可能性があります。作業の記録には、モデル名だけでなく、利用した場所とCodexの版も残します。

比較を始める前に、現在の画面に何が表示され、どの設定が選ばれているかを一度だけ確認します。特に、モデル名の表示、推論の強さ、利用できる道具、利用枠の表示は、同じ作業でも結果へ影響します。ここを記録しておけば、あとから「5.3と5.4の違い」と「選択条件の違い」を切り分けられます。

表示名とモデルIDを分けて見る

画面に表示された短い名称は、人が選びやすいように整えられたラベルです。APIや設定で指定するモデルIDとは表記が異なる場合があります。5.3を選んだつもりで別のモデルを使っていた、または5.4を選んだのに利用枠の都合で別の候補へ切り替わっていた、といった混同を避けるには、開始時に表示されたモデル、設定に記録されたID、利用場所をそれぞれ確認します。

比較の再現性を高めるなら、同じ質問文を使うだけでは不十分です。対象のファイル、読み込ませた資料、推論の強さ、ツールを使える条件、確認するテストもそろえます。条件が違うまま結果だけを比べると、モデルの差ではなく入力の差を見てしまいます。

Codexの版とモデルの版を混同しない

Codex 0.153.4は、モデルそのものの名称ではなく、Codex側のリリース番号です。今回のリリースノートではAstraの表示と既定値が更新されていますが、この変更からGPT-5.3-CodexとGPT-5.4の性能差を推測することはできません。逆に、モデルの評価結果だけを読んで、現在の選択画面や提供条件まで同じだと考えることも危険です。二つの版番号を別の欄に記録すれば、後から結果を見直しやすくなります。

出力を比較する指標を固定する

比較時は、正しく動くかだけでなく、不要なファイルを変更していないか、テストの意味を変えていないか、説明から変更の根拠を追えるかも確認します。画面操作を含む場合は、表示崩れ、フォーカス、キーボード操作、異なる画面幅の挙動を別に見ます。調査を含む場合は、出典のURLと、事実と提案が区別されているかを見ます。同じ指標で確認すると、速さに引っ張られず、実際に使い続けられるかを判断できます。

料金・文脈長・利用条件

2026年9月7日時点の公式ページでは、GPT-5.3-CodexのAPI料金は入力100万トークンあたり1.75ドル、キャッシュ入力0.175ドル、出力14ドルと案内されています。GPT-5.4は入力2.50ドル、キャッシュ入力0.25ドル、出力15ドルです。GPT-5.4のほうが単価は高い一方、公式発表では必要なトークン数を減らす方向の改善も説明されています。単価だけでなく、同じ作業を完了するまでに何回のやり取りと出力が必要かを見ます。

GPT-5.3-CodexのAPIモデルページは400,000トークンの文脈長と128,000トークンの最大出力を示しています。GPT-5.4はCodexで1Mトークンの文脈を試せる機能が案内されていますが、標準の272,000トークンを超える利用は、公式発表で通常より大きく利用枠へ影響する条件が示されています。数字だけを見て大きなリポジトリを毎回一度に渡すのではなく、必要な情報を整理してから投入してください。

API料金を見るときの落とし穴

APIの単価は、Codexを契約型の利用枠で使うときの請求額を直接表すものではありません。APIでは入力と出力の量に応じて計算しますが、Codexではプラン、利用枠、モデルごとの扱い、混雑時の制限などが関係します。したがって、「5.4は高いから常に5.3」という判断も、「5.4は少ないトークンで終わるから必ず安い」という判断も避けます。定型の課題を数件選び、完了までの総量と人の確認時間を合わせて比べるのが実務的です。

文脈長をそのまま性能と見なさない

文脈長が大きいと、関連するファイルや資料を保持できる余地は増えます。しかし、古い要件、重複したログ、対象外のコードが多く入ると、重要な制約が見えにくくなります。長い入力を使うなら、冒頭に目的、変更対象、維持する条件、確認方法をまとめ、資料ごとに役割を分けます。5.3でも5.4でも、情報の優先順位を人が整理することが結果の安定につながります。

利用条件も固定ではありません。Codexのアプリ、CLI、IDE、APIでは表示されるモデルや推論の設定が一致しない場合があります。この記事の数値や料金は公式ページを基準にした2026年9月7日時点の確認結果です。実際に作業を始めるときは、GPT-5.3-CodexのAPIモデルページGPT-5.4のAPIモデルページの最新表示、Codexの選択画面、契約中の利用条件を確認してください。

2026年9月のCodex更新をどう読むか

今回この比較を確認する理由は、モデルの性能だけでなく、Codex側の選択体験も変わっているからです。Codex 0.153.4は2026年9月4日に公開され、バンドルされたモデル選択画面でAstraが見えるようになり、明示的なモデル指定がない場合の既定値もAstraになりました。また、利用できる道具がない場面で非同期の質問を前提にしないよう、案内も更新されています。これは、モデルを選ぶ画面とモデルが作業を進める条件を一緒に確認する必要があるということです。

モデル選択画面の変化を確認する

アップデート後に最初に行うのは、以前の設定が残っているかを推測することではなく、現在の選択画面を確認することです。表示される候補、既定値、推論の強さ、ツールを使える条件を見て、今回の作業に必要なものがそろっているかを確かめます。5.3と5.4の比較を続けたいなら、モデルを明示してから同じ課題を試し、選択画面の変更と出力の変更を分けて記録します。

モデルが表示されない場合も、すぐに性能不足と決めつけません。利用プラン、アプリやCLIの版、提供地域、設定された利用場所が原因で候補から外れている可能性があります。公式の案内と現在の画面を確認し、それでも選べないなら、利用できる候補の中で同じ比較軸を使います。

過去の比較記事の数字を鵜呑みにしない

モデルの評価は、更新されたモデル、推論の設定、評価データ、測定方法によって変わります。過去の記事で5.3が最良と書かれていても、その記事が5.4の公開前に測ったものなら、現在の選択を直接決める材料にはなりません。逆に、5.4の総合的な数字が高くても、ターミナルで大量の変更を続ける仕事では5.3が扱いやすいことがあります。記事の公開日と公式ページの更新内容を確認し、自分の小さな課題で再確認します。

実際に比較するための小さな検証

手元の課題で5.3と5.4を比べるときは、モデルごとに別の大きなプロジェクトを渡さないことが重要です。比較の目的は勝敗を作ることではなく、どの条件でどちらが助けになるかを見つけることです。変更前の状態を保存し、同じ入力から開始し、結果を人が確認できる範囲に限定します。数回の試行で傾向を見て、長期の利用条件を決めます。

比較の単位を小さくすると、失敗したときに原因を調べやすくなります。モデルが間違えたのか、対象範囲の説明が足りなかったのか、確認条件が曖昧だったのかを分けて記録できるからです。まず短い課題で傾向をつかみ、その後に本番に近い変更へ広げます。

Step 1: 再現できる課題を一つ選ぶ

小さな不具合、既存画面の一箇所の修正、テストの追加、関数の整理など、開始条件と終了条件が明確な課題を選びます。課題文には、対象ファイル、変更してよい範囲、守るべき仕様、実行する確認方法を書きます。画面操作を比べるなら、正しい表示の条件と確認する画面幅も指定します。曖昧な課題ほど、モデルの差ではなく指示の不足が結果を決めます。

Step 2: 同じ材料と指示を渡す

5.3と5.4で入力が変わると、公平な比較になりません。同じリポジトリの状態、同じ関連ファイル、同じエラー、同じ確認方法を使います。片方にだけ追加の説明を渡したくなった場合は、補足を加える前後を別の試行として記録します。推論の強さを変更したときも、モデルの差と設定の差を混同しないように、設定をメモしておきます。

Step 3: 差分と確認結果を記録する

評価するのは最終回答の印象だけではありません。テストが通ったか、必要なファイルだけが変わったか、追加の指示が何回必要だったか、画面や資料の条件を守ったかを見ます。エラーが出たときに原因を説明できたか、修正後の確認方法を残したかも重要です。短時間で終わっても人の確認が増えるなら、実際の負担は小さくありません。

Step 4: 自分の主な失敗に合う方を選ぶ

数回の結果を並べたら、平均点を作る前に、仕事で一番避けたい失敗を見ます。誤った大規模変更が怖いなら差分の広がりとテスト結果、画面の崩れが怖いなら画面確認、調査の誤りが怖いなら出典と根拠を重く見ます。コード中心の長い作業なら5.3、複数の道具と画面確認が混ざる作業なら5.4から始め、結果が合わなければもう一方へ切り替えます。

まとめ

5.3 codex vs 5.4の比較では、GPT-5.3-Codexを長いソフトウェア開発とコードベース中心の作業に、GPT-5.4をコーディングに加えて画面操作、文書、調査、複数の道具を扱う作業に割り当てると考えると整理しやすくなります。GPT-5.4は総合的な評価や画面操作で強い一方、Terminal-Bench 2.0のように端末操作を重く見る評価ではGPT-5.3-Codexが上回るため、数字だけで新旧を決めることはできません。

2026年9月4日のCodex 0.153.4では、バンドルされたモデル選択画面でAstraの表示と既定値が更新されました。だからこそ、モデル名、Codexの版、利用プランを分けて確認し、現在の画面で選べる候補を確かめます。選択できたモデルを記録し、同じ小さな課題で差分、テスト、確認時間、追加指示の量を比べると、自分の開発に合う答えへ近づけます。

最終的なおすすめは、まずコードだけで完結する課題をGPT-5.3-Codexで、画面や資料を含む課題をGPT-5.4で試し、結果を逆のモデルでも一度確認する方法です。公式のGPT-5.3-Codex発表GPT-5.4発表Codex 0.153.4リリースノートを基準にしつつ、利用直前の表示と条件を確認してください。

参考になったら ♡
Codexer Navi 編集部
@codexer_navi

Anthropic の Claude / Claude Code を中心に、日本のエンジニア向けに最新動向と実務 を毎日発信。 運営方針 は メディアについて をご覧ください。