SonnetとCodexの違いを比較|料金と使い分けを実例で解説

SonnetとCodexの違いを比較|料金と使い分けを実例で解説

SonnetとCodexのどちらを選ぶか迷う人が増えています。2026年6月にClaude Sonnet 5、7月にGPT-5.6が登場し、単純な「速い・賢い」比較だけでは、料金や作業の進め方まで見ないと判断しにくくなりました。本記事では、公式発表を基に、コード読解、修正、テスト、長い作業の扱いやすさを比べ、開発環境に合う選び方を整理します。

結論powered by Claude

2026年8月3日時点で、AnthropicのClaude Sonnet 5はClaude CodeとClaude Platformで使える新しい中核モデルです。一方、OpenAIはGPT-5.6をChatGPT、Codex、APIへ展開しており、Codexでは契約や利用面に応じてモデルの選択肢が変わります。最新情報は[AnthropicのSonnet 5発表](https://www.anthropic.com/news/claude-sonnet-5)と[OpenAIのGPT-5.6発表](https://openai.com/index/gpt-5-6/)で確認できます。

比べるときに大切なのは、Sonnetを単体のモデル名、Codexをモデルを使ってコードベースを扱う作業環境とエージェント製品として分けて考えることです。Sonnet 5を使う入口にはClaude Codeがあり、Codexの入口にはターミナル、エディタ、ブラウザやアプリがあります。名前の階層が違うため、同じ条件の比較にそろえるところから始めます。

結論は一律ではありません。短い修正を素早く回すのか、広いコードベースを読み込んで検証まで進めるのか、すでにどの契約を持っているのかで有力な選択は変わります。同じ課題を同じリポジトリで試し、正確さ、修正範囲、確認のしやすさ、費用を記録すれば、印象だけに頼らず判断できます。

目次 (22)

なぜ今SonnetとCodexを比べるのか

この比較が必要になった理由は、コーディング支援の中心がコードの一行を補う機能から、リポジトリを調べ、複数のファイルを編集し、テスト結果を読んで修正を重ねるエージェントへ移ったからです。利用者はモデルの回答文だけでなく、作業の開始から完了までに何回確認が必要だったか、変更がどの範囲に収まったか、失敗したときに原因を追えるかまで見なければなりません。

時事的な転機は二つあります。Anthropicは6月30日、Claude Sonnet 5を全プランで提供し、Claude CodeとClaude Platformでも使えるようにしました。発表では、従来は大きなモデルが必要だったコーディングやツール操作を、Sonnetの速度と価格帯で扱えることを打ち出しています。OpenAIは7月9日、GPT-5.6をChatGPT、Codex、APIへ展開しました。Codexでは利用するプランに応じて選べるモデルと設定が変わるため、以前の世代の印象だけで比べると現状を取り違えます。

つまり、検索語の「sonnet codex」は、単に二つの名前を横に置く話ではありません。Sonnet 5をClaude Codeで使う場合と、GPT-5.6などをCodexで使う場合を、同じ作業単位で見比べる必要があります。なお、公式発表にある評価値は各社が異なる条件で測ったものです。数値だけを横並びにせず、手元の言語、フレームワーク、テストの厚さに照らして確認するのが安全です。

最新の提供範囲は変わる可能性があるため、実際に選ぶ直前にはClaude Sonnetの公式ページOpenAIのモデル一覧を開き、表示されるモデル名、利用地域、契約条件を確認してください。

まず名前を分ける:Sonnetはモデル、Codexは作業環境

SonnetはAnthropicが提供するモデル系列の名前です。現在の記事で中心にするSonnet 5は、文章生成だけでなくコードの理解、ツール操作、長い作業の計画を想定したモデルとして案内されています。Claude Codeは、そのモデルにプロジェクトのファイルを読ませ、指示に沿って作業させるための入口です。したがって「SonnetがCodexより速い」と表現するときは、どの入口、どの設定、どの課題を指しているのかを補う必要があります。

CodexはOpenAIのコーディングエージェント製品です。内部で使われるモデルと、ローカルのターミナル、エディタ、クラウドやアプリからの操作面を合わせて、コードを調査し、変更し、検証する一つの作業環境として考えると分かりやすくなります。GPT-5.6のような汎用性の高いモデルと、コーディングに最適化されたモデルは役割が違うため、Codexという名前だけで性能を決めつけないことが重要です。

Sonnet側はClaude Codeを入口に見る

Sonnet 5をコード作業で比較するなら、Claude Codeの設定と一緒に確認します。モデル単体の回答品質だけでなく、リポジトリの読み取り方、ファイル変更の前に何を説明するか、テスト結果を受けて再調査できるかが、実際の使い心地を左右します。AnthropicのCLI資料では、--model claude-sonnet-5のようにモデルを指定できると案内されています。利用者は、別のモデルを使っている状態で比較したつもりにならないよう、開始時のモデル名を記録しておくとよいでしょう。

Codex側はモデル名と入口を分けて見る

Codexでは、モデルの選択と実行場所を別々に記録します。同じGPT系でも、ターミナルのローカル作業、ブラウザ側のクラウド作業、コードレビューでは使える設定や確認画面が異なることがあります。OpenAIの公式資料は、Codexをコードベースの理解、機能追加、バグ修正、テスト、レビューに使う場として説明しています。比較表に「Codex」とだけ書かず、「Codexのどの画面で、どのモデルを、どの設定で使ったか」まで残すと、再現性のある比較になります。

比較1:コードを読み始めるまで

最初の差は、指示を送った直後にどれだけ前提を共有できるかです。小さな関数の修正なら、対象ファイルと期待する動作を明示すれば、どちらでも早く結果に届くでしょう。差が出やすいのは、設定ファイル、データの流れ、既存テスト、例外処理が複数のディレクトリに分かれたリポジトリです。

ここでは「どちらが多くのファイルを読めるか」だけで判断しません。必要なファイルを見つけるまでの時間、読んだ前提を説明するか、関係のないファイルまで変更しないかを観察します。読み取りが速くても、重要な境界を見落とせば後で修正回数が増えます。逆に、最初の調査が丁寧でも、毎回同じ説明を求めるなら日常の負担になります。

小さな修正は確認の少なさを見る

一つの関数に条件分岐を追加する、テスト名を直す、型エラーを修正する、といった小さな課題では、回答の華やかさより変更の正確さを見ます。Sonnet 5とCodexの両方に同じ指示を渡し、変更したファイル数、差分の行数、テストの実行結果を記録してください。余計な整形や無関係なリファクタリングが少ないほうは、レビュー担当者の確認を軽くできます。

また、修正前に不明点を質問するか、勝手に前提を置くかも重要です。前提を置く必要がある場合に、それを明示してから進めるエージェントは、後から方向を直しやすくなります。短いタスクほど成功したように見えやすいので、正解したかだけでなく、何を根拠に変更したかも残して比較しましょう。

大きなリポジトリは探索の筋道を見る

複数のサービスやパッケージを含むリポジトリでは、最初の探索が結果を左右します。入口となるファイルを探し、呼び出し関係をたどり、設定とテストの位置を確認してから変更に入るかを見ます。Sonnet 5の公式発表は、コーディング、ツール利用、計画、長い作業の改善を説明していますが、実際の速度はリポジトリの構造と指示書の品質にも左右されます。

Codexも同じで、OpenAIの公式ガイドが示すようなコードベースの把握を実際に行えるかは、対象プロジェクトを与えないと分かりません。調査の要約にファイル名や関数名が含まれているか、変更の前後で依存関係が壊れていないかを見てください。探索の筋道が明確なら、出力が一度で完璧でなくても人が安全に引き継げます。

比較2:実装とレビューの進め方

コーディングエージェントを選ぶとき、最終的なコードだけを比べると判断を誤ります。実務では、作業を小さな単位に分ける、途中で方針を確認する、テストを回す、失敗した箇所だけ直す、最後に差分を読むという流れが何度も発生するからです。ここでの差は、モデルの知識量よりも、利用者がどの時点で介入しやすいかに表れます。

同じ課題を二つの環境へ渡すときは、指示を盛りすぎないことも大切です。「このバグを直し、既存の挙動を保ち、関連テストを追加して結果を説明する」のように、目的、変更範囲、完了条件をそろえます。個別の製品を勝たせるための指示を書けば、比較ではなくプロンプトの差を測ることになります。

Sonnetを試すときは修正の一貫性を見る

Sonnet 5をClaude Codeで試す場合は、最初の提案が巧みかより、二回目以降も同じ規約を守れるかを見ます。最初にコードの構造を説明させ、次に一つの変更を依頼し、最後に失敗するテストを示して修正を求める、という三段階にすると、調査から検証までの一貫性を確認できます。AnthropicがSonnet 5について示す「少ない手順で結果へ届く」という方向性は、手元の作業でも変更回数と確認回数に置き換えて測れます。

特に、既存の命名規則やエラー処理を守れるかを確認してください。新しいコードが単体では動いても、周辺の書き方から外れると保守の負担が増えます。Claude CodeのCLI資料にあるモデル指定を使い、実行時のモデルがSonnet 5であることを確認したうえで、同じ課題を複数回試すと、偶然の成功と安定した傾向を分けられます。

Codexを試すときは検証までのつながりを見る

Codexでは、機能追加や不具合修正を依頼したあと、関連テストを自分で選び、失敗原因を特定し、差分をまとめられるかを見ます。OpenAIはGPT-5.6をCodexで利用できることに加え、コードの実装、リファクタリング、デバッグ、テスト、検証を扱う用途を公式に示しています。だからこそ、生成されたコードの見栄えではなく、検証の証拠が残るかを評価軸にします。

良い結果とは、テストがすべて通ることだけではありません。実行できなかったテスト、その理由、未確認の境界条件、変更していない箇所を説明できることも含みます。Codexの作業面で確認がしやすく、必要なときに差分へ戻れるなら、長い修正を人が監督しやすくなります。逆に、説明が短くても確認材料が不足するなら、速さを高く評価しすぎないようにしましょう。

比較3:料金と利用上限

料金比較では、モデルのAPI単価、アプリやCLIの月額契約、利用上限を混ぜないようにします。Sonnet 5の公式発表では、Claude Platformに2026年8月31日までの導入価格として入力100万トークン2ドル、出力100万トークン10ドルを示し、その後は3ドルと15ドルになると説明しています。一方、GPT-5.6はSol、Terra、Lunaの層ごとにAPI価格が案内されています。これらはAPI利用の目安であり、CodexやClaude Codeの契約料金と同一ではありません。

日常利用で見るべきなのは、一回の作業が安いかだけではなく、同じ期間に何回試せるかです。短い修正を大量に行う人は応答の速さと軽いモデルの費用が効き、長い調査を少ない回数で終える人は、一回あたりの出力量と再試行の少なさが効きます。無料枠や月額枠の残量が分かりにくい場合、比較期間だけでも作業数、再試行数、検証に使った時間を記録してください。

Sonnet 5は8月31日までの価格を切り分ける

Sonnet 5の導入価格は、2026年8月3日に試す人にとって目を引く情報です。ただし、8月31日を過ぎた後の通常価格、Claude Codeの契約で含まれる範囲、APIの従量利用は別々に確認します。発表にある価格だけを月額の総額と受け取らず、入力と出力の比率、長いファイルを何度も読み込む回数、キャッシュや契約側の制限を含めて見積もる必要があります。

モデルが安くても、修正が増えれば人の確認時間が増えます。逆に、一回の出力が高くても、最初からテストまで進んで再実行が減るなら総費用は下がるかもしれません。Sonnet 5を評価するときは「100万トークンあたりの価格」と「一つの課題を完了するまでの実支出」を分けて表にし、価格改定後にも再計算できる形にしておくと安心です。

Codexは契約とモデルの表示を確認する

Codex側では、ChatGPTの契約で利用する場合とOpenAI APIを使う場合で請求の見方が変わります。OpenAIのGPT-5.6発表は、Codexで利用できるプランごとのモデル選択と、APIのSol、Terra、Lunaの価格を分けて説明しています。したがって、利用者がまず確認するのは「どのモデルが選択画面に表示されるか」「作業の上限はどこで確認できるか」「APIを使う作業が別請求になるか」です。

料金の最終確認は、OpenAIの料金ページAnthropicの料金ページをその時点で開いて行います。記事や比較サイトの数字は更新のタイミングがずれる可能性があります。費用をチームで比べるなら、同じ課題、同じ入力、同じ検証条件で、請求額だけでなく完了までの時間と人の確認回数も残しましょう。

比較4:長い文脈とツール操作

長い作業では、モデルの文脈長だけを見てはいけません。重要なのは、必要な情報をいつ参照し、途中の決定をどう保持し、古い前提をどう捨てるかです。巨大なリポジトリを一度に渡しても、関連の薄い情報で注意が分散すれば、短い範囲を順序よく読むより結果が悪くなることがあります。

Sonnet 5の発表は、コード、ツール利用、計画、知識作業、デザインの改善を掲げています。GPT-5.6の発表も、Codexでの利用、ツール操作、長い作業、複数の作業を分けて進める機能を説明しています。両社の言葉をそのまま優劣に変換せず、対象プロジェクトで「最初に見た情報を最後まで活用できるか」「途中で失敗しても復帰できるか」を確認するのが現実的です。

文脈の広さは読み取りの正確さと一緒に測る

長いファイルを保持できても、必要な定義を参照し忘れれば意味がありません。比較用の課題には、遠いディレクトリにある設定、古い実装と新しい実装の両方、例外時だけ通るテストを含めます。最終回答にそれらの関係が正しく反映されているか、参照したファイルが実際の変更理由になっているかを確認してください。

長い作業のテストでは、途中で「ここまでの前提を三つにまとめて」と依頼し、その要約と最終差分が一致するかを見るのも有効です。要約が変わるときに、エージェントが変更理由を説明できるか、前の判断を無条件に引きずらないかが分かります。文脈が広いことは強みですが、不要な情報を整理できることも同じくらい重要です。

ツール操作は成功率だけでなく停止点を見る

コードの読み書き、テスト実行、検索、差分確認などのツール操作では、成功した回数より、失敗時にどこで止まるかを記録します。権限が必要な操作を先に説明するか、実行結果を読まずに次へ進まないか、同じ失敗を繰り返さないかを見れば、日常の監督しやすさを測れます。

比較時は、外部サービスへの接続を含む課題より、まず手元のリポジトリで完結する課題から始めます。環境の差を小さくするためです。次に、テストデータの準備や画面の確認など、実務に近い操作を一つずつ足します。操作の範囲が広がるほど、便利さと確認負担の両方が増えるので、成功率だけで導入を決めないでください。

比較5:チームで選ぶときの判断軸

個人の好みとチームの採用判断は分けます。個人なら、応答の読みやすさ、契約の持ちやすさ、普段使うエディタとの相性で決めても問題ありません。チームでは、誰がモデルを選べるか、変更前の確認をどこで行うか、作業結果をどの形式で共有するか、問題が起きたときにどの記録を見ればよいかまで決めます。

Sonnet 5とCodexのどちらを採用しても、最初に必要なのは製品名ではなく、作業の境界です。読み取りだけを許す場所、変更してよい場所、テストを実行する場所、最終的に人が確認する場所をリポジトリごとに定義します。権限の確認画面やプロジェクトの指示書を整えると、モデルを変えたときも比較の条件をそろえやすくなります。

個人開発は契約と得意な作業から選ぶ

すでにClaudeの契約を持ち、長い既存コードの読解や複数ファイルの修正を日常的に行うなら、Claude CodeでSonnet 5を試すのが自然です。逆にChatGPTを中心に使い、Codexのターミナルやエディタからレビューとテストまで進めたいなら、GPT-5.6を含むCodexの選択肢を確認するのが近道です。

どちらも初めてなら、最初の一週間だけ同じ五つの課題を固定します。小さなバグ、既存機能の変更、テスト追加、依存関係の更新、コードレビューを順に試し、毎回の差分と確認時間を残します。体感の速さは端末や回線でも変わるため、印象ではなく自分の課題の完了率を中心に判断します。

チーム導入は再現性と引き継ぎやすさから選ぶ

複数人で使う場合は、同じ依頼を別の人が再現できるかが重要です。使ったモデル、設定、対象ブランチ、テスト結果、未確認の点を記録できるほうが、担当者が変わってもレビューを続けやすくなります。Sonnet 5のClaude CodeとCodexのどちらを選んでも、個人の画面だけに結果を閉じ込めないことが大切です。

また、製品の更新でモデル名や料金が変わる前提を共有します。月に一度、代表的な課題を同じ条件で再実行し、品質、速度、費用、確認負担の四つを見直します。最初に勝った製品を固定するのではなく、チームのコードベースと契約条件に対して、どちらが安定して説明可能な結果を出すかを継続的に確かめてください。

同じタスクで比べる手順

机上のベンチマークを読むだけでは、SonnetとCodexの違いは自分の開発環境に置き換わりません。次の順序で同じ課題を一つずつ試すと、比較条件をそろえやすくなります。

  1. 対象を固定する。 公開しても問題のない小さなリポジトリか、社内の評価用コピーを一つ用意し、使うコミット、言語、テストコマンド、対象ファイルを決めます。最初から大きすぎるコードベースを渡すと、モデルの差と準備不足の差が混ざります。

  2. 指示をそろえる。 目的、変更してよい範囲、守る既存仕様、実行してほしいテスト、完了時に説明してほしい項目を同じ文面で渡します。Sonnet 5ではClaude Code、Codexでは選択画面に表示されたモデル名を記録し、別のモデルが選ばれていないか確認します。

  3. 調査だけを先に評価する。 いきなり編集を許可せず、関係するファイル、原因の仮説、確認が必要なテストを説明させます。ファイル名の正しさ、見落とした依存関係、前提の明示を点数化すると、回答の流暢さに引っ張られにくくなります。

  4. 同じ変更と検証を行う。 同じ修正を依頼し、変更ファイル数、差分行数、テスト結果、失敗からの復帰回数を記録します。動いたコードだけでなく、変更していない場所を守れたか、テストを実行できなかった理由を説明できたかも評価します。

  5. 費用と引き継ぎを確認する。 課題完了までの実支出、所要時間、人が確認した回数、残った作業を記録します。最後に別の人へ差分を渡し、調査理由と検証結果だけで内容を理解できるかを確かめます。ここまで行って初めて、普段の開発に合うかを判断できます。

SonnetとCodexの使い分け

現時点の情報を踏まえると、Sonnet 5はClaude Codeを通して、速度と能力のバランスを保ちながらコード作業を進めたい人に向きます。特に、Claudeの契約をすでに持っている、Claude系の回答に慣れている、既存コードの読解から修正まで一つの対話でつなげたい、という条件が重なると試す理由が明確です。Anthropicの公式ページが示すように、Sonnet 5はClaude Codeで利用でき、8月31日までは導入価格も案内されています。

Codexは、OpenAIのモデルと、ターミナル・エディタ・ブラウザなど複数の作業面をまとめて使いたい人に向きます。ChatGPTの契約を起点に始めたい、コードレビューやテストまで同じ製品面で扱いたい、GPT-5.6のモデル層を用途に応じて選びたい、という条件なら確認する価値があります。公式発表ではGPT-5.6がCodexで利用できることと、利用するプランによって選択肢が変わることが説明されています。

ただし、これは永続的な優劣ではありません。モデルの更新、価格、契約に含まれる範囲、利用できる機能は変わります。SonnetとCodexを長く使うなら、月ごとの評価課題を決め、同じコードで再確認してください。選び方を製品名の好みから、品質、費用、確認のしやすさ、引き継ぎやすさの四つへ移すと、更新があっても判断を続けられます。

まとめ

SonnetとCodexを比べるときは、Sonnet 5というモデルと、GPT-5.6などを組み込んだCodexという作業環境を同じ階層に置かないことが出発点です。Claude CodeとCodexを入口としてそろえ、同じリポジトリ、同じ指示、同じテストで比較します。そこで見るべきなのは、コードを正しく読めるか、変更範囲を守れるか、失敗を説明できるか、検証結果を人へ渡せるかです。

料金も、APIの単価と月額契約を分けて確認します。Sonnet 5は8月31日までの導入価格が案内され、GPT-5.6はCodexとAPIで提供条件が異なります。目先の安さだけでなく、一つの課題が終わるまでの再試行、人の確認時間、未確認事項まで含めて比べてください。個人なら現在の契約と得意な作業、チームなら再現性と引き継ぎやすさを基準にすれば、現在の「sonnet codex」という検索意図を、実際の選定へつなげられます。

公式情報は更新されるため、利用前にはAnthropicのClaude Sonnet 5発表Claude CodeのCLI資料OpenAIのGPT-5.6発表OpenAIのモデル一覧を確認してください。

参考になったら ♡
Codexer Navi 編集部
@codexer_navi

Anthropic の Claude / Claude Code を中心に、日本のエンジニア向けに最新動向と実務 を毎日発信。 運営方針 は メディアについて をご覧ください。