AI / LLM の判断 · 確認 2026-08-23

Codex vs Claude Code:モデルより先にAgentの使い方を比べる

目的から順に、必要な能力と道具を切り分けます。

この比較は、公開されている一次情報とDocumentation上の機能を基にしています。実機Benchmarkや「使ってみた」比較ではありません。

CodexとClaude Codeを比べるとき、最初にModel名を並べるのは簡単です。

でも実際にDeveloperが触るのはModel単体ではありません。

Terminal、IDE、Cloud、Permission、Sandbox、Git、PR、Subagent、Parallel task、Review。

つまり、比較しているのはAgent workflowです。

この記事では「どちらが一番賢いか」は決めません。

決めるのは、

自分がコードをどう書き、どこまで委任し、どうReviewしたいかに、どちらのAgent workflowが合うか

です。

一番大きな違いは、ModelよりSurfaceの組み方

Codex

現在のCodexは、CLIだけではありません。

OpenAIはCodexをChatGPT、IDE extension、Terminal/CLI、Cloud、Desktop appをまたぐCoding Agentとして展開しています。

Codex appは複数Agentを別Thread/Projectで管理し、worktreeを使って同一Repoで並行Taskを走らせるSurfaceとして現在説明されています。

そのため、

一つのTerminal sessionでAgentとPairする

だけでなく、

複数Taskを投げて後からReviewする

という使い方がProductの中心へかなり入っています。

Claude Code

Claude CodeはTerminalを非常に明確な中心Surfaceとして持ちます。

Repo内で起動し、必要なFileを読み、変更し、Command/Test/Gitを使いながら進めるAgentです。

一方、現在はWeb版もあり、GitHub RepoをRemote environmentへCloneしてTaskを委任し、離席中も処理を続け、完了後にBranch/PRとして戻すAsync workflowを持っています。

つまりClaude Codeも、

TerminalだけのTool

と考えるのは現在は古い。

Synchronousに一緒に作るか、Taskを委任するか

細かく方向修正したい

Terminal/IDEでAgentを見ながら進める方が自然です。

Anthropic自身もClaude Code on the webの説明で、探索的なTaskや頻繁なcourse correctionが必要なTaskはTerminal/IDE側が向くと区別しています。

CodexもIDE/CLIでLocal contextを使いながら進められます。

このタイプでは、

  • Diffを見ながら修正
  • Permissionを都度確認
  • Test結果を見て次の指示

のようなPair workflowが重要です。

明確なTaskを丸ごと渡したい

両方ともRemote/Cloud系のDelegation surfaceがあります。

CodexはCloud/agent app/parallel workを強く持ち、Claude Code on the webはGitHub Repo単位のisolated remote taskとPR handoffを明示しています。

ここではModel比較より、

  • Task開始がどこからできるか
  • 途中で見に行けるか
  • 並列Taskをどう管理するか
  • Local未Commit変更をどう扱うか
  • 最終Reviewがどこに戻るか

を見る方が役に立ちます。

PermissionとSandboxは「どちらもある」で終わらせない

ここは実装が違います。

Codex

現在のOpenAI資料では、CodexのLocal/Cloud agentはSandboxとApproval policyを組み合わせてControlする設計が説明されています。

Workspace外WriteやNetworkなど、Sandbox boundaryを越えるActionはApproval対象にでき、Rulesで扱いを調整できます。

Codex app/CLI側では、Defaultで作業Folder/BranchにWriteを限定し、Network等のElevated actionでPermissionを求める考え方が明示されています。

Claude Code

Claude CodeはPermission modeを明示的に持ちます。

現在のHelpでは、

  • default
  • acceptEdits
  • plan
  • auto

のようなmodeと、allow / ask / deny rulesが案内されています。

Localでは/sandboxによるSandbox runtimeも現在案内されていますが、これはCodexのdefault sandboxと同じ意味で「両方Sandboxあり」と丸めない方がいい。

Web版Claude Codeは別にisolated VMとNetwork controlを持ちます。

LocalとRemoteでControl modelを分けて見る必要があります。

SubagentとMulti-agentは似ているが同じ言葉ではない

Claude CodeはSubagentを明示的なPrimitiveとして持ちます。

Agentごとに、Tool、Permission、Model、Contextを分けてTaskを任せられるCurrent documentationがあります。

Codexは複数AgentをThread/WorktreeでParallelに動かすWorkflowを強く持っています。

見た目は近い部分があります。

でもここで、

Codex subagent = Claude Code subagent

と勝手に同じFeature扱いはしません。

比較するのは、自分が複数Task/役割をどう分割したいかです。

Browser / Webも同じCheck boxではない

現在のCodex app資料ではIn-app Browserが案内されています。

CLI/IDEでもWeb searchやMCPなど、設定したTool/Network boundaryによってWeb系Capabilityが変わります。

Claude CodeはMCPによってExternal toolをつなげられます。

ただし、このP06で「Claude CodeにもCodex appと同じNative browserがある」とは確認できていません。

そのため比較表では、単純なYes/Noを避けます。

Browser validationが自分のTaskの必須条件なら、公開前確認時点の実際のSurfaceをもう一度確認します。

Reviewの形

Codex

Codex app/IDEでは変更Diffを確認し、Thread内でCommentしたりEditorへ戻して手動修正したりするFlowが現在説明されています。

Worktreeで並列TaskをLocal stateから分離できる点も、Review/mergeのやり方に関係します。

Claude Code

Localでは/diff、Checkpoint/Rewind、Permission modeがあります。

WebではBranch/PRへ戻すFlowが明確です。

どちらが優れているかではなく、

自分がReviewする場所がTerminal/Editorなのか、PRなのか、Agent command centerなのか

を見る。

Economicsは月額だけで比較しない

Codex

現在のOpenAI Helpでは、CodexはFree / ChatGPT Goを含むChatGPT各プランに含まれ、利用上限はPlanごとに異なると案内されています。

一部のPlus / Proユーザーでは、上限到達後にCreditsを追加して継続できる場合があります。Flexible usage対象のCodex rate cardはToken usage基準です。

Claude Code

現在のAnthropic pricing/helpではClaude CodeはPaid plansに含まれ、Claude本体とUsage poolを共有するPlanがあります。

Usage credits/bundlesやAPI key/Cloud provider経由のPay-as-you-go pathもあります。

ここで大事なのは、

月額が同じかではなく、自分のCoding量でどのUsage modelに当たるか

です。

AgentはTaskの長さ、Context、Model、Tool useで消費が変わるので、固定の「何Messageで何円」だけでは判断しにくい。

Workflow別の結論

Codexを強く検討しやすい

  • ChatGPT account内でCoding Agentを他のWork surfaceと一緒に使いたい
  • Desktop command-centerで複数Agent/Projectを監督したい
  • Worktreeを使ったParallel delegationが重要
  • IDE/CLI/Cloudを同じCodex系Surfaceで行き来したい
  • CodexのCurrent sandbox/approval modelが自分のControl要件に合う

これはDocumentationから見えるFitです。

「コード品質が上だから」ではありません。

Claude Codeを強く検討しやすい

  • Terminal-centricなRepo/Shell/Git workflowを中心にしたい
  • Permission modeやCLAUDE.md/settingsを細かくProjectに固定したい
  • Subagentを役割/Tool/Model単位で構成したい
  • Local synchronous workとWeb asynchronous GitHub taskを使い分けたい
  • Claude subscription/API/cloud-provider pathが自分の運用に合う

これもWorkflow Fitです。

Combine

すでに両方のSubscription/Usageを正当化できるなら、Task種類で使い分けることはできます。

ただし、

「難しいTaskは両方に投げて勝った方を採用」

を常時Workflowにすると、CostとReview量も2倍に近づきます。

Complementがある場合だけ。

Keep current

今のAgentで、

  • Taskが終わる
  • Reviewできる
  • Permissionが許容
  • Costが許容

なら、Switchしないのも正解です。

Model差はどう扱う?

重要です。

でも、このP06でHarness差とModel差を混ぜた「体感Winner」は作りません。

P07の整理どおり、結果はModel、Harness、Context、Environment、ReviewのInteractionです。

需要が出たらLevel Bで、同じRepo / 同じTask / 同じEnvironmentを可能な限り揃えて比較します。

今はやっていません。

結論

Codex vs Claude Codeで最初に比べるのはModel名ではありません。

Codex

multi-surface / command-center / parallel-agent / ChatGPT-connected coding workflowが自分のDelegationに合うか。

Claude Code

terminal-centric control / explicit permissions / subagents / web async GitHub taskが自分の開発スタイルに合うか。

どちらも現在、Localに一緒にPairするだけのToolではなく、Remote/Background/Parallelへ広がっています。

だからこそ、Winnerを一行で決めるより、

どこでTaskを渡し、どこでControlし、どこでReviewを受け取るか

を決める方が長持ちします。

Current is doing more work in this comparison than either agent.

What would change our mind?

  • Surface統合や廃止
  • Sandbox/permission defaultの変更
  • Browser/MCP/Subagent/multi-agent機能の変更
  • Background/parallel workflowの変更
  • Model availabilityの大幅変更
  • Included plan / credits / usage modelの変更
  • Level B testで一方が特定Task classに一貫した優位を示す

Dated change log

2026-08-23 JST — Draft baseline

Level A public documentation only. 公開前確認前に全volatile FACTを再確認する。

2026-08-23 JST — Launch-window FACT refresh

CodexのFree / Goを含む現行Plan accessとPlan別usage limitへ更新。Static model matrixは追加しない。

Next

まだ調べますか?