【技術編】Claude CodeからCodexを動かす——セットアップ手順と、ハマりどころ3つ

技術ネタ

こんにちは、ノンズ株式会社 代表の野々下です。前職まではRailsエンジニアでした。

本編の記事では「AIにAIを任せたら、必要なのはマネジメントだった」という話を書きました。こちらはその技術編です。実際に動かしたコマンドと、ドキュメントに書いていないハマりどころを共有します。

構成: Claude Codeが監督、Codexが実働

  • Claude Code(Anthropic): 普段のメイン環境。今回は「上司役」として、Codexへの指示・検収を担当
  • Codex CLI(OpenAI): 「部下役」。レビュー・画像生成などの実働を担当
  • 連携方法は2つ: OpenAI公式のClaude Codeプラグイン(/codex:review 等)と、codex exec の直接呼び出し。検証には後者が向いています(挙動が見える)

セットアップ(約15分)

# 1. Codex CLIのインストール
npm install -g @openai/codex
codex login   # ChatGPTアカウントでOK。既にVS Code拡張を使っていれば ~/.codex の認証が流用される

# 2. Claude Code側に公式プラグインを導入
claude plugin marketplace add openai/codex-plugin-cc
claude plugin install codex@openai-codex
# → Claude Code再起動後に /codex:review /codex:status /codex:result が使える

参考にしたセットアップ記事: Claude CodeからCodexを連携させるセットアップガイド(@mix_dvd さん)

基本形: codex exec(非対話モード)

Claude Codeから(あるいはシェルから)Codexに仕事を振る基本形はこれです。

codex exec --sandbox read-only --skip-git-repo-check "指示文" < /dev/null
  • --sandbox read-only: レビュー等の読み取り作業はこれで固定。書き込みが要る仕事だけ workspace-write
  • --skip-git-repo-check: gitリポジトリ外の作業ディレクトリで実行する場合に必要
  • < /dev/null: 超重要(後述のハマりどころ①)

ハマりどころ3つ

① stdinを閉じないと、黙って無限に待つ

codex exec は標準入力がパイプにつながっていると「まだ指示が続く」と判断して待ち続けます。バックグラウンド実行やスクリプト経由で呼ぶと、エラーも出さずに止まったままになります(実測: 30分無反応・API未到達なのでトークン消費もゼロ)。< /dev/null で標準入力を明示的に閉じるのが対策です。

② シークレット入りファイルをそのまま渡さない

レビュー対象のコードにAPIキーやトークンが埋まっている場合、外部AIにそのまま渡すのは避けるべきです。当社ではマスク済みコピーを作ってから渡しています。

sed -E 's/[A-Za-z0-9_-]{32,}/<REDACTED_TOKEN>/g' Code.gs > /tmp/review/Code.gs

副作用がひとつ: ディレクトリ構成ごとコピーしないと、レビューAIが「設定ファイルのパスが一致しない」等の環境起因の誤検知を返します(実際に10件中2件がこれでした)。マスクはしても配置は本物に合わせるのがコツです。

③ 検収なしで受け取らない

Codexのレビュー指摘10件のうち、正当だったのは8件。精度としては十分実用ですが、逆に言えば2件は環境起因の誤検知でした。指摘を鵜呑みにして修正を始める前に、1件ずつ検証する工程(うちではClaude Codeが担当)を挟む前提で運用すべきです。

実測値(2026年7月末時点・gpt-5.5 / reasoning: xhigh)

タスク 所要 トークン 結果
コードレビュー(GAS+Python 159行) 約4分 24.7k 指摘10件・うち8件正当。実装者(Claude)が見落とした競合状態を検出
イラスト生成(挿絵1枚) 約2分 42.7k 指示どおり・そのまま使用
サムネイル生成(1200×630・日本語テキスト指定) 約2分 日本語を一字も崩さず描画。この記事のサムネイルがそれです

画像生成は codex features listimage_generation がstableになっていれば追加設定なしで使えます。日本語テキストが正確に入るのは正直驚きました。

運用の型: 委任トライアルログ

どの仕事をCodexに振るかは、試行のたびに採点表(◎○△✕)へ記録して決めています。

作業タイプ 評価 一言
別系統AIによるクロスレビュー 実装した本人の盲点を突く。ダブルチェックの別担当者と同じ効果
画像の量産(挿絵・サムネ) ◎〜○ 一発ものは強い。ブランド統制が要るものは人間側で設計
(検証中)テスト生成・翻訳ほか 積み上げ中

ポイントは「AとBどちらが優秀か」を決めることではなく、得意分野マップを組織図のように育てることです。

まとめ

  • 連携自体は15分で終わる。難しさはセットアップではなく運用側にある
  • < /dev/null・シークレットマスク・検収工程、の3点を最初から仕込んでおくと事故らない
  • 精度は「10件中8件正当」レベル。使えるが、検収前提で

自社の開発フローにも、この仕組みを組み込めます

ノンズ株式会社では、こうした自社検証をもとに中小企業向けのAI導入支援を行っています。「うちの開発フローにも組み込めるか」といったご相談は、30分の無料オンライン相談でどうぞ。

サービスの詳細を見る

top
entry

Entry

エントリーはこちら

今と未来の想定年収がわかる 年収シミュレーター