AI(または自分)が出した主張を、別のモデルに反証させるための小さなスクリプトです。
Codex CLI の codex exec を1回呼ぶだけの bash です。
A tiny bash script that asks a different model (via Codex CLI) to try to refute a claim, instead of agreeing with it.
AI エージェントの「直しました」「効果が出ました」は、間違っていても自然な文章に読めます。
実例:「p95 が 124.3 → 193.0 に上がり、手本の 165.2 を超えた」という報告は、 「1コマの中の画素の95%点」と「コマごとの平均輝度の95%点」という別の統計量を比べていました。 作業していた側は2時間気づかず、同じ主張を Codex に渡すと約1.4万トークンで 「統計量も母集団も違う」と指摘されました。効いたのは賢さの差ではなく、独立していることだと考えています。
- bash
- Codex CLI(
codex execが使える状態)
./crosscheck.sh claim.md # 背景で実行し、ログのパスを返す
./crosscheck.sh -w claim.md # 終わるまで待つ
echo "..." | ./crosscheck.sh - # 標準入力から| 環境変数 | 既定値 | 内容 |
|---|---|---|
CROSSCHECK_MODEL |
gpt-6-astra |
codex exec -m に渡すモデル名 |
CROSSCHECK_DIR |
/tmp |
ログの出力先 |
査読の観点は次の4つです。返答は「成立します」の1行か、誤りの箇所を3行以内です。
- 比べている2つの数字は、同じ定義・同じ母集団・同じ手順で測られているか
- 標本の数は結論に足りているか(n=1 で一般化していないか)
- 根拠から出てこない飛躍はないか
- 測っていないのに測ったことにしている箇所はないか
- 要約ではなく、根拠にした測定の手順そのもの(コード片・実際の数字)を入れる。 要約だけだと、要約した時点で混ざった誤りごと追認されます。
- 問いは「成立しますか。成立しないならどこが誤りか」の形にする。
- 返答まで2分ほどかかることがあります。
- 事実の真偽(最新情報など)は、モデルが知らなければ判定できません。
- 反証が返らないことは、正しさの証明ではありません。
- 上の実例は1件です。どの場面でも同じように効くとは限りません。
MIT