Skip to main content
Glama

cold-run

私は47種類のエージェントスキルをテストし、23個を削除した。そのうち3つが Claude のコードを悪くしていた。

そして、それを実行するツールを構築し、24個の生き残ったスキル群に向けて実行したところ、最初の5個のうち3個が NEGATIVE と判定された。

これはバグではない。私が見つけた最も興味深い事実であり、あなたがそれを見つけるのを待つことなく公開している: runs/bare-baseline/。

npx cold-run

発見

何もしないスキルは退屈な失敗にすぎない。よくある失敗はもっと質が悪い:

スキルはエージェントの注意力を消費する。 特定のチェックを買い求め、その代価は、タスクが本来必要とする他のすべてから支払われる。

キャッシュ付きルックアップを構築するよう求められて、amplification-check に従ったエージェントはジッタと single-flight を追加した——まさにスキルが要求しているものである。そのスキルを一度も見ていないエージェントは、それら に加えて LRU 上限、stale-while-revalidate、ネガティブキャッシュを追加していた。スキル版のキャッシュは無制限に肥大していく。

Lambda 内にリトライを追加するよう求められたときは、スキル版エージェントはきちんと整理されたリトライ予算テーブルと、確定の404をタイムアウトと同等に熱心にリトライする、総なめの except を生成した。

スキルを読んだだけでは、これは見えない。両方のスキルはどちらもよく書かれているからだ。タスクを2回実行して、生成物を差分比較してこそ見える。


Related MCP server: tar-engine

何をするか

スキルを探し出し、それぞれに敵対するテストタスクを選び、cold(スキルなし)と skilled(スキルあり)のペアを並列実行し、どのスキルが何も変えないか笑る。

cold-run v0.1  —  30 skills in ~/.claude/skills

  REAL      retry-guard                added a breaker + cap; cold declined one
  NONE      be-thorough                cold output was identical
  NONE      check-edge-cases           cold found two more edge cases
  NEGATIVE  refactor-first             skilled dropped a null check cold kept
  ...

  11 change nothing.
   2 make the output worse.
  17 earn their place.

  Deleting the 13 frees ~7,400 tokens of always-loaded
  context, every session.

  full report      -> cold-run-report.md
  every transcript -> .cold-run/

何も削除しない。レポートとすべてのトランスクリプトを書き出し、(消すかいなかの) 判断は自分の手にある。

コストは実際に発生し、まず許可を求めてくる。 スキルごとにモデルが4回呼び出される。12を超えるスキルライブラリでは5本に分散したテストを行うので、初回の実行は安く済む。--all で残りをすべて実行する。

npx cold-run                    # auto-finds your skills
npx cold-run path/to/skills     # or point it somewhere
npx cold-run --all --yes        # everything, no prompt

ローカルに claude CLI があればそれを経由し、なければ ANTHROPIC_API_KEY を利用して走る。依存ゼロ——npx で即座に起動。

MCP サーバーとして

同じ監査を、すでに使っているエージェントからのルートで実行できる——Claude Code、Claude Desktop、Cursor など。エージェント自身のサブエージェントを使うため、API キーの追加も、隠れた費用もない。

claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp
{
  "mcpServers": {
    "cold-run": {
      "command": "npx",
      "args": ["-y", "--package=cold-run", "cold-run-mcp"]
    }
  }
}

あとは聞くだけ:「私のスキルの中で、実際に役に立っているのはどれか?」

五つの判定

REAL

生成物が実質的に異なり、スキルありの実行のほうが優れている。

MARGINAL

コールド実行がすでに正しく出した出力に、小さな実質的追加が加わっている。

NONE

区別がつかない——または、スキルありの実行が原則について 語った だけ。語ることは変えることではない。

NEGATIVE

コールド実行の出力のほうが良かった。珍しくない。私の47個のうち3個がこれに該当した。

INVALID

片方の実行が一切生成物を生まなかったため、ペアは無効。報告はされても数えられない。実際に起きなかった実行からの判定は、判定がないことより悪い。

生き残った24個と、その注記(アスタリスク)

このツールを生み出したスキルライブラリは skills/ にあります。それぞれの裏には、記録された cold/skilled のペアがあります—— EVIDENCE.md と runs/ledger.md をご覧ください。

インストールする前に読んでください。 その監査は、私のマシンのグローバル運用規約(立ち止まって確認する動作と、固定された報告形式を強制する環境ルール)のもとで両エージェントを実行しました。cold-run は意図的にそれをすべてを取り除いています。ひな基盤のもとでは、最初の5個のうち3個がNEGATIVEと評価されました。どちらの結果も、トランスクリプを含めて完全公開されています: runs/bare-baseline/。

どちらの数字が当たるかは、あなた自身の CLAUDE.md がすでに強制している内容次第です。どちらもひな基盤ではフルスケールで実行されておらず、その矛盾は隠すより公開します。選に残れなかった23個は、なぜどれも修繕不可能だったかもふくめて runs/dropped.md にあります。

残ったスキルのいくつかを、ハードルの判断材料として挙げます:

  • yagni-audit —「レートリミッターを実装する」に対して、コールドは約700行——同期、非同期、キー付き、Redis、Lua、デコレータ——を書いた。スキルありは15行だった。

  • trust-source-check — コールドは共有のスタティックな env-var トークンでサービスを認証した。スキルありは、JWKS で検証済みの OIDC トークンとオーディエンスの固定を要求した。

  • reverse-path-proof — スキルありは実際の Postgres コンテナを実行し、255文字のネームでロールバックが 中断 し、テーブル内の全名前を消すことを突き止めた。コールドには同じバグがあった。

  • pit-of-success — コールドはデフォルトですぐに完全削除を出荷した。スキルありは30日間復元を可能にし、ユーザーIDを表示する確認の背後に purge を置いた。

普通の方法でインストールしても、しなくてもよい。主役はツールである。

スキルの評価はここでは2つの関門としている

  1. コールドとの差分 — それで生成物は変わるか? 23個のスキルがここで不合格になった。 → EVIDENCE.md

  2. ルーティング — 説明文が実際にスキルを 読み込ませる か? 説明文が一発も発動しないスキルは、トークンだけを消費して重量を残す。360件の書き込みリクエストを対象とする分類器としてテストされ、全24個が通過するまでに2ラウンド失敗があった。 → tests/router

一方を通過しても他方で不合格になるスキルは、やはり不調です。

skill-doctor と比較

skill-doctor は リンター であり、スキルを読み、frontmatter の妥当性や壊れたリソースリンクを検査し、トリガー説明が 弱そう とも分かるかを見て、0-100でスコアを付ける。決して実行はしません。

cold-run はもう半分です。スキルと、そのスキルを見ないエージェントとを同じタスク上で実行し、出力を比較する。

skill-doctor

cold-run

スキルを読む

はい

はい

スキルを実行する

いいえ

はい

壊れたリンクや不正なfrontmatterを検出する

はい

いいえ

構造は正しいのに何も変えないスキルを検出する

いいえ

はい

スキルは構造という点で100/100をとっても、何もしない( no-op )のままということがあります。このツールはちょうどそのシナリオを捉えます。しかもよくある形です——47個中23個は構造的に完璧でした。

両方走らせてください。それぞれ、異なる種類の失敗を浴います。

先行する実践

obra/superpowers はワークフローの層(ブレインストーミング→計画→実行→検証)であり、これとは重なりはなし。ここにワークフロースキルはゼロ、むこうにドメインチェクはゼロだ。writing-skills は、このツールが自動化しているのと同じサブエージェントテストを促していて、これは完全に一致します。

ライセンス

MIT。

Related MCP Connectors

Related MCP Servers

  • A
    license
    Not graded
    quality
    B
    maintenance
    Audits AI agent skills for safety using static, semantic, adversarial, and supply-chain analysis, providing scores and risk flags. Can be run via CLI, CI, or as an MCP tool from Claude Code, Cursor, and Codex.
    16 PyPI
    2
    Apache 2.0
  • A
    license
    Not graded
    quality
    A
    maintenance
    Enables deterministic auditing of agent skills, system prompts, and downloaded file collections against eight malicious-skill supply-chain patterns, returning line-numbered findings and pass/flag verdicts without using an LLM or network calls.
    MIT
  • A
    license
    Not graded
    quality
    C
    maintenance
    Enables authorized security auditing of AI-agent supply chains and agent-facing surfaces: deterministic local skill-bundle audits against eight attack patterns, secrets scanning, and scope-gated read-only recon of agent endpoints and MCP surfaces.
    MIT