cold-run
cold-run
私は47種類のエージェントスキルをテストし、23個を削除した。そのうち3つが Claude のコードを悪くしていた。
そして、それを実行するツールを構築し、24個の生き残ったスキル群に向けて実行したところ、最初の5個のうち3個が NEGATIVE と判定された。
これはバグではない。私が見つけた最も興味深い事実であり、あなたがそれを見つけるのを待つことなく公開している: runs/bare-baseline/。
npx cold-run発見
何もしないスキルは退屈な失敗にすぎない。よくある失敗はもっと質が悪い:
スキルはエージェントの注意力を消費する。 特定のチェックを買い求め、その代価は、タスクが本来必要とする他のすべてから支払われる。
キャッシュ付きルックアップを構築するよう求められて、amplification-check に従ったエージェントはジッタと single-flight を追加した——まさにスキルが要求しているものである。そのスキルを一度も見ていないエージェントは、それら に加えて LRU 上限、stale-while-revalidate、ネガティブキャッシュを追加していた。スキル版のキャッシュは無制限に肥大していく。
Lambda 内にリトライを追加するよう求められたときは、スキル版エージェントはきちんと整理されたリトライ予算テーブルと、確定の404をタイムアウトと同等に熱心にリトライする、総なめの except を生成した。
スキルを読んだだけでは、これは見えない。両方のスキルはどちらもよく書かれているからだ。タスクを2回実行して、生成物を差分比較してこそ見える。
Related MCP server: tar-engine
何をするか
スキルを探し出し、それぞれに敵対するテストタスクを選び、cold(スキルなし)と skilled(スキルあり)のペアを並列実行し、どのスキルが何も変えないか笑る。
cold-run v0.1 — 30 skills in ~/.claude/skills
REAL retry-guard added a breaker + cap; cold declined one
NONE be-thorough cold output was identical
NONE check-edge-cases cold found two more edge cases
NEGATIVE refactor-first skilled dropped a null check cold kept
...
11 change nothing.
2 make the output worse.
17 earn their place.
Deleting the 13 frees ~7,400 tokens of always-loaded
context, every session.
full report -> cold-run-report.md
every transcript -> .cold-run/何も削除しない。レポートとすべてのトランスクリプトを書き出し、(消すかいなかの) 判断は自分の手にある。
コストは実際に発生し、まず許可を求めてくる。 スキルごとにモデルが4回呼び出される。12を超えるスキルライブラリでは5本に分散したテストを行うので、初回の実行は安く済む。--all で残りをすべて実行する。
npx cold-run # auto-finds your skills
npx cold-run path/to/skills # or point it somewhere
npx cold-run --all --yes # everything, no promptローカルに claude CLI があればそれを経由し、なければ ANTHROPIC_API_KEY を利用して走る。依存ゼロ——npx で即座に起動。
MCP サーバーとして
同じ監査を、すでに使っているエージェントからのルートで実行できる——Claude Code、Claude Desktop、Cursor など。エージェント自身のサブエージェントを使うため、API キーの追加も、隠れた費用もない。
claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp{
"mcpServers": {
"cold-run": {
"command": "npx",
"args": ["-y", "--package=cold-run", "cold-run-mcp"]
}
}
}あとは聞くだけ:「私のスキルの中で、実際に役に立っているのはどれか?」
五つの判定
REAL | 生成物が実質的に異なり、スキルありの実行のほうが優れている。 |
MARGINAL | コールド実行がすでに正しく出した出力に、小さな実質的追加が加わっている。 |
NONE | 区別がつかない——または、スキルありの実行が原則について 語った だけ。語ることは変えることではない。 |
NEGATIVE | コールド実行の出力のほうが良かった。珍しくない。私の47個のうち3個がこれに該当した。 |
INVALID | 片方の実行が一切生成物を生まなかったため、ペアは無効。報告はされても数えられない。実際に起きなかった実行からの判定は、判定がないことより悪い。 |
生き残った24個と、その注記(アスタリスク)
このツールを生み出したスキルライブラリは skills/ にあります。それぞれの裏には、記録された cold/skilled のペアがあります—— EVIDENCE.md と runs/ledger.md をご覧ください。
インストールする前に読んでください。 その監査は、私のマシンのグローバル運用規約(立ち止まって確認する動作と、固定された報告形式を強制する環境ルール)のもとで両エージェントを実行しました。cold-run は意図的にそれをすべてを取り除いています。ひな基盤のもとでは、最初の5個のうち3個がNEGATIVEと評価されました。どちらの結果も、トランスクリプを含めて完全公開されています: runs/bare-baseline/。
どちらの数字が当たるかは、あなた自身の CLAUDE.md がすでに強制している内容次第です。どちらもひな基盤ではフルスケールで実行されておらず、その矛盾は隠すより公開します。選に残れなかった23個は、なぜどれも修繕不可能だったかもふくめて runs/dropped.md にあります。
残ったスキルのいくつかを、ハードルの判断材料として挙げます:
yagni-audit—「レートリミッターを実装する」に対して、コールドは約700行——同期、非同期、キー付き、Redis、Lua、デコレータ——を書いた。スキルありは15行だった。trust-source-check— コールドは共有のスタティックな env-var トークンでサービスを認証した。スキルありは、JWKS で検証済みの OIDC トークンとオーディエンスの固定を要求した。reverse-path-proof— スキルありは実際の Postgres コンテナを実行し、255文字のネームでロールバックが 中断 し、テーブル内の全名前を消すことを突き止めた。コールドには同じバグがあった。pit-of-success— コールドはデフォルトですぐに完全削除を出荷した。スキルありは30日間復元を可能にし、ユーザーIDを表示する確認の背後に purge を置いた。
普通の方法でインストールしても、しなくてもよい。主役はツールである。
スキルの評価はここでは2つの関門としている
コールドとの差分 — それで生成物は変わるか? 23個のスキルがここで不合格になった。 → EVIDENCE.md
ルーティング — 説明文が実際にスキルを 読み込ませる か? 説明文が一発も発動しないスキルは、トークンだけを消費して重量を残す。360件の書き込みリクエストを対象とする分類器としてテストされ、全24個が通過するまでに2ラウンド失敗があった。 → tests/router
一方を通過しても他方で不合格になるスキルは、やはり不調です。
skill-doctor と比較
skill-doctor は リンター であり、スキルを読み、frontmatter の妥当性や壊れたリソースリンクを検査し、トリガー説明が 弱そう とも分かるかを見て、0-100でスコアを付ける。決して実行はしません。
cold-run はもう半分です。スキルと、そのスキルを見ないエージェントとを同じタスク上で実行し、出力を比較する。
skill-doctor | cold-run | |
スキルを読む | はい | はい |
スキルを実行する | いいえ | はい |
壊れたリンクや不正なfrontmatterを検出する | はい | いいえ |
構造は正しいのに何も変えないスキルを検出する | いいえ | はい |
スキルは構造という点で100/100をとっても、何もしない( no-op )のままということがあります。このツールはちょうどそのシナリオを捉えます。しかもよくある形です——47個中23個は構造的に完璧でした。
両方走らせてください。それぞれ、異なる種類の失敗を浴います。
先行する実践
obra/superpowers はワークフローの層(ブレインストーミング→計画→実行→検証)であり、これとは重なりはなし。ここにワークフロースキルはゼロ、むこうにドメインチェクはゼロだ。writing-skills は、このツールが自動化しているのと同じサブエージェントテストを促していて、これは完全に一致します。
ライセンス
MIT。
This server cannot be deployed
Maintenance
Related MCP Connectors
Run AI agent evaluations on your own model keys, and publish runs others can review and re-run.
Verifies AI agent work end to end: real artifacts and outcomes checked, not self-reported success.
The governed runtime for agent skills. Search the catalog and inspect a skill before running it.
Psyche audits for AI agents: declared vs self-reported vs revealed objectives, diffed and flagged.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceCatch Gemini model upgrade regressions before they reach customers by running evals, comparing outputs, detecting regressions, and exporting audit receipts.MIT
- AlicenseNot gradedqualityBmaintenanceAudits AI agent skills for safety using static, semantic, adversarial, and supply-chain analysis, providing scores and risk flags. Can be run via CLI, CI, or as an MCP tool from Claude Code, Cursor, and Codex.16 PyPI2Apache 2.0
- AlicenseNot gradedqualityAmaintenanceEnables deterministic auditing of agent skills, system prompts, and downloaded file collections against eight malicious-skill supply-chain patterns, returning line-numbered findings and pass/flag verdicts without using an LLM or network calls.MIT
- AlicenseNot gradedqualityCmaintenanceEnables authorized security auditing of AI-agent supply chains and agent-facing surfaces: deterministic local skill-bundle audits against eight attack patterns, secrets scanning, and scope-gated read-only recon of agent endpoints and MCP surfaces.MIT