cold-run
cold-run
私は47種類のエージェントスキルをテストし、23個を削除した。そのうち3つが Claude のコードを悪くしていた。
そして、それを実行するツールを構築し、24個の生き残ったスキル群に向けて実行したところ、最初の5個のうち3個が NEGATIVE と判定された。
これはバグではない。私が見つけた最も興味深い事実であり、あなたがそれを見つけるのを待つことなく公開している: runs/bare-baseline/。
npx cold-run発見
何もしないスキルは退屈な失敗にすぎない。よくある失敗はもっと質が悪い:
スキルはエージェントの注意力を消費する。 特定のチェックを買い求め、その代価は、タスクが本来必要とする他のすべてから支払われる。
キャッシュ付きルックアップを構築するよう求められて、amplification-check に従ったエージェントはジッタと single-flight を追加した——まさにスキルが要求しているものである。そのスキルを一度も見ていないエージェントは、それら に加えて LRU 上限、stale-while-revalidate、ネガティブキャッシュを追加していた。スキル版のキャッシュは無制限に肥大していく。
Lambda 内にリトライを追加するよう求められたときは、スキル版エージェントはきちんと整理されたリトライ予算テーブルと、確定の404をタイムアウトと同等に熱心にリトライする、総なめの except を生成した。
スキルを読んだだけでは、これは見えない。両方のスキルはどちらもよく書かれているからだ。タスクを2回実行して、生成物を差分比較してこそ見える。
何をするか
スキルを探し出し、それぞれに敵対するテストタスクを選び、cold(スキルなし)と skilled(スキルあり)のペアを並列実行し、どのスキルが何も変えないか笑る。
cold-run v0.1 — 30 skills in ~/.claude/skills
REAL retry-guard added a breaker + cap; cold declined one
NONE be-thorough cold output was identical
NONE check-edge-cases cold found two more edge cases
NEGATIVE refactor-first skilled dropped a null check cold kept
...
11 change nothing.
2 make the output worse.
17 earn their place.
Deleting the 13 frees ~7,400 tokens of always-loaded
context, every session.
full report -> cold-run-report.md
every transcript -> .cold-run/何も削除しない。レポートとすべてのトランスクリプトを書き出し、(消すかいなかの) 判断は自分の手にある。
コストは実際に発生し、まず許可を求めてくる。 スキルごとにモデルが4回呼び出される。12を超えるスキルライブラリでは5本に分散したテストを行うので、初回の実行は安く済む。--all で残りをすべて実行する。
npx cold-run # auto-finds your skills
npx cold-run path/to/skills # or point it somewhere
npx cold-run --all --yes # everything, no promptローカルに claude CLI があればそれを経由し、なければ ANTHROPIC_API_KEY を利用して走る。依存ゼロ——npx で即座に起動。
MCP サーバーとして
同じ監査を、すでに使っているエージェントからのルートで実行できる——Claude Code、Claude Desktop、Cursor など。エージェント自身のサブエージェントを使うため、API キーの追加も、隠れた費用もない。
claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp{
"mcpServers": {
"cold-run": {
"command": "npx",
"args": ["-y", "--package=cold-run", "cold-run-mcp"]
}
}
}あとは聞くだけ:「私のスキルの中で、実際に役に立っているのはどれか?」
五つの判定
REAL | 生成物が実質的に異なり、スキルありの実行のほうが優れている。 |
MARGINAL | コールド実行がすでに正しく出した出力に、小さな実質的追加が加わっている。 |
NONE | 区別がつかない——または、スキルありの実行が原則について 語った だけ。語ることは変えることではない。 |
NEGATIVE | コールド実行の出力のほうが良かった。珍しくない。私の47個のうち3個がこれに該当した。 |
INVALID | 片方の実行が一切生成物を生まなかったため、ペアは無効。報告はされても数えられない。実際に起きなかった実行からの判定は、判定がないことより悪い。 |
生き残った24個と、その注記(アスタリスク)
このツールを生み出したスキルライブラリは skills/ にあります。それぞれの裏には、記録された cold/skilled のペアがあります—— EVIDENCE.md と runs/ledger.md をご覧ください。
インストールする前に読んでください。 その監査は、私のマシンのグローバル運用規約(立ち止まって確認する動作と、固定された報告形式を強制する環境ルール)のもとで両エージェントを実行しました。cold-run は意図的にそれをすべてを取り除いています。ひな基盤のもとでは、最初の5個のうち3個がNEGATIVEと評価されました。どちらの結果も、トランスクリプを含めて完全公開されています: runs/bare-baseline/。
どちらの数字が当たるかは、あなた自身の CLAUDE.md がすでに強制している内容次第です。どちらもひな基盤ではフルスケールで実行されておらず、その矛盾は隠すより公開します。選に残れなかった23個は、なぜどれも修繕不可能だったかもふくめて runs/dropped.md にあります。
残ったスキルのいくつかを、ハードルの判断材料として挙げます:
yagni-audit—「レートリミッターを実装する」に対して、コールドは約700行——同期、非同期、キー付き、Redis、Lua、デコレータ——を書いた。スキルありは15行だった。trust-source-check— コールドは共有のスタティックな env-var トークンでサービスを認証した。スキルありは、JWKS で検証済みの OIDC トークンとオーディエンスの固定を要求した。reverse-path-proof— スキルありは実際の Postgres コンテナを実行し、255文字のネームでロールバックが 中断 し、テーブル内の全名前を消すことを突き止めた。コールドには同じバグがあった。pit-of-success— コールドはデフォルトですぐに完全削除を出荷した。スキルありは30日間復元を可能にし、ユーザーIDを表示する確認の背後に purge を置いた。
普通の方法でインストールしても、しなくてもよい。主役はツールである。
スキルの評価はここでは2つの関門としている
コールドとの差分 — それで生成物は変わるか? 23個のスキルがここで不合格になった。 → EVIDENCE.md
ルーティング — 説明文が実際にスキルを 読み込ませる か? 説明文が一発も発動しないスキルは、トークンだけを消費して重量を残す。360件の書き込みリクエストを対象とする分類器としてテストされ、全24個が通過するまでに2ラウンド失敗があった。 → tests/router
一方を通過しても他方で不合格になるスキルは、やはり不調です。
skill-doctor と比較
skill-doctor は リンター であり、スキルを読み、frontmatter の妥当性や壊れたリソースリンクを検査し、トリガー説明が 弱そう とも分かるかを見て、0-100でスコアを付ける。決して実行はしません。
cold-run はもう半分です。スキルと、そのスキルを見ないエージェントとを同じタスク上で実行し、出力を比較する。
skill-doctor | cold-run | |
スキルを読む | はい | はい |
スキルを実行する | いいえ | はい |
壊れたリンクや不正なfrontmatterを検出する | はい | いいえ |
構造は正しいのに何も変えないスキルを検出する | いいえ | はい |
スキルは構造という点で100/100をとっても、何もしない( no-op )のままということがあります。このツールはちょうどそのシナリオを捉えます。しかもよくある形です——47個中23個は構造的に完璧でした。
両方走らせてください。それぞれ、異なる種類の失敗を浴います。
先行する実践
obra/superpowers はワークフローの層(ブレインストーミング→計画→実行→検証)であり、これとは重なりはなし。ここにワークフロースキルはゼロ、むこうにドメインチェクはゼロだ。writing-skills は、このツールが自動化しているのと同じサブエージェントテストを促していて、これは完全に一致します。
ライセンス
MIT。
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Connectors
Verifies AI agent work end to end: real artifacts and outcomes checked, not self-reported success.
Deterministic AI code review, with an audit record. Governance inside the agent loop.
Git-backed platform for skills, tools, and context for AI agents
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/sina-heidariaan/cold-run'
If you have feedback or need assistance with the MCP directory API, please join our Discord server