cold-run
cold-run
Ich habe 47 Agent-Skills getestet. Ich habe 23 davon gelöscht. Drei von ihnen machten Claudes Code schlechter.
Dann habe ich das Werkzeug gebaut, das genau das tut, es auf die 24 Überlebenden angesetzt – und es bewertete drei der ersten fünf als NEGATIV.
Das ist kein Bug. Es ist das Interessanteste, was ich gefunden habe, und ich veröffentliche es, statt zu warten, dass du es findest: runs/bare-baseline/.
npx cold-runDer Befund
Ein Skill, der nichts tut, ist der langweilige Fehler. Der häufige ist schlimmer:
Ein Skill verbraucht die Aufmerksamkeit des Agenten. Er kauft eine bestimmte Prüfung und bezahlt diese Prüfung aus allem anderen, was die Aufgabe benötigt.
Aufgefordert, einen gecachten Lookup zu bauen, ergänzte der Agent mit amplification-check Jitter und Single-Flight – genau das, was der Skill verlangt. Der Agent, der den Skill nie gesehen hatte, ergänzte diese und ein LRU-Limit, Stale-While-Revalidate und Negativ-Caching. Der Cache der Skill-Variante wächst unbegrenzt.
Aufgefordert, Retries innerhalb einer Lambda zu ergänzen, lieferte der Skill-Agent eine saubere Retry-Budget-Tabelle und ein pauschales except, das ein eindeutiges 404 genauso hartnäckig wiederholt wie einen Timeout.
Das siehst du nicht, wenn du einen Skill liest. Diese beiden Skills sind gut geschrieben. Du siehst es nur, wenn du die Aufgabe zweimal ausführst und die Artefakte diffst.
Was es tut
Findet deine Skills, wählt für jeden eine adversarial gewählte Testaufgabe aus, lässt ein Kaltlauf-/Skilllauf-Paar parallel laufen und zeigt dir, welche deiner Skills nichts verändern.
cold-run v0.1 — 30 skills in ~/.claude/skills
REAL retry-guard added a breaker + cap; cold declined one
NONE be-thorough cold output was identical
NONE check-edge-cases cold found two more edge cases
NEGATIVE refactor-first skilled dropped a null check cold kept
...
11 change nothing.
2 make the output worse.
17 earn their place.
Deleting the 13 frees ~7,400 tokens of always-loaded
context, every session.
full report -> cold-run-report.md
every transcript -> .cold-run/Es löscht nie etwas. Es schreibt den Bericht samt Transkript und die Entscheidung liegt bei dir.
Die Kosten sind real, und es fragt zuerst. Vier Modellaufrufe pro Skill. Bei einer Bibliothek mit über zwölf Skills testet es eine Streuung von fünf, damit dein erster Lauf günstig bleibt; --all übernimmt den Rest.
npx cold-run # auto-finds your skills
npx cold-run path/to/skills # or point it somewhere
npx cold-run --all --yes # everything, no promptLäuft über dein lokales claude CLI, falls vorhanden, sonst über ANTHROPIC_API_KEY.
Keine Abhängigkeiten – npx startet sofort.
Als MCP-Server
Dasselbe Audit, angetrieben von der Agent, mit dem du schon jetzt sprichst – Claude Code, Claude Desktop, Cursor. Es verwendet die eigenen Subagenten deines Agenten: kein zweiter API-Key, keine versteckten Kosten.
claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp{
"mcpServers": {
"cold-run": {
"command": "npx",
"args": ["-y", "--package=cold-run", "cold-run-mcp"]
}
}
}Frag dann einfach: „Welche meiner Skills bewirken eigentlich etwas?"
Die fünf Urteile
REAL | Das Artefakt unterscheidet sich substanziell, und der Skill-Lauf ist besser. |
MARGINAL | Eine kleine echte Ergänzung zu einem Ergebnis, das der Kaltlauf bereits richtig hatte. |
NONE | Nicht zu unterscheiden – oder der Skill-Lauf hat das Prinzip nur erwähnt. Erwähnen ist kein Verändern. |
NEGATIVE | Die Kaltlauf-Ausgabe war besser. Das ist nicht selten. Drei von meinen 47 landeten hier. |
INVALID | Eine Seite hat nie ein Artefakt erzeugt, also ist das Paar ungültig. Gemeldet, nie gewertet. Ein Urteil über einen Lauf, zu dem es nicht gab kommt schlechter als kein Urteil. |
Die 24, die überlebten – und das Sternlein darauf
Diese Skill-Bibliothek, aus der dieses Werkzeug hervorgegangen ist, liegt in skills/. Hinter jeden Skill liegt ein aufgezeichnetes Kalt-/Skill-Paar – siehe EVIDENCE.md und runs/ledger.md.
Lies das, bevor du sie installierst. Dieses Audit hat beide Agenten unter den globalen Betriebsverträgen meiner Maschine laufen lassen – Hausregeln, die Stopp-und-Nachfragen und ein festes Berichtsformat erzwingen. cold-run entfernt all das absichtlich. Unter der Bare-Baseline wurden Drei der ersten fünf Überlebenden mit NEGATIVE bewertet. Beide Ergebnisse sind vollständig samt Transkripten veröffentlicht: runs/bare-baseline/.
Welche Zahl von beiden Auf dich zufällt, hängt davon ab, was deine eigene CLAUDE.md bereits erzwingt. Keine wurde beim Volumenumfang unter der Bare-Baseline gelaufen. Ich verschleiere den Widerspruch nicht, sonder ich verschicke ihn. Verstanden.
Die 23, die es nicht schafften, und warum sich keiner reparieren ließ, stehen in runs/dropped.md.
Einige der Überlebenden, damit dir die Messlatte beurteilen kannst:
yagni-audit– „Implementiere einen Rate Limiter.“ Kaltlauf schrieb ~700 Zeilen: synch, asynchron, mit Schlüssel, Redis, Lua, Decorators. Skill-Lauf schrieb 15.trust-source-check– Kaltlauf Authentisierung Dienste mit einem gemeinsamen statischen Env-Var-Token. Skill-Lauf verlangte ein JWKS-verifiziertes OIDC-Token mit Audience-Pinning.reverse-path-proof– Skill-Lauf startete einen echten Postgres-Container und fand heraus, dass das Rollback bei einem 255-Zeichen-Namen abbricht und damit jeden Namen in der Tabelle löscht. Der Kaltlauf hatte denselben Bug.pit-of-success– Kaltlauf lieferte sofortiges hartes Löschen als Standard. Skill-Lauf machte es 30 Tage umkehrbar und verhängte der endgültigen Löschung eine Bestätigung,die dei Benutzer-ID anzeigt.
Installier sie auf dem üblichen Weg – oder nicht. Das Werkzeug ist der Punkt.
Skills werden hier an zwei Schwellen gemessen, nicht an einer
Cold-run-Delta – verändert es das Artefakt? 23 Skills sind daran gescheitert. → EVIDENCE.md
Routing – führt die Beschreibung den Skill wirklich geladen? Ein perfekter Skill mit einer nie feuernde Beschreibung is Ballast, who only costs Tokens. Verglichen als Klassifikator mit gegen 360 geschriebenen Anfragen; zwei Runden scheiterten, bevor alle 24 bestanden. → tests/router/
Ein Skill, der eine Schwelle überspringtbut genau an der anderen erfasst, ist weiterhin kaputt.
vs. skill-doctor
skill-doctor ist ein Linter. Er liest deine Skills und prüft Frontmatter-Gültigkeit, defekte Resource-Links und ob eine genaue Trigger-Beschreibung schwache wirkt, und bewertet dann 0–100. Es führt niemals etwas aus.
cold-run ist die andere Hälfte. Es führt den Skill und einen nicht Skill-kundigen Agenten mit derselben Aufgabe aus, und vergleicht die Artefakte.
skill-doctor | cold-run | |
Liest deine Skills | ja | ja |
Führt sie aus | nein | ja |
Erkennt einen defekten Link bzw. schlecht Frontmatter | ja | nein |
Erkennt einen wohlgeformter Skill, der nichts verändert | nein | ja |
Ein Skill kann strukturell 100/100 erreichen und trotzdem ein No-op sein. Genau Parallel dazu ist der Fehler yap, dieser entdeckt – und es ist die häufige: 23 von meinen 47 waren strukturell perfekt.
Führe beide aus. Sie schlagen an andere Stellen fehl.
Vorher vorhanden
obra/superpowers ist die Workflow-Schicht: Brainstorm, Plan, Execute, Verify. Es gibt keine Überdeckung mit diesem Werkzeug: Hier '''zero-Workflow-Skills''', dort keine Domän-Checks. Dessen writing-skills schreibt den gleichen Subagenten-Test vor, den dieses Werkzeug automatisiert.
Lizenz
MIT.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Connectors
Verifies AI agent work end to end: real artifacts and outcomes checked, not self-reported success.
Deterministic AI code review, with an audit record. Governance inside the agent loop.
Git-backed platform for skills, tools, and context for AI agents
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/sina-heidariaan/cold-run'
If you have feedback or need assistance with the MCP directory API, please join our Discord server