Skip to main content
Glama

cold-run

Ich habe 47 Agent-Skills getestet. Ich habe 23 davon gelöscht. Drei von ihnen machten Claudes Code schlechter.

Dann habe ich das Werkzeug gebaut, das genau das tut, es auf die 24 Überlebenden angesetzt – und es bewertete drei der ersten fünf als NEGATIV.

Das ist kein Bug. Es ist das Interessanteste, was ich gefunden habe, und ich veröffentliche es, statt zu warten, dass du es findest: runs/bare-baseline/.

npx cold-run

Der Befund

Ein Skill, der nichts tut, ist der langweilige Fehler. Der häufige ist schlimmer:

Ein Skill verbraucht die Aufmerksamkeit des Agenten. Er kauft eine bestimmte Prüfung und bezahlt diese Prüfung aus allem anderen, was die Aufgabe benötigt.

Aufgefordert, einen gecachten Lookup zu bauen, ergänzte der Agent mit amplification-check Jitter und Single-Flight – genau das, was der Skill verlangt. Der Agent, der den Skill nie gesehen hatte, ergänzte diese und ein LRU-Limit, Stale-While-Revalidate und Negativ-Caching. Der Cache der Skill-Variante wächst unbegrenzt.

Aufgefordert, Retries innerhalb einer Lambda zu ergänzen, lieferte der Skill-Agent eine saubere Retry-Budget-Tabelle und ein pauschales except, das ein eindeutiges 404 genauso hartnäckig wiederholt wie einen Timeout.

Das siehst du nicht, wenn du einen Skill liest. Diese beiden Skills sind gut geschrieben. Du siehst es nur, wenn du die Aufgabe zweimal ausführst und die Artefakte diffst.


Was es tut

Findet deine Skills, wählt für jeden eine adversarial gewählte Testaufgabe aus, lässt ein Kaltlauf-/Skilllauf-Paar parallel laufen und zeigt dir, welche deiner Skills nichts verändern.

cold-run v0.1  —  30 skills in ~/.claude/skills

  REAL      retry-guard                added a breaker + cap; cold declined one
  NONE      be-thorough                cold output was identical
  NONE      check-edge-cases           cold found two more edge cases
  NEGATIVE  refactor-first             skilled dropped a null check cold kept
  ...

  11 change nothing.
   2 make the output worse.
  17 earn their place.

  Deleting the 13 frees ~7,400 tokens of always-loaded
  context, every session.

  full report      -> cold-run-report.md
  every transcript -> .cold-run/

Es löscht nie etwas. Es schreibt den Bericht samt Transkript und die Entscheidung liegt bei dir.

Die Kosten sind real, und es fragt zuerst. Vier Modellaufrufe pro Skill. Bei einer Bibliothek mit über zwölf Skills testet es eine Streuung von fünf, damit dein erster Lauf günstig bleibt; --all übernimmt den Rest.

npx cold-run                    # auto-finds your skills
npx cold-run path/to/skills     # or point it somewhere
npx cold-run --all --yes        # everything, no prompt

Läuft über dein lokales claude CLI, falls vorhanden, sonst über ANTHROPIC_API_KEY. Keine Abhängigkeiten – npx startet sofort.

Als MCP-Server

Dasselbe Audit, angetrieben von der Agent, mit dem du schon jetzt sprichst – Claude Code, Claude Desktop, Cursor. Es verwendet die eigenen Subagenten deines Agenten: kein zweiter API-Key, keine versteckten Kosten.

claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp
{
  "mcpServers": {
    "cold-run": {
      "command": "npx",
      "args": ["-y", "--package=cold-run", "cold-run-mcp"]
    }
  }
}

Frag dann einfach: „Welche meiner Skills bewirken eigentlich etwas?"

Die fünf Urteile

REAL

Das Artefakt unterscheidet sich substanziell, und der Skill-Lauf ist besser.

MARGINAL

Eine kleine echte Ergänzung zu einem Ergebnis, das der Kaltlauf bereits richtig hatte.

NONE

Nicht zu unterscheiden – oder der Skill-Lauf hat das Prinzip nur erwähnt. Erwähnen ist kein Verändern.

NEGATIVE

Die Kaltlauf-Ausgabe war besser. Das ist nicht selten. Drei von meinen 47 landeten hier.

INVALID

Eine Seite hat nie ein Artefakt erzeugt, also ist das Paar ungültig. Gemeldet, nie gewertet. Ein Urteil über einen Lauf, zu dem es nicht gab kommt schlechter als kein Urteil.

Die 24, die überlebten – und das Sternlein darauf

Diese Skill-Bibliothek, aus der dieses Werkzeug hervorgegangen ist, liegt in skills/. Hinter jeden Skill liegt ein aufgezeichnetes Kalt-/Skill-Paar – siehe EVIDENCE.md und runs/ledger.md.

Lies das, bevor du sie installierst. Dieses Audit hat beide Agenten unter den globalen Betriebsverträgen meiner Maschine laufen lassen – Hausregeln, die Stopp-und-Nachfragen und ein festes Berichtsformat erzwingen. cold-run entfernt all das absichtlich. Unter der Bare-Baseline wurden Drei der ersten fünf Überlebenden mit NEGATIVE bewertet. Beide Ergebnisse sind vollständig samt Transkripten veröffentlicht: runs/bare-baseline/.

Welche Zahl von beiden Auf dich zufällt, hängt davon ab, was deine eigene CLAUDE.md bereits erzwingt. Keine wurde beim Volumenumfang unter der Bare-Baseline gelaufen. Ich verschleiere den Widerspruch nicht, sonder ich verschicke ihn. Verstanden.

Die 23, die es nicht schafften, und warum sich keiner reparieren ließ, stehen in runs/dropped.md.

Einige der Überlebenden, damit dir die Messlatte beurteilen kannst:

  • yagni-audit – „Implementiere einen Rate Limiter.“ Kaltlauf schrieb ~700 Zeilen: synch, asynchron, mit Schlüssel, Redis, Lua, Decorators. Skill-Lauf schrieb 15.

  • trust-source-check – Kaltlauf Authentisierung Dienste mit einem gemeinsamen statischen Env-Var-Token. Skill-Lauf verlangte ein JWKS-verifiziertes OIDC-Token mit Audience-Pinning.

  • reverse-path-proof – Skill-Lauf startete einen echten Postgres-Container und fand heraus, dass das Rollback bei einem 255-Zeichen-Namen abbricht und damit jeden Namen in der Tabelle löscht. Der Kaltlauf hatte denselben Bug.

  • pit-of-success – Kaltlauf lieferte sofortiges hartes Löschen als Standard. Skill-Lauf machte es 30 Tage umkehrbar und verhängte der endgültigen Löschung eine Bestätigung,die dei Benutzer-ID anzeigt.

Installier sie auf dem üblichen Weg – oder nicht. Das Werkzeug ist der Punkt.

Skills werden hier an zwei Schwellen gemessen, nicht an einer

  1. Cold-run-Delta – verändert es das Artefakt? 23 Skills sind daran gescheitert. → EVIDENCE.md

  2. Routing – führt die Beschreibung den Skill wirklich geladen? Ein perfekter Skill mit einer nie feuernde Beschreibung is Ballast, who only costs Tokens. Verglichen als Klassifikator mit gegen 360 geschriebenen Anfragen; zwei Runden scheiterten, bevor alle 24 bestanden. → tests/router/

Ein Skill, der eine Schwelle überspringtbut genau an der anderen erfasst, ist weiterhin kaputt.

vs. skill-doctor

skill-doctor ist ein Linter. Er liest deine Skills und prüft Frontmatter-Gültigkeit, defekte Resource-Links und ob eine genaue Trigger-Beschreibung schwache wirkt, und bewertet dann 0–100. Es führt niemals etwas aus.

cold-run ist die andere Hälfte. Es führt den Skill und einen nicht Skill-kundigen Agenten mit derselben Aufgabe aus, und vergleicht die Artefakte.

skill-doctor

cold-run

Liest deine Skills

ja

ja

Führt sie aus

nein

ja

Erkennt einen defekten Link bzw. schlecht Frontmatter

ja

nein

Erkennt einen wohlgeformter Skill, der nichts verändert

nein

ja

Ein Skill kann strukturell 100/100 erreichen und trotzdem ein No-op sein. Genau Parallel dazu ist der Fehler yap, dieser entdeckt – und es ist die häufige: 23 von meinen 47 waren strukturell perfekt.

Führe beide aus. Sie schlagen an andere Stellen fehl.

Vorher vorhanden

obra/superpowers ist die Workflow-Schicht: Brainstorm, Plan, Execute, Verify. Es gibt keine Überdeckung mit diesem Werkzeug: Hier '''zero-Workflow-Skills''', dort keine Domän-Checks. Dessen writing-skills schreibt den gleichen Subagenten-Test vor, den dieses Werkzeug automatisiert.

Lizenz

MIT.

-
license - not tested
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Verifies AI agent work end to end: real artifacts and outcomes checked, not self-reported success.

  • Deterministic AI code review, with an audit record. Governance inside the agent loop.

  • Git-backed platform for skills, tools, and context for AI agents

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/sina-heidariaan/cold-run'

If you have feedback or need assistance with the MCP directory API, please join our Discord server