Skip to main content
Glama

cold-run

Probé 47 habilidades de agente. Eliminé 23 de ellas. Tres estaban empeorando el código de Claude.

Luego construí la herramienta que hace eso, la apunté a las 24 supervivientes y calificó tres de las primeras cinco como NEGATIVE.

Eso no es un error. Es lo más interesante que he encontrado, y lo publico en lugar de esperar a que lo encuentres tú: runs/bare-baseline/.

npx cold-run

El hallazgo

Que una habilidad no haga nada es el fallo aburrido. El común es peor:

La habilidad gasta la atención del magento. Compra una comprobación concreta y la paga con todo lo demás que la tarea necesitaba.

Ante la petición de construir una caché de búsqueda, el agente que seguía amplification-check añadió jitter y single-flight, exactamente lo que la habilidad pide. El agente que nunca había visto la habilidad añadió todo eso y además un límite de LRU, stale-while-revalidate y caché negativa. La caché de la versión con habilidad crece sin límite.

Ante la petición de añadir reintentos dentro de una Lambda, el agente con habilidad produjo una tabla de presupuesto de reintentos impecable y un except general que reintenta un 404 definitivo con el mismo ahínco que un timeout.

No puedes ver esto leyendo una habilidad. Las dos están bien escritas. Solo lo ves ejecutando la tarea dos veces y comparando los artefactos.


Qué hace

Encuentra tus habilidades, elige para cada una una tarea de prueba adversarial adversa, ejecuta en paralelo un par frío/con habilidad y te dice cuáles de tus habilidades no cambian nada.

cold-run v0.1  —  30 skills in ~/.claude/skills

  REAL      retry-guard                added a breaker + cap; cold declined one
  NONE      be-thorough                cold output was identical
  NONE      check-edge-cases           cold found two more edge cases
  NEGATIVE  refactor-first             skilled dropped a null check cold kept
  ...

  11 change nothing.
   2 make the output worse.
  17 earn their place.

  Deleting the 13 frees ~7,400 tokens of always-loaded
  context, every session.

  full report      -> cold-run-report.md
  every transcript -> .cold-run/

Nunca borra nada. Escribe el informe y cada transcripción, y la decisión es tuya.

El coste es real y pide permiso primero. Cuatro llamadas al modelo por habilidad. En una biblioteca de más de 12 prueba una muestra de cinco, de modo que tu primera ejecución sea barata; --all hace el resto.

npx cold-run                    # auto-finds your skills
npx cold-run path/to/skills     # or point it somewhere
npx cold-run --all --yes        # everything, no prompt

Se ejecuta a través de tu CLI local claude si tienes una; si no, mediante ANTHROPIC_API_KEY. Cero dependencias: npx arranca al instante.

Como servidor MCP

La misma auditoría, impulsada por el agente con el que ya hablas: Claude Code, Claude Desktop, Cursor. Usa los subagentes propios de tu agente, así que no hay una segunda clave API ni gastos ocultos.

claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp
{
  "mcpServers": {
    "cold-run": {
      "command": "npx",
      "args": ["-y", "--package=cold-run", "cold-run-mcp"]
    }
  }
}

Entonces solo pregunta: "¿cuáles de mis habilidades hacen algo de verdad?"

Los cinco veredictos

REAL

El artefacto difiere significativamente y la ejecución con habilidad es mejor.

MARGINAL

Una adición real pequeña sobre una salida que la ejecución en frío ya lograba.

NONE

Indistinguible, o la ejecución con habilidad solo habla del principio. Hablar no es cambiar.

NEGATIVO

La salida en frío era mejor. Esto no es extraño. Tres de mis 47 cayeron en este veredicto.

INVALID

Una de las partes nunca produjo un artefacto, así que el par queda anulado. Se informa, nunca se cuenta. Amina un veredicto único de una ejecución que no sucedió es peor que que ya no haya fallo.

Y una conjunto.

Las 24 que sobrevivieron, y el asterisco en ellas

La biblioteca que generó esta herramienta está en skills/. Todas tienen tienen detrás un par frío/con habilidad registrado: ver EVIDENCE.md y runs/ledger.md.

Lee esto antes de instalarlas. Esa auditoría ejecutó ambos agentes bajo los contratos operativos globales de mi máquina: reglas de casa que obligan a un comportamiento de parar y preguntar y a un formato de informe fijo. cold-run elimina deliberadamente todo eso. Bajo la línea base mínima, tres de las cinco primeras supervivientes se califican como NEVATIVE. Ambos resultados se publican completos, con transcripciones: runs/bare-baseline/.

El número que te corresponde depende de lo que tu propio CLAUDE.md ya fuerce. Ni se ha ejecutado a gran escala bajo la línea base mínima. Prefiero publicar la contradicción a esconderla. Las 23 que no pasaron los filtros y por qué no pudieron repararse se cuentan en runs/dropped.md.

Algunas de las supervivientes, para que juzgues el nivel:

  • yagni-audit — «implementar un limitador de frecuencia». La versión en frío escribió unas 700 líneas: síncronas, asíncronas, con clave múltiple, Redis, Lua, decoradores. La con habilidad escribió 15.

  • trust-source-check — la versión en frío autenticaba los servicios con un token estático y compartido de variable de entorno. La con habilidad exigía un token OIDC verificado por JWKS con fijación de audiencia.

  • reverse-path-proof — la versión con habilidad ejecutó un contenedor real de Postgres y descubrió que el rollback aborta con un nombre de 255 caracteres y borra todos los nombres de la tabla. La versión en frío tenía el mismo error.

  • pit-of-success — la versión en frío enviaba el borrado definitivo como opción por defecto. La con habilidad lo hizo reversible durante 30 días y puso la purga detrás de una confirmación que hacía eco del id del usuario.

Instálalos del modo normal, o no. La herramienta es lo importante.

Las habilidades se califican aquí con dos filtros, no uno

  1. Delta de la ejecución en frío — ¿cambia el artefacto? 23 habilidades no pasaron este filtro. → EVIDENCE.md

  2. Enrutamiento — ¿la descripción en verdad consigue que esa habilidad se cargue? Un habilidad perfecta con una descripción that founded runs nunca se active es peso muerto que aún cuesta tokens. Se probó como clasificador contra 360 solicitudes escritas; dos rondas fallaron hasta que las 24 pasaron. → tests/router/

Una habilidad que pase un filtro y falle en el otro sigue siendo rota.

vs. skill-doctor

skill-doctor es un linter. Lee tus habilidades y comprueba la validez de la portada de frontmatter, los enlaces a recursos o si descripción de activación parece frágil, y luego puntúa de 0 a 100. Nunca ejecuta.

cold-run es la otra mitad: ejecuta la habilidad y a un agente que no puede verla, sobre el mismo cometido, y compara los artefactos.

skill-doctor

cold-run

Lee tus habilidades

Las ejecuta

no

Detecta un enlace roto o un frontmatter mal

no

Detecta una habilidad bien formada y que no cambia nada

no

Una habilidad puede tener 100/100 en estructura y seguir siendo un no-op. Ese es el fallo que esto detecta, y es también google el común: 23 de mis 47 eran estructuralmente perfectas.

Ejecuta ambos. Fallan en cosas distintas.

Antecedentes

obra/superpowers es la capa de flujo de trabajo: pensar, planear, ejecutar, verificar. No hay solapamiento con esto: cero habilidades de flujo de trabajo aquí, cero comprobaciones de dominio allá. Su writing-skillings prescribe el mismo tipo de prueba con subagentes que esta herramienta automatiza.

Licencia

MIT.

-
license - not tested
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Verifies AI agent work end to end: real artifacts and outcomes checked, not self-reported success.

  • Deterministic AI code review, with an audit record. Governance inside the agent loop.

  • Git-backed platform for skills, tools, and context for AI agents

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/sina-heidariaan/cold-run'

If you have feedback or need assistance with the MCP directory API, please join our Discord server