Skip to main content
Glama

cold-run

Я протестировал 47 навыков агентов. Удалил 23 из них. Три делали код Claude хуже.

Затем я собрал инструмент, который делает это, нацелил его на 47 выживших — и он оценил три из первых пяти как NEGATIVE.

Это не баг. Это самое интересное, что я нашёл, и я публикую это, а не жду, пока вы найдёте сами: runs/bare-baseline/.

npx cold-run

Суть

Навык, который ничего не делает, — это скучный провал. Типичный — хуже:

Навык расходует внимание агента. Он покупает конкретную проверку и платит за неё всем остальным, что было нужно для задачи.

Когда агента попросили собрать кешируемый look-up, тот, кто следовал amplification-check, добавил джиттер и single-flight — ровно то, что требует навык. Агент, который никогда не видел навыка, добавил их и предел LRU, stale-while-revalidate и негативное кеширование. Кеш «умелой» версии растёт без ограничений.

Когда агента попросили добавить повторы внутри Lambda, «умелый» агент выдал аккуратную таблицу бюджета повторов и одеяло except, который ретраит однозначный 404 так же усердно, как и таймаут.

Этого нельзя увидеть, читая навык. Оба этих навыка хорошо написаны. Это видно только если запустить задачу дважды и сравнить артефакты.


Что он делает

Находит ваши навыки, подбирает для каждого состязательное тестовое задание, запускает пару cold/skilled параллельно и сообщает, какие из ваших навыков ничего не меняют.

cold-run v0.1  —  30 skills in ~/.claude/skills

  REAL      retry-guard                added a breaker + cap; cold declined one
  NONE      be-thorough                cold output was identical
  NONE      check-edge-cases           cold found two more edge cases
  NEGATIVE  refactor-first             skilled dropped a null check cold kept
  ...

  11 change nothing.
   2 make the output worse.
  17 earn their place.

  Deleting the 13 frees ~7,400 tokens of always-loaded
  context, every session.

  full report      -> cold-run-report.md
  every transcript -> .cold-run/

Он никогда ничего не удаляет. Он сохраняет отчёт и каждую стенограмму, а решение остаётся за вами.

Стоимость реальна, и он спрашивает разрешение. Четыре вызова модели на навык. На библиотеке более 12 навыков он тестирует выборку из пяти, чтобы первый прогон был дёшев; --all делает остальное.

npx cold-run                    # auto-finds your skills
npx cold-run path/to/skills     # or point it somewhere
npx cold-run --all --yes        # everything, no prompt

Работает через локальный CLI claude, если он у вас установлен, иначе через ANTHROPIC_API_KEY. Ноль зависимостей — npx запускается мгновенно.

Как MCP-сервер

Тот же аудит, управляемый любым агентом, с которым вы уже общаетесь, — Claude Code, Claude Desktop, Cursor. Он использует собственные сабагенты вашего агента, поэтому не требуется второй API-ключ и нет скрытых расходов.

claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp
{
  "mcpServers": {
    "cold-run": {
      "command": "npx",
      "args": ["-y", "--package=cold-run", "cold-run-mcp"]
    }
  }
}

Просто спросите: «Какие из моих навыков вообще что-то делают?»

Пять вердиктов

REAL

Артефакт существенно отличается, и прогон с навыком лучше.

MARGINAL

Небольшое реальное дополнение к результату, который уже был верен в cold-прогон.

NONE

Неотличим — или прогон с навыком только рассуждал о принципе. Рассуждение — это не изменение.

NEGATIVE

Результат cold-прогон было лучше. Это не редкость. Три из моих 47 оказались именно здесь.

INVALID

Одна из сторон не создала артефакт, поэтому пара недействительна. Фиксируется, но не учитывается. Вердикт за прогон, который не состоялся, хуже, чем отсутствие вердикта.

24 выживших — и звёздочка к ним

Библиотека, из которой родился этот инструмент, находится в skills/. Каждая навыка имеет задокументированную пару cold/skilled — см. EVIDENCE.md и runs/ledger.md.

Прочтите это перед установкой. В том аудите обаагента работали под моими глобальными контрактами этой машины — домовыми правилами, которые заставляют «стоп и думай» и фиксируют формат отчёта. cold-run намеренно снимает всё это. На «голом» бейзлайне три и з первых пяти выживших получают оценку NEGATIVE. Оба результата опубликованы полностью, вместе при стенограммами: runs/bare-baseline/.

Какая цифра относится к вам, зависит от того, что ваш собственный CLAUDE.md уже требует. Ни один из вариантов не был полностью выполнен на «голом» бейзлайне. Я предпочитаю показать противоречие, а не спрятать его. 23 навыка, которые не прошли, и почему ни один из них нельзя было починить, — в runs/dropped.md.

А вот некоторые выжившие, чтобы вы могли оценить планку:

  • yagni-audit — «релиcus rate limiter». Cold-прогон написал ~700 строк: синхронная, асинхронная, бесключевая версия, Redis, Lua, деколдаторы. «Умелый» — 15.

  • trust-source-check — cold-прогон аутовал сервисы общим статическим токеном из переменной окружения. «Умелый» требовал OIDC-токен с верификацией по JWKS и привязкой к аудитории.

  • reverse-path-proof — «умелый» прогнанный запустил настоящий контейнер Postgres и обнаружил, что rollback аварийно прерывается на 255-символьном имени, стирая все имена в таблице. У cold-прогон был тот же баг.

  • pit-of-success — cold-прогон сразу срушивал необратимое удаление по умолчанию. «Умелый» сделал его отменяемым в течение 30 дней и поставил purge за подтверждение, которое выводит id пользователя.

Установите их обычным способом или не устанавливайте. Главное — инструмент.

Навыки проверяются по двум воротам, а не по одному

  1. Cold-run delta — меняет ли навык артефакт? 23 навыка не прошли эту проверку. → EVIDENCE.md

  2. Маршрутизация — действительно ли описание приводит к загрузке навыка? Идеальный навык с описанием, которое не срабатывает, — всё же мёртвый груз, который стои т проектар токены. Проверено как классификатор против 360 письменных запросов; дву захода не прошли, прежде чем все 24 не сработали. → tests/router/

Навык, прошедший один фильтр, но проваливший другой, — всё сломан.

Иронизированный skill-doctor

skill-doctor — это линтер. Он читает ваши навыки и проверяет валидность frontmatter, битые ссылки на ресурсы и то, выглядит ли описание-триггер слабым, затем ставит от 0 до 100. Он никогда ничего не запускает.

cold-run — другая половина. Он выполняет задачу и с навыком, и с агентом, который не видит этот навык, и сравнивает полученные артефакты.

skill-doctor

cold-run

Читает ваши навыкники

да

да

Запускает их

нет

да

Ловит битую ссылку или плохой frontmatter

да

нет

Ловит навык, который корректен, но ничего не меняет

нет

да

Навык может получить 100/100 за структуру и всё равно оставаться пустышкой. Именно эта ошибка тут и ловится, и она распространена — 23 из моих 47 были структурно безупречны.

Запускайте оба. Сбоят они на разных вещах.

Предшественники

obra/superpowers — это слой рабочих процессов: brainstorm, plan, execute, verify. Пересечения с этим тут нет: здесь нет ни одного «навыкиьи рабочего процесса», как и никаких доменных проверок там. Его writing-skills описывает ровно то тестирование субагентами, которое автоматизирует этот инструмент.

Лицензия

MIT.

-
license - not tested
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Verifies AI agent work end to end: real artifacts and outcomes checked, not self-reported success.

  • Deterministic AI code review, with an audit record. Governance inside the agent loop.

  • Git-backed platform for skills, tools, and context for AI agents

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/sina-heidariaan/cold-run'

If you have feedback or need assistance with the MCP directory API, please join our Discord server