cold-run
cold-run
Я протестировал 47 навыков агентов. Удалил 23 из них. Три делали код Claude хуже.
Затем я собрал инструмент, который делает это, нацелил его на 47 выживших — и он оценил три из первых пяти как NEGATIVE.
Это не баг. Это самое интересное, что я нашёл, и я публикую это, а не жду, пока вы найдёте сами: runs/bare-baseline/.
npx cold-runСуть
Навык, который ничего не делает, — это скучный провал. Типичный — хуже:
Навык расходует внимание агента. Он покупает конкретную проверку и платит за неё всем остальным, что было нужно для задачи.
Когда агента попросили собрать кешируемый look-up, тот, кто следовал amplification-check,
добавил джиттер и single-flight — ровно то, что требует навык. Агент, который никогда не видел
навыка, добавил их и предел LRU, stale-while-revalidate и негативное кеширование. Кеш
«умелой» версии растёт без ограничений.
Когда агента попросили добавить повторы внутри Lambda, «умелый» агент выдал аккуратную
таблицу бюджета повторов и одеяло except, который ретраит однозначный 404 так же усердно,
как и таймаут.
Этого нельзя увидеть, читая навык. Оба этих навыка хорошо написаны. Это видно только если запустить задачу дважды и сравнить артефакты.
Что он делает
Находит ваши навыки, подбирает для каждого состязательное тестовое задание, запускает пару cold/skilled параллельно и сообщает, какие из ваших навыков ничего не меняют.
cold-run v0.1 — 30 skills in ~/.claude/skills
REAL retry-guard added a breaker + cap; cold declined one
NONE be-thorough cold output was identical
NONE check-edge-cases cold found two more edge cases
NEGATIVE refactor-first skilled dropped a null check cold kept
...
11 change nothing.
2 make the output worse.
17 earn their place.
Deleting the 13 frees ~7,400 tokens of always-loaded
context, every session.
full report -> cold-run-report.md
every transcript -> .cold-run/Он никогда ничего не удаляет. Он сохраняет отчёт и каждую стенограмму, а решение остаётся за вами.
Стоимость реальна, и он спрашивает разрешение. Четыре вызова модели на навык. На
библиотеке более 12 навыков он тестирует выборку из пяти, чтобы первый прогон был дёшев;
--all делает остальное.
npx cold-run # auto-finds your skills
npx cold-run path/to/skills # or point it somewhere
npx cold-run --all --yes # everything, no promptРаботает через локальный CLI claude, если он у вас установлен, иначе через
ANTHROPIC_API_KEY. Ноль зависимостей — npx запускается мгновенно.
Как MCP-сервер
Тот же аудит, управляемый любым агентом, с которым вы уже общаетесь, — Claude Code, Claude Desktop, Cursor. Он использует собственные сабагенты вашего агента, поэтому не требуется второй API-ключ и нет скрытых расходов.
claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp{
"mcpServers": {
"cold-run": {
"command": "npx",
"args": ["-y", "--package=cold-run", "cold-run-mcp"]
}
}
}Просто спросите: «Какие из моих навыков вообще что-то делают?»
Пять вердиктов
REAL | Артефакт существенно отличается, и прогон с навыком лучше. |
MARGINAL | Небольшое реальное дополнение к результату, который уже был верен в cold-прогон. |
NONE | Неотличим — или прогон с навыком только рассуждал о принципе. Рассуждение — это не изменение. |
NEGATIVE | Результат cold-прогон было лучше. Это не редкость. Три из моих 47 оказались именно здесь. |
INVALID | Одна из сторон не создала артефакт, поэтому пара недействительна. Фиксируется, но не учитывается. Вердикт за прогон, который не состоялся, хуже, чем отсутствие вердикта. |
24 выживших — и звёздочка к ним
Библиотека, из которой родился этот инструмент, находится в skills/. Каждая навыка имеет задокументированную пару cold/skilled — см. EVIDENCE.md и runs/ledger.md.
Прочтите это перед установкой. В том аудите обаагента работали под моими глобальными
контрактами этой машины — домовыми правилами, которые заставляют «стоп и думай» и фиксируют
формат отчёта. cold-run намеренно снимает всё это. На «голом» бейзлайне три и з первых
пяти выживших получают оценку NEGATIVE. Оба результата опубликованы полностью, вместе при
стенограммами: runs/bare-baseline/.
Какая цифра относится к вам, зависит от того, что ваш собственный CLAUDE.md уже требует.
Ни один из вариантов не был полностью выполнен на «голом» бейзлайне. Я предпочитаю показать
противоречие, а не спрятать его. 23 навыка, которые не прошли, и почему ни один из них нельзя
было починить, — в runs/dropped.md.
А вот некоторые выжившие, чтобы вы могли оценить планку:
yagni-audit— «релиcus rate limiter». Cold-прогон написал ~700 строк: синхронная, асинхронная, бесключевая версия, Redis, Lua, деколдаторы. «Умелый» — 15.trust-source-check— cold-прогон аутовал сервисы общим статическим токеном из переменной окружения. «Умелый» требовал OIDC-токен с верификацией по JWKS и привязкой к аудитории.reverse-path-proof— «умелый» прогнанный запустил настоящий контейнер Postgres и обнаружил, что rollback аварийно прерывается на 255-символьном имени, стирая все имена в таблице. У cold-прогон был тот же баг.pit-of-success— cold-прогон сразу срушивал необратимое удаление по умолчанию. «Умелый» сделал его отменяемым в течение 30 дней и поставил purge за подтверждение, которое выводит id пользователя.
Установите их обычным способом или не устанавливайте. Главное — инструмент.
Навыки проверяются по двум воротам, а не по одному
Cold-run delta — меняет ли навык артефакт? 23 навыка не прошли эту проверку. → EVIDENCE.md
Маршрутизация — действительно ли описание приводит к загрузке навыка? Идеальный навык с описанием, которое не срабатывает, — всё же мёртвый груз, который стои т проектар токены. Проверено как классификатор против 360 письменных запросов; дву захода не прошли, прежде чем все 24 не сработали. → tests/router/
Навык, прошедший один фильтр, но проваливший другой, — всё сломан.
Иронизированный skill-doctor
skill-doctor — это линтер. Он читает ваши навыки и проверяет валидность frontmatter, битые ссылки на ресурсы и то, выглядит ли описание-триггер слабым, затем ставит от 0 до 100. Он никогда ничего не запускает.
cold-run — другая половина. Он выполняет задачу и с навыком, и с агентом, который не видит этот навык, и сравнивает полученные артефакты.
skill-doctor | cold-run | |
Читает ваши навыкники | да | да |
Запускает их | нет | да |
Ловит битую ссылку или плохой frontmatter | да | нет |
Ловит навык, который корректен, но ничего не меняет | нет | да |
Навык может получить 100/100 за структуру и всё равно оставаться пустышкой. Именно эта ошибка тут и ловится, и она распространена — 23 из моих 47 были структурно безупречны.
Запускайте оба. Сбоят они на разных вещах.
Предшественники
obra/superpowers — это слой рабочих процессов:
brainstorm, plan, execute, verify. Пересечения с этим тут нет: здесь нет ни одного «навыкиьи
рабочего процесса», как и никаких доменных проверок там. Его writing-skills описывает
ровно то тестирование субагентами, которое автоматизирует этот инструмент.
Лицензия
MIT.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Connectors
Verifies AI agent work end to end: real artifacts and outcomes checked, not self-reported success.
Deterministic AI code review, with an audit record. Governance inside the agent loop.
Git-backed platform for skills, tools, and context for AI agents
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/sina-heidariaan/cold-run'
If you have feedback or need assistance with the MCP directory API, please join our Discord server