Skip to main content
Glama

cold-run

47개의 에이전트 스킬을 테스트했습니다. 23개를 삭제했습니다. 그중 3개는 Claude의 코드를 더 나쁘게 만들고 있었습니다.

그리고 그 일을 하는 도구를 만들어 살아남은 24개에 들려보냈고, 처음 5개 중 3개가 NEGATIVE 판정을 받았습니다.

그것은 버그가 아닙니다. 이번 조사에서 가장 흥미진진한 수확이며, 여러분이 발견할 때마다 기다리지 않고 공개합니다: runs/bare-baseline/.

npx cold-run

그 발견

아무것도 하지 않는 스킬은 지루한 실패입니다. 흔한 실패는 그보다 더 나쁩니다:

스킬은 에이전트의 주의력을 소모합니다. 특정한 검사를 사고, 그 검사 비용을 과제가 필요한 다른 모든 것에서 지불합니다.

캐시된 조회를 만들라는 요청을 받았을 때, amplification-check를 따르는 에이전트는 지터와 single-flight를 추가했습니다 — 스킬이 정확히 요구한 것입니다. 그 스킬을 한 번도 보지 못한 에이전트는 그 기능들에다 LRU 캡, stale-while-revalidate, 부정 캐싱까지 추가했습니다. 스킬을 적용한 버전의 배송은 커질 수 없이 커집니다.

Lambda 내부에 재시도를 추가하라는 요청을 받았을 때, 스킬을 적용한 에이전트는 단정한 재시도 예산 표와, 확실한 404를 타임아웃과 똑같이 적극적으로 재시도하는 무차별적인 except를 만들어 냈습니다.

이런 사실은 스킬을 읽는 것만으로는 보이지 않습니다. 그 두 스킬 모두 잘 작성되어 있습니다. 과제를 두 번 실행하고 결과물을 diffing해야만 보입니다.


도구가 하는 일

여러분의 스킬을 찾아 각 스킬에 하나씩 적대적인 테스트 과제를 고르고, cold/skilled 쌍을 병렬로 실행한 뒤 어떤 스킬이 아무것도 바꾸지 않는지 알려줍니다.

cold-run v0.1  —  30 skills in ~/.claude/skills

  REAL      retry-guard                added a breaker + cap; cold declined one
  NONE      be-thorough                cold output was identical
  NONE      check-edge-cases           cold found two more edge cases
  NEGATIVE  refactor-first             skilled dropped a null check cold kept
  ...

  11 change nothing.
   2 make the output worse.
  17 earn their place.

  Deleting the 13 frees ~7,400 tokens of always-loaded
  context, every session.

  full report      -> cold-run-report.md
  every transcript -> .cold-run/

아무것도 삭제하지 않습니다. 보고서와 이제 모든 대화를 기록하고, 결정은 여러분의 몫입니다.

비용은 실재하며 먼저 묻습니다. 스킬당 모델 호출 4회입니다. 스킬이 12개 넘는 라이브러리에서는 너비 있게 5개를 뽑아 테스트하므로 첫 실행은 저렴합니다. --all으로 나머지를 모두 돌려봅니다.

npx cold-run                    # auto-finds your skills
npx cold-run path/to/skills     # or point it somewhere
npx cold-run --all --yes        # everything, no prompt

로컬 claude CLI가 있으면 그것을 통해 실행하고, 그렇지 않으면 ANTHROPIC_API_KEY를 사용합니다. 의존성 제로 — npx는 즉시 실행됩니다.

MCP 서버로 사용

이미 대화하던 에이전트로 동일한 감사를 수행합니다 — Claude Code, Claude Desktop, 쿼터 Cursor. 여러분의 에이전트가 가진 하위 에이전트를 사용하므로 두 번째 API 키도, 숨겨진 부담도 없습니다.

claude mcp add cold-run -- npx -y --package=cold-run cold-run-mcp
{
  "mcpServers": {
    "cold-run": {
      "command": "npx",
      "args": ["-y", "--package=cold-run", "cold-run-mcp"]
    }
  }
}

그러면 그냥 물어만 보세요: "내 스킬 중 실제로 아무것도 하는 것이 무엇인가요?"

다섯 가지 판정

REAL

결과물이 실질적으로 서리에게 변화하고 스킬을 적용한 실행이 더 좋다.

MARGINAL

cold 실행이 이미 올린 출력 위에 작지만 실제적인 추가가 있는 경우.

NONE

거의고 차이 없음 — 또는 스킬을 적용한 실행이 원칙에 대해 말로만 했음. 말하는 것은 바꾸는 것이 아님.

NEGATIVE

cold 출력이 더 좋았다. 그 이유는 드물지 않습니다. 내 47개 중 3개가 여기 해당했습니다.

INVALID

한쪽에서 결과물이 나오지 않아 쌍이 무효. 보고는 하지만 셈하지 않는다. 실행되지 않은 검사에서 나온 판단은 판단 없음보다 열등하다.

그리고 살아남은 24개, 그리고 별표

이 도구의 기반이 된 라이브러리는 skills/에 있습니다. 모든 스킬 뒤에는 기록된 cold/skilled 쌍이 있는을 지켜 EVIDENCE.mdruns/ledger.md에서 확인할 수 있습니다.

설치하기 전에 이 내용을 읽으십시오. 그리고 감사는 기계의 전반щие 운영 계약 하에서 두 에이전트를 모두 실행했습니다 — 정지 후 질문하게하고서 고정된 보고 형식을 강 청한 내 규칙입니다. cold-run은 의도적으로 그 모든 것을 거둬들입니다. bare baseline 아래에서는 처음 다섯 개 생존자 중 세 개가 NEGATIVE로 판정됩니다. 두 개 결과 모두 전체 기록과 함께 게시됩니다: runs/bare-baseline/.

어떤 숫자가 여러분 것인지는 여러분 자신의 CLAUDE.md가 원래 강제하는 것에 따라 다릅니다. bare baseline에서는 어느 쪽도 전체 규모로 아직 돌려지지 않았습니다. 모순을 숨기는 것보다 선을 보여 드리는 게 낫습니다. 들어가지 못한 23개와 왜 그중 어떤 것도 고칠 수 없는지에 대한 이유들은 runs/dropped.md에 있습니다.

생존자 중 몇 가지를 보니 판단 기준을 알 수 있습니다:

  • yagni-audit — "rate limiter를 하나 구현하세요." cold 실행은 약 ~700줄을 썼습니다: sync, async, keyed, Redis, Lua, 데코레이터입니다. skilled 실행은 15줄이었습니다.

  • trust-source-check — cold 실행은 공유 정 적 env-var 토큰으로 서비스를 인증했습니다. skilled 실행은 audience 고정을 요구한 JWKS 검증 OIDC 토큰을 요구했습니다.

  • reverse-path-proof — skilled 실행은 실제 Postgres 컨테이너를 운영했고 255자 이름에서 롤백이 중단되어 테이블의 모든 이름이 지워지는 것을 발견했습니다. cold 실행에도 이 같은 버그가 있었습니다.

  • pit-of-success — cold 실행은 기본값으로 즉각 완전 삭제를 선택했습니다. skilled 실행을 30일간 무엇이 가능하게 만들고 사용자 ID를 가진 확인을 이후에 영구 삭제로 남겼습니다.

보통 방식으로 설치하든 하지 않든 그 자유입니다. 도구가 본질입니다.

스킬은 여기서 두 갈래 관문으로 판정됩니다, 하나가 아님

  1. Cold-run 델타 — 실제로 생성된 결과를 바꾸는가? 23개에서 실패했습니다. → EVIDENCE.md

  2. 라우팅 — 설명이 실제로 그 스킬을 로드하게 하는가? 완벽한 스킬도 발동하지 않는 설명을 가지고 있으면 여전히 토큰만 소모하는 죽은 분짐입니다. 360건의 실제 요청에 대해 분류기로 테스트했고, 24개가 모두 통과하기 전에 두 라운드가 실패했습니다. → tests/router/

한 가지 관문은 통과했지만 다른 관문을 통과하지 못한 스킬도 여전히 버그입니다.

vs. skill-doctor

skill-doctor린터입니다. 여러분의 스킬을 가져와 frontmatter 유효성, 끊긴 리소스 링크, 클한다 트리거 설명이 미약해 보이는지 등을 검사한 뒤 0–100 점수를 매깁니다. 절대 아무것도 실행하지 않습니다.

cold-run은 그 나머지 절반입니다. 동일한 과제를 하나는 스킬을 사용하는 에이전트, 하나는 스킬을 볼 수 없는 에이전트에 돌리고 그 결과물을 비교합니다.

skill-doctor

cold-run

여러분의 스킬을 읽어낼 수 있음

스킬 실행

아니오

이어지지 않은 링크나 잘못된 frontmatter를 잡아냄

아니오

잘 작성됐지만 아무것도 바꾸지 않는 스킬을 잡아냄

아니오

스킬 하나는 구조에서 100/100을 받아도 여전히 무준수일 수 있습니다. 이것이 바로 이 도구가 잡아내는 실패이고, 그리고 똑너무 흔합니다. 내 47개 중 23개는 구조상 완벽했습니다. 두 가지를 다 감사하세요. 다른에서 정확히 다릅니다.

관련 셋에서

obra/superpowers는 워크플로 레이어입니다. 브레인스토밍, 계획, 실행, 검증. 이것과 겹치는 부분이 없습니다. 여기에는 검증 워크플로 스킬이 전혀 없고 거기에는 도메인 검사가 전혀 없습니다. 이 저장소의 writing-skills 문서는 이 도구가 자동으로 수행하는 것과 같은 서브에이전트 테스트 방법을 권장합니다.

라이선스

MIT.

-
license - not tested
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Verifies AI agent work end to end: real artifacts and outcomes checked, not self-reported success.

  • Deterministic AI code review, with an audit record. Governance inside the agent loop.

  • Git-backed platform for skills, tools, and context for AI agents

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/sina-heidariaan/cold-run'

If you have feedback or need assistance with the MCP directory API, please join our Discord server