evaluate
Run the built-in benchmark harness to measure query accuracy, validation, freshness, and latency across diverse repository scenarios.
Instructions
Run the built-in real benchmark harness across small, medium, monorepo, polyglot, ignored-tree, broken-state, and rename-freshness scenarios. Reports golden-query accuracy, validation rates, freshness reliability, and p50/p95/p99 query latency.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||