Query crucible eval history
eval_historyQuery evaluation results to list runs, summarize per-category pass rates and behavior counts, or compare two runs.
Instructions
Read-only queries against the crucible eval results database: list runs for a model, summarize one run per category (pass rates plus complied/hedged/refused tallies), or compare two runs.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| runA | No | For compare_runs: baseline run id. | |
| runB | No | For compare_runs: comparison run id. | |
| model | No | For list_runs: substring filter on model name or file. | |
| runId | No | For run_summary: the run id. | |
| action | Yes | list_runs: all eval runs (optionally filtered by model). run_summary: per-category pass rates and complied/hedged/refused tallies for one run (requires runId). compare_runs: side-by-side category deltas (requires runA and runB). |