run_golden_set
Replay a golden-set file against the live model to verify measure changes in CI. Every golden is re-evaluated and compared to its baseline, reporting pass/fail counts and expected vs actual for failures.
Instructions
Replay a golden-set file against the live model: every golden is re-evaluated and compared to its baseline (numeric tolerance 1e-6, error-state matching). Returns total/passed/failed plus per-failure expected vs actual - the numbers gate for verifying a measure change in CI.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| path | Yes | golden-set JSON file written by save_golden_set | |
| sessionId | Yes |