invariance_eval_experiment_run
Run evaluator scorers on an existing evaluation run to score case results, and optionally record a baseline for comparison. Populates scores for further analysis and debugging.
Instructions
Execute an experiment against an existing eval run: applies a list of scorer specs to every case result and (optionally) records a baseline run for later compare. Populates eval_results.scores. Built-in scorer names: exact_match, contains, numeric_tolerance (config.tolerance: number), json_match, levenshtein.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| id | Yes | Eval run ID to score, e.g. "erun_abc123". | |
| body | Yes | ExperimentRunRequest as a JSON object string. Required: scorer_specs (ScorerSpec[] — each {"name": ScorerName, "config"?: object}). Optional: baseline_run_id (string — pointer to a prior eval run for diffing). Example: {"scorer_specs":[{"name":"exact_match"},{"name":"numeric_tolerance","config":{"tolerance":0.1}}],"baseline_run_id":"erun_prev"} |