test_evaluator
Run a grader on sample inputs to verify scoring accuracy before committing, ensuring valid evaluation results.
Instructions
Test-run a grader with sample inputs to verify it scores correctly BEFORE committing.
Required keys in inputs: at least "input" and "output". Optional: "expected_output", "metrics", "metadata".
Example: { "evaluator_id": "abc123", "inputs": { "input": "What is 2+2?", "output": "4", "expected_output": "4" } }
Returns the actual score (boolean_value / numerical_value / etc.) and reasoning. Use this before commit_evaluator.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| inputs | Yes | Sample data. At minimum {input, output}. Add expected_output / metrics / metadata as the evaluator needs. | |
| evaluator_id | Yes | Evaluator ID (optionally with version: "id:version"). | |
| generation_method | No | Force evaluation method. Default: auto. |