benchmark_start_duel
Start a randomized, blind A/B battle between two outputs for evaluation, keeping model identities masked to reduce bias.
Instructions
Start a randomized, blind A/B battle between two outputs for evaluation. Model identities remain masked.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| task_id | Yes | The benchmark task ID | |
| output_a_id | No | Optional specific anonymous output ID for Response A | |
| output_b_id | No | Optional specific anonymous output ID for Response B |