responses_list
List responses for a run, in row order. Returns {total, limit, offset, returned, responses}. Defaults to 50 rows because full payloads are large: use "fields" to drop the bodies, "min_score"/"max_score" to isolate low scorers, and sort "score_asc" to read the worst rows first. For per-metric averages of the whole run use runs_get instead of aggregating here.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| sort | No | Row order; defaults to "id". | |
| limit | No | Rows to return; defaults to 50, capped at 500. | |
| fields | No | Only return these keys, keeping the payload small. Response keys: id, run_id, input_data, response_text, expected_output, created_at, score, reviewed, reviews, status, attempts, row_index, error. Prefix with "reviews." to trim each review, e.g. ["score", "reviews.metric_name", "reviews.ai_score"]. id is always included. | |
| offset | No | Rows to skip before returning results. | |
| run_id | Yes | ||
| status | No | Filter by row status: pending, retrying, succeeded or failed. | |
| max_score | No | Only rows whose average judge score is at most this. Use with sort "score_asc" for failure-mode analysis. | |
| min_score | No | Only rows whose average judge score is at least this. |