get_model_benchmarks
Get all benchmark scores for a model across eval sources.
Returns scores grouped by benchmark name (SWE-bench Verified, LiveBench, Terminal-Bench, etc.), with reasoning_mode and agent_framework as secondary dimensions. Use to compare a model's strengths across tasks.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| benchmark | No | optional filter by benchmark name (e.g., "SWE-bench Verified"). | |
| model_name | Yes | model name (e.g., "Claude Fable 5", "GPT-5.5"). |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||