Evaluate
evaluateRun a Cookbook benchmark against a model or checkpoint, scoring datasets with configurable metrics and persisting evaluation artifacts. Use to measure model quality before or after training.
Instructions
Run a Cookbook benchmark and persist evaluation artifacts. This spends credits.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| request | Yes | ||
| background | No |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||