Run a golden set against a prompt version
llmeval.runEvaluate LLM prompt versions against a golden dataset, returning per-case checks, score, tokens, latency, and pass rate. Replay recorded responses without an API key, or record new model calls.
Instructions
Runs llm-eval-harness over a golden dataset with one prompt version and returns every case with its checks, score, tokens and latency, plus the pass rate. Mode replay (default) serves recorded responses and needs no API key; record calls the model and saves recordings. The result file path is returned for llmeval.drift.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| mode | No | replay uses recordings (no API key); record calls the model | replay |
| repo | No | Repository root to run in; defaults to TOOLKIT_REPO | |
| prompt | Yes | Prompt name, for example support-answer | |
| version | Yes | Prompt version to run | |
| goldenSet | Yes | Golden dataset file (YAML or JSON), relative to the repository |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| mode | Yes | ||
| cases | Yes | ||
| model | No | ||
| prompt | Yes | ||
| dataset | Yes | ||
| summary | Yes | ||
| resultsPath | No |