Calculate an agent evaluation sample size
calculate_evaluation_sample_sizeCalculate how many evaluations are needed to detect at least one failure and to estimate its failure rate within a chosen margin, using failure rate, confidence, margin, and population.
Instructions
Calculate two different samples: how many independent evaluations are needed to detect at least one failure, and how many are needed to estimate its rate at a chosen margin. Use this when a user asks how many tests are enough; do not interpret zero observed failures as proof of zero risk.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| locale | No | Language for interpretations, assumptions, formulas and warnings (default en). | |
| margin | Yes | Margin for estimating the failure rate, in percentage points. | |
| confidence | Yes | Confidence level, in percent. | |
| population | Yes | Number of distinct evaluable cases. | |
| failureRate | Yes | Failure rate to detect, in percent. |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| slug | Yes | ||
| units | Yes | ||
| inputs | Yes | ||
| source | Yes | ||
| api_url | Yes | ||
| license | Yes | ||
| results | Yes | ||
| updated | Yes | ||
| version | Yes | ||
| formulas | Yes | ||
| language | Yes | ||
| warnings | Yes | ||
| assumptions | Yes | ||
| canonical_url | Yes | Cite this URL. | |
| interpretation | Yes | ||
| schema_version | Yes | ||
| methodology_url | Yes |