recommend_deployment
Recommend GPU or hardware for LLM inference by comparing performance, cost, and constraints. Use evidence-backed analysis to choose what to buy or run based on your model and workload.
Instructions
$0.25 USDC: recommend what to buy or run from bounded StackBench fit, performance, confidence, evidence, caveats, and economics only when supported.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| mode | No | configuration | |
| model | Yes | ||
| engine | No | ||
| objective | No | balanced | |
| tco_years | No | ||
| batch_size | No | ||
| concurrency | No | ||
| cost_policy | No | latest_official | |
| max_results | No | ||
| ubatch_size | No | ||
| quantization | No | ||
| budget_amount | No | ||
| prompt_tokens | Yes | ||
| engine_version | No | ||
| ownership_mode | No | purchase | |
| quality_policy | No | prefer | |
| budget_currency | No | ||
| evidence_policy | No | include_public | |
| flash_attention | No | ||
| hardware_system | No | ||
| workload_profile | No | ||
| constraint_policy | No | point_estimate | |
| maximum_tco_amount | No | ||
| maximum_vram_bytes | No | ||
| quality_thresholds | No | ||
| maximum_power_watts | No | ||
| candidate_kv_formats | No | ||
| decode_context_depth | No | ||
| minimum_decode_tok_s | No | ||
| recommendation_scope | No | full | |
| manual_hardware_costs | No | ||
| minimum_prefill_tok_s | No | ||
| materiality_tiebreaker | No | minimize_power | |
| quality_policy_version | No | planner-quality-policy-v2 | |
| quality_evidence_policy | No | allow_calibrated_estimates | |
| economic_materiality_pct | No | ||
| electricity_rate_per_kwh | No | ||
| workload_profile_version | No | ||
| utilization_days_per_year | No | ||
| utilization_hours_per_day | No | ||
| economic_materiality_amount | No | ||
| allow_manual_market_override | No |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||