warm
Load a model into GPU memory or refresh its keep-alive to keep it resident, avoiding reload delays.
Instructions
Load a model or refresh its keep-alive (e.g. "5m"; "-1" pins indefinitely).
An already resident model requires zero additional capacity. New loads account for reservations using an approximate model size; size_verified describes that estimate, while outcome describes verified residency. Returns succeeded|refused|failed|unknown. On unknown, inspect residency and pending_until before retrying. force=True bypasses admission checks but cannot override a pending operation. Zero durations must use unload().
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| by | No | unknown | |
| force | No | ||
| model | Yes | ||
| keep_alive | No | 5m |