vision.vlm
Ask a local OpenAI-compatible vision model about a screenshot or cropped UI region to identify unknown icons and describe their purpose.
Instructions
本地视觉小模型问图(crop-and-ask):缺省整屏,传 box 只裁剪该区域提问(推荐:小图快且准)。需本地 OpenAI 兼容视觉端点:设 MAH_VLM_URL 与 MAH_VLM_MODEL(如 ollama:MAH_VLM_URL=http://127.0.0.1:11434/v1/chat/completions,MAH_VLM_MODEL=qwen2.5vl:3b)。定位:图集外未知图标的语义兜底层
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| box | No | [l,t,r,b] 只裁剪该区域 | |
| from | No | 截图路径,缺省最近一次 vision.screenshot | |
| prompt | No | 问题;缺省=描述该界面元素及用途 | |
| timeout | No |