vision.ask
Answer visual questions about Android screenshots by cropping a region and sending the prompt to a client vision model or external vision endpoint.
Instructions
通用识图增强入口(增强层,非主链路)。MAH_VISION_MODE 决定策略:client=截图以 MCP image 内容块返回,由具备视觉能力的客户端模型自己判读(零额外部署);endpoint=转发问题到外部部署的视觉端点(MAH_VLM_URL/MAH_VLM_MODEL,同 vision.vlm);off=关闭(默认,仅用 ui.snapshot/ui2.*/图集等确定性证据层)
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| box | No | [l,t,r,b] 只取该区域 | |
| from | No | 截图路径,缺省最近一次 vision.screenshot | |
| prompt | No | 问题(endpoint 模式用) |