analyze_image
Analyze local screenshots with an image path and prompt to get text descriptions or structured JSON for inspecting UI layouts, error messages, and element coordinates in UI automation.
Instructions
分析本地图片(UI 自动化视觉辅助)。
当需要"查看屏幕/截图/界面"时使用:传入截图路径与问题,返回多模态模型的文字描述或结构化 JSON。
调用规范(必须遵守):
调用前,先在回复中说明你正在分析哪张截图及其目的(如"让我分析一下当前界面")。
prompt 必须写明具体想知道的描述内容,例如 "描述界面布局并列出所有可见按钮"、"截图中有哪些错误提示"、"这个弹窗的标题和选项是什么"。
禁止传空 prompt 或含糊 prompt(如 "看一下"、"描述" ),server 会把过短的 prompt 视为无效并自动补充标准描述要求。
图片必须已保存为本地文件,传入绝对路径;本工具自行读取,无需传图片内容。
需要结构化结果(如元素坐标)时设置 json_mode=true,要求模型返回 JSON。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| prompt | Yes | 要问的问题,如"描述界面并列出可见按钮" | |
| json_mode | No | 为 true 时要求模型返回 JSON(用于结构化结果,如坐标) | |
| image_path | Yes | 本地图片文件的绝对路径(如 /tmp/screenshot.png) |