vision
Convert image files into structured text descriptions and OCR output, enabling text-only LLMs to read and reason about pictures, screenshots, charts, and documents.
Instructions
识别一张图片,返回结构化文字描述与 OCR 文字。
适用于截图、文档、图表、照片等。当主文本模型无法直接读取图片、 或需要把图片内容转成文字再交给纯文本模型推理时,调用本工具。
参数: image_path: 图片的本地绝对路径(支持 png/jpg/jpeg/webp 等常见格式)。 prompt: 可选,自定义识别指令;不填则使用默认的"描述+OCR"指令。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| prompt | No | 请详细描述这张图片。如果图片中包含文字,请完整提取所有可见文字;如果包含界面、图表或表格,请说明其结构、关键元素和位置关系。请用结构化、客观的语言输出,方便后续文本模型基于你的描述继续分析和推理。 | |
| image_path | Yes |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| result | Yes |