recognize_image
Analyze images to generate detailed text descriptions. Supports local files, URLs, and base64 input for use in screenshot analysis, UI review, and chart interpretation.
Instructions
识别图片内容并返回文字描述。
适用于截图分析、UI 审查、图片内容理解、图表解读等场景。
Args: image: 图片来源,支持三种形式: 1. 本地文件绝对/相对路径(如 /tmp/a.png、./pic.jpg) 2. http(s) 网络图片 URL 3. base64 编码字符串(裸串即可,无需 data: 前缀) prompt: 想让模型关注的重点或要回答的问题。 默认为详细描述图片全部内容。
Returns: 视觉模型给出的图片文字描述。
Raises: FileNotFoundError: 本地图片路径不存在。 RuntimeError: 未配置 API key 或视觉模型调用失败。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| image | Yes | ||
| prompt | No | 请详细描述这张图片的内容,包括其中的文字、物体、人物、场景、布局、颜色等信息。 |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| result | Yes |