view_media
Displays a local image or video frame as image content, letting the calling model see the actual visuals. Use timestamp to pick a specific video frame; defaults to middle frame.
Instructions
把一张【图片】、或【视频的某一帧】作为图片内容直接返回,让调用方模型亲眼看到画面。
path 是图片(png/jpg/jpeg/webp/gif):直接返回该图(长边超出 max_dimension 会等比缩小)。 GIF 只返回首帧(想感知整段动画请用 describe_video)。
path 是视频:给了 timestamp(秒)就抽那一帧;没给则抽正中间那一帧。需要本机有 ffmpeg。
与 describe_video 的分工:describe_video 让 Gemini 看视频写【文字】;view_media 把【画面本身】投给 你(调用方模型)看。stdio / HTTP 模式都可用。
Args: path: 本地图片或视频文件路径。 timestamp: 仅对视频有效,抽取该秒(float)的一帧;不填则取中间帧。 max_dimension: 返回图片的长边上限像素,默认 1024(超出等比缩小,不放大;范围 16~4096)。
Returns: 一张图片内容(MCP ImageContent);出错时返回一句中文说明。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| path | Yes | ||
| timestamp | No | ||
| max_dimension | No |