媒体理解(图/视频/音频 → 文本)
analyze_mediaAnalyze images, videos, or audio using multimodal LLMs to generate text descriptions, transcriptions, or insights. Overcomes limitations of text-only models for media understanding.
Instructions
用多模态 LLM 分析媒体内容并输出文本(宿主模型自身无法看视频/听音频,此为能力补充)。三选一提供 image_urls / video_urls / audio_url(协议自动判别)。异步提交:默认等待 60s,短任务直接返回 text;长任务(视频/思考模型)超时返回 task_id,用 get_task / wait_for_task 取回。模型来自 llm-router 注册表(与生成类不同),用支持对应能力的模型(如 gemini-3.1-pro-preview 支持 vision/video/audio);model 无效时错误会列出可用模型。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| model | Yes | llm-router 模型 id,如 gemini-3.1-pro-preview、claude-sonnet-4-6 | |
| prompt | Yes | 对媒体的分析指令,如“描述这段视频”“转写这段音频” | |
| audio_url | No | 单个音频 URL | |
| image_urls | No | 图片 URL 数组(1–10 张) | |
| max_tokens | No | ||
| video_urls | No | 视频 URL 数组(1–10 个) | |
| temperature | No | ||
| wait_seconds | No | 最长等待秒数,默认 60,设 0 立即返回 task_id | |
| system_prompt | No | 系统指令 |