dsh-vision-dashscope
dsh-vision-dashscope
DSH-Plugin (MCP-Server) zur Erkennung und Generierung von Bildern, Videos und Audio über DashScope / 千问 (Qwen). Speziell entwickelt gegen das Problem „Bei großen Videos versagt es“ bei Plugins wie Deepseek-omnimodal:
Lange/große Videos direkt erkennen: Über die temporäre OSS-Direktübertragung von Bailian (
oss://temporäre URL, Dateilimit 1 GB, geprüft anhand dermax_file_size_mbdes Modells), ohne Komprimierung, ohne Qualitätsverlust; kleine Videos (≤14 MB) werden per base64 übertragen, um einen Upload zu sparen.Auch Formate, die der Browser nicht abspielen kann, wie mkv/avi, werden erkannt (das Modell dekodiert serverseitig und extrahiert Frames).
Audio: Kurze Audiodateien werden direkt von qwen3.5-omni verstanden, lange Audiodateien automatisch per fun-asr transkribiert.
Werkzeuge
Werkzeug | Beschreibung |
| Lokales Bild / Bild-URL → Beschreibung oder aufgabenbasierte Analyse (qwen3.7-flash) |
| Lokales Video / Video-URL → Beschreibung oder aufgabenbasierte Analyse (qwen3.7-flash; große Dateien per OSS-Direktübertragung) |
| Kurze Audiodateien per qwen3.5-omni verstehen; lange Audiodateien per fun-asr transkribieren |
| Text-zu-Bild (qwen-image-3.0 usw.; ab ca. 0,18 CNY pro Bild) |
| Text-zu-Video (wan2.7-t2v / happyhorse-1.1-t2v; ab ca. 0,6 CNY pro Sekunde) |
| Bild-zu-Video (wan2.7-i2v usw.; Erstbild wird automatisch in temporäres OSS hochgeladen) |
| Aktuelle Modell- und Limit-Konfiguration anzeigen |
Die Erkennungswerkzeuge rufen die kostenpflichtige DashScope-API auf (Abrechnung nach Tokens, geringe Menge, niedriger Preis).
Generierungswerkzeuge rufen die kostenpflichtige Schnittstelle nur bei
confirm=truetatsächlich auf; beifalsewird nur der voraussichtliche Preis zurückgegeben (z. B. „Voraussichtlich 3,00 CNY (5 Sekunden × 0,6 CNY/Sekunde)“).Generierte Ergebnisse werden automatisch in ein lokales Ausgabeverzeichnis heruntergeladen (Standard:
~/Downloads/dsh-vision-dashscope, änderbar überDASH_VISION_OUTPUT_DIR) und der lokale Pfad wird zurückgegeben – in Kombination mit dsh-image-preview können sie direkt im Chat inline angezeigt werden.Bei Text-zu-Bild wird standardmäßig zusätzlich eine JPEG-Vorschau erstellt (
preview-Feld, längste Seite 1600 px / Qualität 85, konfigurierbar); das ursprüngliche PNG bleibt infileserhalten – das Inline-Limit für Bilder in DSH beträgt 5 MB; große PNGs (1792×2400 können 7 MB erreichen) führen bei direktem Inline-Einbetten zu 404; mit der JPEG-Vorschau werden sie normal angezeigt.
Related MCP server: jimeng_visual_generation
Installation
Erforderlich: Python 3.12+, uv. Kopieren Sie .env.example zu .env und tragen Sie den API-Key ein:
git clone https://github.com/ywleeo/dsh-vision-dashscope.git
cd dsh-vision-dashscope
cp .env.example .env # 填入 DASH_VISION_API_KEY
uv syncDer API-Key kann auch über die Umgebungsvariable DASH_VISION_API_KEY gesetzt werden (Fallback: OMNIMODAL_API_KEY / DASHSCOPE_API_KEY).
DSH-Anbindung
In ~/.dsh/profiles/web/cordis.patch.yml (Benutzer-Patch-Ebene) ergänzen:
- insert:
- id: mcp-vision-dashscope
name: '@deepseek-ai/dsh-mcp-client'
config:
serverName: vision-dashscope
transport: stdio
command: /Users/leeo/.local/bin/uv
args:
- run
- --directory
- /path/to/dsh-vision-dashscope
- dsh-vision-dashscope
failOnStartupError: falsedsh web neu starten. Nach der Verbindung erscheinen die Werkzeuge unter Namen wie mcp__vision-dashscope__recognize_video.
Prinzip des Hochladens großer Dateien (entscheidend für lange Videos)
GET /api/v1/uploads?action=getPolicy&model=<model>liefert die Upload-Berechtigung (inkl.upload_host, Signatur,max_file_size_mb);Multipart-Upload der Datei in den temporären OSS-Speicher, ergibt eine temporäre
oss://<key>-URL (gültig 48 h, kostenlos);Chat-Anfrage mit
video_url: {"url": "oss://..."}und HeaderX-DashScope-OssResourceResolve: enable; das Modell lädt serverseitig und dekodiert/extrahiert Frames.
Referenz: Temporäre Datei-URL über Datei-Upload erhalten (Alibaba Cloud Bailian-Dokumentation), Visuelles Verständnis (Video).
Konfiguration (Umgebungsvariablen / .env)
Variable | Standard | Beschreibung |
| — | API-Key (Fallback OMNIMODAL_API_KEY / DASHSCOPE_API_KEY) |
|
| Modell für Bilderkennung |
|
| Modell für Videoerkennung |
|
| Modell für kurze Audioinhalte |
|
| Modell für Transkription langer Audioinhalte |
|
| Base64-Schwelle für Videos; darüber OSS-Direktübertragung |
|
| Schwelle für Transkription langer Audioinhalte (Sekunden) |
|
| Text-zu-Bild-Modell (gilt analog für PRO/MAX-Stufe) |
|
| Text-zu-Video-Modell (MAX-Stufe happyhorse-1.1-t2v; gilt analog für I2V) |
|
| Verzeichnis für generierte Ergebnisse |
|
| Maximale Videodauer bei Generierung (Sekunden) |
|
| Ausgabelimit |
Test
uv run pytest -qLizenz
MIT
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- Flicense-qualityCmaintenanceMCP server enabling AI agents to generate AI videos and images, analyze video content, and download videos from Douyin and Xiaohongshu.
- AlicenseAqualityCmaintenanceMCP server for generating images and videos using Volcengine's Jimeng APIs, supporting text-to-image, image-to-image, multi-image fusion, text-to-video, and image-to-video.31MIT
- AlicenseAqualityDmaintenanceMCP server for AI-powered media generation: images, videos, audio, and upscaling using 99 AI models.6MIT
- Flicense-qualityDmaintenanceAn MCP server for generating images and videos via external multimodal models, providing unified tools like imageGenerate, videoGenerate, and materialWrite with support for normal and smart generation modes.
Related MCP Connectors
MCP server for Wan AI video generation
MCP server for Hailuo (MiniMax) AI video generation
MCP server for ByteDance Seedream AI image generation
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/ywleeo/dsh-vision-dashscope'
If you have feedback or need assistance with the MCP directory API, please join our Discord server