analyze_media
Upload and analyze large or complex local media files—PDFs, videos, audio, images—via server-side extraction and model analysis when client Read fails or truncates content.
Instructions
Sube y analiza un archivo local mediante EnriProxy (extracción del lado servidor + análisis con modelo).
Cuándo usarla:
PDFs grandes (muchas páginas) o escaneados donde el Read del cliente puede truncar o perder contenido.
Video/audio u otros medios binarios que su cliente no puede leer con Read.
Archivos de audio en formatos comunes (mp3, wav, flac, m4a, aac, ogg/oga, opus, wma, weba, mka, aiff/aif/aifc, caf, m4b/m4r, mp1/mp2/mpa/mpga).
HEIC/AVIF/TIFF/APNG/SVG/documentos de Office cuando el Read del cliente es poco confiable.
Archivos muy grandes que requieren subidas reanudables (hasta 4GB).
PDFs/videos grandes: use
analysis_mode= 'multipass' para mejor cobertura (auto prefiere multipass para PDFs de más de 20 páginas).Para preguntas de video en un tiempo específico (por ejemplo, "¿qué pasa en 12:34?"), use
video.clip_start_secondsyvideo.clip_duration_seconds.
Reglas:
Use
pathpara un archivo, opathspara varias imágenes (capturas de UI/sets de fotos).path/pathsaceptan rutas absolutas en la máquina donde corre este servidor MCP (el cliente), o URLs http(s) que se descargan temporalmente en esa misma máquina (hasta 64 MiB; no se permiten hosts locales ni redes privadas).Requiere una API key válida de EnriProxy (env
ENRIPROXY_API_KEY, enviada como Authorization: Bearer ...).Prefiera el Read nativo del cliente sólo para texto/PDF/imágenes comunes pequeños y simples cuando funcione; prefiera esta herramienta para PDFs grandes.
Responda estrictamente con la salida de la herramienta; si faltan fotogramas/transcripción, dígalo.
Video: los fotogramas y la transcripción pertenecen a la MISMA línea de tiempo del video (no son imágenes sin relación).
Los GIF/WebP/APNG/SVG animados se convierten en fotogramas clave representativos.
Establezca
language(por ejemplo, 'es') para coincidir con el idioma del usuario y evitar deriva de idioma.
Depuración de capturas de UI (cuando el material sean capturas de pantalla de aplicaciones):
Abra con un veredicto de una línea en lenguaje claro (por ejemplo, 'el formulario de login renderiza correctamente' o 'el header se solapa con la barra lateral').
Describa zona por zona (header, barra lateral, contenido principal, modales, notificaciones), no como escena general.
Aproxime los colores como valores hex (por ejemplo, #1F6FEB) y nómbrelos; señale colores inesperados o inconsistentes.
Cuantifique defectos de layout: desbordes, recortes, solapamientos, desalineaciones, espaciados faltantes, texto cortado; estime magnitudes en píxeles cuando sea posible.
Transcriba textualmente etiquetas, botones y cualquier mensaje de error o estado visible.
Si la solicitud indica qué se esperaba, compare observado vs esperado de forma explícita.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| path | No | Ruta absoluta a un archivo local en la máquina donde corre el servidor MCP (por ejemplo, C:\\Users\\User\\Downloads\\video.mp4), o una URL http(s) de imagen/video/audio/PDF para descargar y analizar (hasta 64 MiB; hosts locales y redes privadas bloqueados). | |
| audio | No | Ajuste opcional de multipass para audio (se usa sólo al analizar archivos de audio). | |
| paths | No | Rutas absolutas a varios archivos de imagen locales o URLs http(s) (capturas de UI/sets de fotos; cada URL hasta 64 MiB). Cuando se proporcionan, EnriVision sube un único archivo de conjunto para procesamiento por lotes y reducción del lado servidor. | |
| video | No | Ajuste opcional de multipass para video. Se usa sólo al analizar videos. | |
| images | No | Ajuste opcional de multipass para conjuntos de imágenes (se usa sólo con `paths`). | |
| region | No | Región relativa de la IMAGEN original para analizar a resolución nativa (zoom). Coordenadas entre 0 y 1; (0,0) es la esquina superior izquierda. Use las cajas devueltas en 'elements' de un análisis previo de la misma imagen: NUNCA invente coordenadas. Ideal para leer texto pequeño (labels, código) que en la imagen completa comprimida resulta ilegible. Sólo imágenes (path, no paths). | |
| context | No | Pista opcional de análisis: ui, diagram, chart, error, code, meeting, tutorial, photo. Déjelo vacío para detección automática. | |
| document | No | Ajuste opcional de multipass para documentos (PDF). | |
| language | No | Código de idioma preferido de respuesta (ISO 639-1), por ejemplo 'es', 'en'. | |
| question | No | Pregunta explícita opcional que responder sobre el archivo. | |
| max_frames | No | Máximo opcional de fotogramas para videos (1-20) en modo single-pass. Para tiempos específicos, prefiera video.clip_start_seconds + video.clip_duration_seconds. Para multipass, use video.max_frames_per_segment. | |
| transcribe | No | Sobreescritura opcional para activar/desactivar la transcripción de audio en videos. | |
| analysis_mode | No | Selector opcional de modo de análisis: auto, single o multipass. | |
| transcription_language | No | Pista opcional de idioma para la transcripción de audio/video (por ejemplo, 'auto', 'es', 'en'). |