ffmpeg__process_audio_for_stt
Convert audio or video input into a Whisper/STT-ready audio file by normalizing sample rate, channels, and removing silence for effective speech transcription.
Instructions
Build a Whisper/STT-ready compact audio output from either audio or video input. @remarks Returns a JSON summary in stdout with output_path and normalization parameters for LLM-friendly parsing. @param input_path Source media path (video or audio). @param output_path Destination audio path. @param start_time Optional start timestamp (for example 00:04:30). @param end_time Optional end timestamp (for example 00:05:30). @param sample_rate Output sample rate in Hz, default 16000. @param channels Output channels count, default 1. @param remove_silence Whether to remove long silent regions, default true. @param audio_format Output container format, default mp3. @param __mcp_response_mode Optional response mode: content (default) or structuredContent.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| channels | No | ||
| end_time | No | ||
| input_path | Yes | ||
| start_time | No | ||
| output_path | Yes | ||
| sample_rate | No | ||
| audio_format | No | ||
| remove_silence | No | ||
| __mcp_response_mode | No | content |