generate_audio
Turn written text into spoken audio using TTS models, with adjustable voice, speed, and style. Supports voice cloning for personalized output.
Instructions
Generate speech audio from text using TTS models
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| seed | No | Seed for reproducible generation | |
| text | Yes | Text to convert to speech | |
| model | No | TTS model to use (dia-tts or orpheus-tts) | |
| top_p | No | Controls word variety (0.1-1.0, higher = rarer words) | |
| voice | No | Voice selection for TTS (orpheus: tara, dan, josh, emma) | |
| cfg_scale | No | How strictly to follow text (1-5, dia only) | |
| input_audio | No | Base64 audio for voice cloning (dia only) | |
| temperature | No | Controls randomness/expressiveness (0.1-2.0) | |
| display_mode | No | How to return the audio: display (show audio), save (return base64 for saving), both (show audio and provide base64) | display |
| speed_factor | No | Playback speed (0.5-1.5). Default 0.94 = normal speech. Try 0.8 for slower, 1.1 for faster | |
| save_location | No | Directory path to save the audio. Overrides default save location. | |
| max_new_tokens | No | Maximum tokens (controls audio length - higher = longer audio) | |
| cfg_filter_top_k | No | Token filtering (10-100, dia only) | |
| repetition_penalty | No | Penalty for repeated phrases (1.0-2.0, orpheus only) |