create_actor
Locks a character's voice by generating a reference sample; preview it, then actor_tts reuses that timbre for consistent dialogue across lines.
Instructions
给一个角色铸声(定妆), 之后用 actor_tts 让他说任意台词都保持同一个音色。
为什么要有这一步: 直接用文字描述合成语音, 那段描述只圈定一个大致的音色区间, 区间内每句台词各漂各的 —— 实测同 voice 同 seed 四句台词基频极差 125 Hz, 关掉采样走贪心反而涨到 242 Hz(音色是文本的函数, 不是采样随机性, 锁 seed 或 temperature 都锁不住)。本工具先用 voice 描述生成一段参考音, 之后所有台词 改由克隆模型照着这段参考音说, 音色与台词内容无关。实测极差降到 5 Hz。
重要: 铸完请先听那段试音, 确认是不是你要的那个人。铸砸了会把整个角色锁死在 错的音色上, 而且它之后每一句都错得很一致。不满意就 force=true 重铸。
参数: name: 角色名(字母/数字/下划线/连字符/中文, 1~40 字), 之后 actor_tts 用它指代 voice: 声音的自然语言描述, 英文效果最佳。写年龄/性别/音色/语速/情绪, 例如 "An elderly Chinese man, gravelly chest voice, commanding" sample_text: 铸声用的台词(可选)。默认用一段覆盖面较广的中文 seed: 随机种子(可选) force: 覆盖已有角色。会让该角色之前所有台词的音色对不上, 慎用
返回: 试音片段的本机路径 —— 先听再用
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| name | Yes | ||
| seed | No | ||
| force | No | ||
| voice | Yes | ||
| sample_text | No |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| ok | Yes | ||
| kind | No | actor | |
| name | No | ||
| seed | No | ||
| error | No | ||
| voice | No | ||
| warnings | No | ||
| truncated | No | ||
| error_code | No | ||
| transcript | No | ||
| ref_seconds | No | ||
| imported_from | No | ||
| source_format | No | ||
| reference_path | No |