doubao-tts
ByteDance Doubao speech synthesis model. Supports multiple languages, voices, and highly natural streaming audio output, suitable for news broadcasts and audiobooks.
ByteDance Doubao speech synthesis model. Supports multiple languages, voices, and highly natural streaming audio output, suitable for news broadcasts and audiobooks.
Overview
| Field | Value |
|---|---|
| Model ID | doubao-tts |
| CLI | dlazy doubao-tts |
| MCP | doubao-tts (Claude Code surfaces this as mcp__dlazy__doubao-tts) |
| Type | audio |
| Execution | Async task; the CLI polls until completion (--no-wait returns generateId immediately) |
| Batch | Supports --batch <n> parallel fan-out |
Parameters
| Arg | Type | Required | Notes |
|---|---|---|---|
prompt | string | Yes | Prompt |
voice_language | "zh-cn" | "en" | No | Voice Language; default "zh-cn" |
voiceId | string | No | Voice ID Options depend on "voice_language"; default "zh_female_shuangkuaisisi_uranus_bigtts"; options depend on --voice_language (see "Dynamic Options") |
speed_ratio | "0.8" | "1.0" | "1.2" | "1.5" | "2.0" | No | Speed Ratio; default "1.0" |
--input @file.jsonor--input '{...}'can supply all args at once; flags take precedence over--inputkeys.
CLI Examples
dlazy doubao-tts --help
dlazy doubao-tts --prompt "Write your prompt here"
dlazy doubao-tts --prompt "Write your prompt here" --dry-run
dlazy doubao-tts --prompt "Write your prompt here" --no-wait
dlazy doubao-tts --prompt "Write your prompt here" --batch 4MCP
MCP is consumed by AI clients, not handwritten. Once dLazy is registered as an MCP server the tool appears in the client's tool list — Claude Code surfaces it as mcp__dlazy__doubao-tts; generic clients (e.g. OpenClaw) call it as doubao-tts.
See MCP setup for how to add the server.
Output
{
"outputs": [
{ "type": "audio", "id": "o_...", "url": "https://files.dlazy.com/result.mp3", "mimeType": "audio/mpeg" }
]
}Media tools emit image / video / audio / file outputs. Use --output url to print only the URLs on stdout.
Dynamic Options
--voiceId (depends on --voice_language)
when --voice_language zh:
| ID | Name |
|---|---|
zh_female_vv_uranus_bigtts | Vivi 2.0 |
zh_female_xiaohe_uranus_bigtts | 小何 2.0 |
zh_male_m191_uranus_bigtts | 云舟 2.0 |
zh_male_taocheng_uranus_bigtts | 小天 2.0 |
zh_male_liufei_uranus_bigtts | 刘飞 2.0 |
zh_male_sophie_uranus_bigtts | 魅力苏菲 2.0 |
zh_female_qingxinnvsheng_uranus_bigtts | 清新女声 2.0 |
zh_female_cancan_uranus_bigtts | 知性灿灿 2.0 |
zh_female_sajiaoxuemei_uranus_bigtts | 撒娇学妹 2.0 |
zh_female_tianmeixiaoyuan_uranus_bigtts | 甜美小源 2.0 |
zh_female_tianmeitaozi_uranus_bigtts | 甜美桃子 2.0 |
zh_female_shuangkuaisisi_uranus_bigtts | 爽快思思 2.0 |
zh_female_peiqi_uranus_bigtts | 佩奇猪 2.0 |
zh_female_linjianvhai_uranus_bigtts | 邻家女孩 2.0 |
zh_male_shaonianzixin_uranus_bigtts | 少年梓辛/Brayan 2.0 |
zh_male_sunwukong_uranus_bigtts | 猴哥 2.0 |
zh_female_yingyujiaoxue_uranus_bigtts | Tina老师 2.0 |
zh_female_kefunvsheng_uranus_bigtts | 暖阳女声 2.0 |
zh_female_xiaoxue_uranus_bigtts | 儿童绘本 2.0 |
zh_male_dayi_uranus_bigtts | 大壹 2.0 |
zh_female_mizai_uranus_bigtts | 黑猫侦探社咪仔 2.0 |
zh_female_jitangnv_uranus_bigtts | 鸡汤女 2.0 |
zh_female_meilinvyou_uranus_bigtts | 魅力女友 2.0 |
zh_female_liuchangnv_uranus_bigtts | 流畅女声 2.0 |
zh_male_ruyayichen_uranus_bigtts | 儒雅逸辰 2.0 |
saturn_zh_female_keainvsheng_tob | 可爱女生 |
saturn_zh_female_tiaopigongzhu_tob | 调皮公主 |
saturn_zh_male_shuanglangshaonian_tob | 爽朗少年 |
saturn_zh_male_tiancaitongzhuo_tob | 天才同桌 |
saturn_zh_female_cancan_tob | 知性灿灿 |
saturn_zh_female_qingyingduoduo_cs_tob | 轻盈朵朵 2.0 |
saturn_zh_female_wenwanshanshan_cs_tob | 温婉珊珊 2.0 |
saturn_zh_female_reqingaina_cs_tob | 热情艾娜 2.0 |
when --voice_language en:
| ID | Name |
|---|---|
timen_male_tim_uranus_bigtts | Timen |
en_female_dacey_uranus_bigtts | Dacey |
en_female_stokie_uranus_bigtts | Stokie |
Audio Models
Browse audio models exposed by @dlazy/cli.
elevenlabs-dialogue
ElevenLabs eleven_v3 multi-voice dialogue: assign a different voice per line (up to 10) and render the whole conversation in one shot. Supports audio tags like [giggling], [whispers] — great for character dialogue, podcasts, and short skits. Before picking a voice, you can search for the right one via elevenlabs-search.