dLazy AIdLazy AI
模型参考音频模型

音频模型

浏览 @dlazy/cli 提供的音频模型。

  • doubao-tts — 字节跳动豆包语音合成模型。支持多语言、多音色和高度自然的流式音频输出,适合新闻播报与有声读物。
  • elevenlabs-dialogue — ElevenLabs eleven_v3 多人对白合成:为每行台词指定不同音色(最多 10 个),一次性生成完整对话音频。支持 [giggling]、[whispers] 等情绪标签,适合角色对白、播客与短剧。选择音色前,可以从 elevenlabs-search 检索合适的音色。
  • elevenlabs-music — ElevenLabs music_v1 音乐生成模型,根据自然语言提示生成 10–300 秒原创音乐。适合 BGM、广告配乐与短视频音轨。
  • elevenlabs-search — 搜索 ElevenLabs 人声库:按关键词、来源、分类筛选可用音色,返回每个音色的试听样本,便于挑选后用于 TTS 配音。只给一个英文描述词检索(如 deep / young / narrative);多给词只会收窄结果,整句通常一个都搜不到。
  • elevenlabs-sfx — ElevenLabs 文本生音效模型,根据描述生成 1–22 秒短音效。适合拟音、环境声、提示音与游戏音效。
  • elevenlabs-tts — ElevenLabs eleven_v3 文本转语音,提供 12 种精选英文/多语种音色,支持稳定性、相似度、风格控制。适合配音、有声内容与角色对话。选择音色前,可以从 elevenlabs-search 检索合适的音色。
  • elevenlabs-voice-clone — ElevenLabs 即时音色克隆(IVC),上传一段干净人声样本即可复刻自定义音色,可用于 ElevenLabs TTS 配音。
  • gemini-2.5-tts — 基于 Gemini 的高质量文本转语音。支持双语(中/英)和多种情感音色。
  • keling-sfx — 音效生成模型:可文本生音效,也可对参考视频生成配套音效/配乐。适合拟音、环境声与短视频声音补全。
  • keling-tts — 文本转语音模型(TTS),可设置语言、音色、语速与输出格式。适合配音旁白、有声内容和语音播报。
  • kling-audio-clone — 自定义音色(可灵),复刻音色用于生成配音或与主体绑定
  • qwen-audio-clone — 阿里云百炼 qwen3-tts 声音复刻,上传一段干净人声样本即可复刻自定义音色,可在后续 TTS 中使用。
  • qwen-tts — 阿里云百炼 qwen3-tts 文本转语音,支持系统音色(含方言)或通过自然语言描述自定义新音色(声音设计)。
  • suno-music — Suno V5.5 音乐生成模型。支持灵感模式(自动作词)和自定义模式(手动填曲风/标题/歌词),可生成包含人声或纯器乐的音乐,并通过风格权重、怪异度、音频权重细调输出。
  • vidu-audio-clone — 复刻真人音色,并使用该音色朗读指定文本。