Voice Clone
在 Voice Clone 中输入待合成文本,上传或录制一段清晰的 3–10 秒参考音频,可选填对应文本,然后生成并下载 24 kHz 音频。
OmniVoice · k2-fsa
OmniVoice 是 k2-fsa 团队的多语言语音模型,支持 646 种语言。在官方 Demo 中体验零样本声音克隆和声音设计。
正在加载工具…
公共 ZeroGPU 演示有共享 GPU 额度和排队限制。Hugging Face 可能要求登录,额度耗尽后需要稍后再试。Wan2.Video 不收取此页面的访问费用。
在 Voice Clone 中输入待合成文本,上传或录制一段清晰的 3–10 秒参考音频,可选填对应文本,然后生成并下载 24 kHz 音频。
在 Voice Design 中无需参考录音即可设计声音,自由组合性别、年龄、音高、口音或方言、耳语等属性。声音设计在中文和英文中表现更稳定。
在文本中加入 [laughter]、[sigh] 等标签生成非语言声音。中文可用带声调数字的拼音纠正发音,英文可用方括号中的 CMU 音素纠正发音。
模型约 0.6B 参数。官方报告最低 RTF 为 0.025,约为实时速度的 40 倍;免费 Demo 的实际速度还取决于排队和硬件。
公共 ZeroGPU 演示有共享 GPU 额度和排队限制。Hugging Face 可能要求登录,额度耗尽后需要稍后再试。Wan2.Video 不收取此页面的访问费用。
输入直接交给所选的 Hugging Face Space,处理与保存方式由维护者决定。本站说明已翻译,演示内部界面的语言由维护者提供。
重新加载工作区,或切换可用的备用线路。如果 GPU 额度已用完,请等待恢复,或尝试相关工具。