首页 / 开源热榜 / OmniVoice / 使用教程

OmniVoice 中文教程:先跑通 Auto Voice,再碰语音克隆

官方资料核对:2026-09-23 · 文档核对,未安装、未下载模型

OmniVoice 是 k2-fsa 的多语言零样本文本转语音模型。它把自动选声、音色设计和语音克隆放进同一套 Python API 与 CLI。官方称支持 600 多种语言,也提供 Gradio 页面和多 GPU 批处理命令。

当前版本:GitHub Releases 把 0.2.1 标为 Latest,页面显示 2026-07-16 发布;主分支 pyproject.toml 也是 0.2.1,要求 Python 3.10 或更高版本。

1. 先选硬件,再装稳定版

官方建议使用全新虚拟环境。PyTorch 要按实际硬件安装:NVIDIA 用户选择匹配的 CUDA wheel;Apple Silicon 的官方示例使用 torch 2.8.0 与 torchaudio 2.8.0;Intel XPU 需要驱动和专用 wheel,且会从 flash_attn 回退到 SDPA。

python3 -m venv .venv
source .venv/bin/activate
python --version

# 先按 PyTorch 官方页面安装与你硬件匹配的 torch / torchaudio
pip install omnivoice

pip install omnivoice 是官方给出的 PyPI 稳定版入口。直接安装 GitHub 主分支会跟随未发布代码,复现实验时应记录 commit。

2. Web 界面只绑定本机

官方快速开始把 demo 绑定到 0.0.0.0。这个地址会监听所有网络接口。个人试用时改成 127.0.0.1,确认防火墙、访问控制和模型下载目录后再考虑局域网访问。

omnivoice-demo --ip 127.0.0.1 --port 8001

第一次加载会取用预训练模型。下载大小、显存占用和启动时间需要在自己的机器上观察,本页没有替你跑模型。

3. 三种模式怎么选

Auto Voice 只接收文本,由模型选声,适合验证环境。Voice Design 用年龄、音高、英语口音或中文方言等属性描述声音;官方提醒它主要用中英文数据训练,其他语言可能不稳。Voice Cloning 从参考音频提取音色,风险最高,只能用于本人声音或已明确授权的素材。

omnivoice-infer \
  --model k2-fsa/OmniVoice \
  --text "这是一次不含个人信息的测试。" \
  --output auto-voice.wav

这条官方 CLI 形式不传 ref_audioinstruct,会走 Auto Voice。确认文件能生成后,再用自己的测试集检查发音、停顿、数字和目标语言。官方的 RTF 最低 0.025 属于项目报告值,不能当成你机器上的速度承诺。

4. 授权语音克隆的边界

官方建议参考音频控制在 3 至 10 秒。省略 ref_text 时,Whisper 会自动转写;这可能再加载一个 ASR 模型。0.2.1 可用 asr_device 指定它运行在哪个设备,也能用 VoiceClonePrompt.save/load 保存和复用音色提示。

权限与安全:不要克隆未授权的真人声音,不要用合成音频冒充、诈骗或绕过身份核验。参考音频与保存的提示文件都应按敏感数据管理。对外发布时标注合成来源,并保留授权与生成记录。

跨语言克隆可能带入参考音频语言的口音。600 多种语言是覆盖范围,不代表每种语言的自然度相同。至少用母语者可理解度、专名读音、数字、长句稳定性和多次生成一致性做单独验收。

5. 相比 OpenVoice 怎么选

相比 OpenVoice V2,OmniVoice 官方主打 600 多种语言、Auto Voice、Voice Design、可保存克隆提示和批量推理。OpenVoice V2 官方列出英语、西班牙语、法语、中文、日语、韩语六种原生语言,重点是音色克隆、风格控制与跨语言克隆,并采用 MIT 许可。选择前应在同一批授权样本上比较音质、延迟、显存和失败样例。

6. 验证状态与验证边界

验证状态:本轮只核对 官方 README、pyproject.toml、0.2.1 release 和 OpenVoice 官方 README。没有安装包、下载模型或处理音频。

验证边界:模型下载、显存、音质、语言覆盖、RTF、Whisper 转写、Web 界面、CLI 和硬件兼容性均未本机实测。页面中的性能数字保留“官方报告”属性,实际选型应重新跑自己的授权语料。

这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。

先判断这个项目是否适合你

近期变化与关注原因

它把广语言覆盖、短参考音频克隆、可描述的音色设计和多硬件后端放在同一套接口中。这些数值只用于判断持续搜索需求,不能当作独立用户数。

原教程未展开的系统信息

核心功能

  • 三种语音生成方式

    自动选声不需要参考音频;语音设计用年龄、音高、口音等属性描述声音;语音克隆从短参考音频提取音色。三种方式共用 generate API,也可从 CLI 调用。

  • 发音与非语言声音控制

    输入中可加入 laughter、sigh 等标签;中文可用带声调数字的拼音纠音,英文可用 CMU 词典格式的音素覆盖读音。数字、日期与货币规范化是可选功能。

  • 多硬件与批量推理

    官方安装说明覆盖 NVIDIA CUDA、Apple Silicon 和 Intel XPU。Intel XPU 不支持 flash_attn,会回退到 SDPA;批量 CLI 可把推理分配到多张 GPU。

架构与数据流

OmniVoice 从 Hugging Face 加载预训练模型,把文本与可选的参考音频、参考文本或音色属性送入统一的 generate 接口。语音克隆会形成可保存的 VoiceClonePrompt;未提供参考文本时,Whisper 负责转写。输出是 24 kHz 波形数组。项目同时封装 Gradio demo、单条推理 CLI 和多 GPU 批处理 CLI。官方把核心模型描述为扩散语言模型式架构。

技术栈和运行条件

语言

Python

框架

PyTorch、Transformers 与 Hugging Face 预训练模型

关键依赖

  • torch>=2.4
  • torchaudio>=2.4
  • transformers>=5.3.0
  • accelerate
  • soundfile
  • gradio

运行环境

Python >=3.10;NVIDIA CUDA、Apple Silicon 或 Intel XPU;PyPI 包和 uv 安装;Apache-2.0 许可

常见问题

OmniVoice 当前版本和 Python 要求是什么?

2026-09-23 核对时,GitHub Latest release 与主分支 pyproject.toml 都是 0.2.1;pyproject.toml 要求 Python 3.10 或更高版本。

OmniVoice 不写 ref_text 也能克隆吗?

可以。官方示例说明省略 ref_text 后会用 Whisper 自动转写参考音频;0.2.1 还支持指定 asr_model_name 和 asr_device。首次使用可能下载额外 ASR 模型,应检查网络、磁盘与数据处理边界。

OmniVoice 的 600 多种语言都一样稳定吗?

官方声明的是语言覆盖,不是逐语言质量保证。Voice Design 主要在中文和英文数据上训练,其他语言的低资源或边界输入可能不稳定;跨语言克隆还可能带入参考音频语言的口音。

怎样降低 OmniVoice 被用于声音冒充的风险?

只使用本人声音或已取得明确授权的素材,保存授权与生成记录,对外内容标注为合成语音。Web 界面本机试用时绑定 127.0.0.1,不要直接暴露到公网,并限制参考音频和保存提示文件的访问权限。