VibeVoiceFusion
VibeVoiceFusion 是一个Web 应用,用于生成高质量、多说话人的合成语音,具备声音克隆功能。基于微软的 VibeVoice 模型(AR + 扩散架构),本项目提供完整的全栈解决方案,包含直观的用户界面、项目管理和先进的显存优化功能。
痛点:
- 提供无需编程知识的友好界面进行语音生成 本项目增强功能
- 优化显存使用,支持消费级 GPU(8GB+ 显存)本项目增强功能
- 支持双语工作流(英语/中文)本项目增强功能
- 提供 Web 界面和命令行界面以适应不同使用场景 本项目增强功能
- 支持高效的多说话人对话合成,保持不同说话人的独特声音特征
亮点:
- 量化技术:Float8 (FP8 E4M3FN) 支持,显存减少约 50%,质量损失极小,运行时动态扩展bf16 精度,本项目增强功能
- 层卸载:动态 CPU/GPU 内存管理,可在有限显存上运行, 本项目增强功能
- 注意力机制:PyTorch 原生 SDPA,最大化兼容性
- 模型架构:Qwen 主干网络 + VAE 声学分词器 + 语义编码器 + 扩散头
功能特性
完整的 Web 应用
- 说话人/声音管理:
- 上传和管理参考语音样本(WAV、MP3、M4A、FLAC、WebM)
- 音频预览与播放控制
- 声音文件替换,自动缓存清除
- 音频裁剪功能
- 对话编辑器:
- 可视化编辑器,支持拖拽重排对话行
- 文本编辑模式用于批量编辑
- 支持多说话人对话(最多 4+ 个说话人)
- 实时预览和验证
- 生成系统:
- 基于队列的任务管理(防止 GPU 冲突)
- 实时进度监控与动态更新
- 可配置参数(CFG scale、随机种子、模型精度)
- 生成历史记录,支持过滤、排序和分页
- 完成的生成可播放和下载
项目地址:https://github.com/zhao-kun/VibeVoiceFusion
VibeVoiceFusion
VibeVoiceFusion 是一个Web 应用,用于生成高质量、多说话人的合成语音,具备声音克隆功能。基于微软的 VibeVoice 模型(AR + 扩散架构),本项目提供完整的全栈解决方案,包含直观的用户界面、项目管理和先进的显存优化功能。
痛点:
亮点:
功能特性
完整的 Web 应用
项目地址:https://github.com/zhao-kun/VibeVoiceFusion