Skip to content

【开源自荐】VibeVoiceFusion, 一站式多说话人语音生成系统 #8030

Description

@zhao-kun

VibeVoiceFusion

VibeVoiceFusion 是一个Web 应用,用于生成高质量、多说话人的合成语音,具备声音克隆功能。基于微软的 VibeVoice 模型(AR + 扩散架构),本项目提供完整的全栈解决方案,包含直观的用户界面、项目管理和先进的显存优化功能。

痛点:

  • 提供无需编程知识的友好界面进行语音生成 本项目增强功能
  • 优化显存使用,支持消费级 GPU(8GB+ 显存)本项目增强功能
  • 支持双语工作流(英语/中文)本项目增强功能
  • 提供 Web 界面和命令行界面以适应不同使用场景 本项目增强功能
  • 支持高效的多说话人对话合成,保持不同说话人的独特声音特征

亮点:

  • 量化技术:Float8 (FP8 E4M3FN) 支持,显存减少约 50%,质量损失极小,运行时动态扩展bf16 精度,本项目增强功能
  • 层卸载:动态 CPU/GPU 内存管理,可在有限显存上运行, 本项目增强功能
  • 注意力机制:PyTorch 原生 SDPA,最大化兼容性
  • 模型架构:Qwen 主干网络 + VAE 声学分词器 + 语义编码器 + 扩散头

功能特性

完整的 Web 应用

  • 项目管理:使用元数据和描述组织语音生成项目
Image
  • 说话人/声音管理
    • 上传和管理参考语音样本(WAV、MP3、M4A、FLAC、WebM)
    • 音频预览与播放控制
    • 声音文件替换,自动缓存清除
    • 音频裁剪功能
Image
  • 对话编辑器
    • 可视化编辑器,支持拖拽重排对话行
    • 文本编辑模式用于批量编辑
    • 支持多说话人对话(最多 4+ 个说话人)
    • 实时预览和验证
Image
  • 生成系统
    • 基于队列的任务管理(防止 GPU 冲突)
    • 实时进度监控与动态更新
    • 可配置参数(CFG scale、随机种子、模型精度)
    • 生成历史记录,支持过滤、排序和分页
    • 完成的生成可播放和下载
Image

项目地址:https://github.com/zhao-kun/VibeVoiceFusion

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions