Skip to content

请支持 audio.cpp 作为本地 ASR + TTS / 声音克隆后端 #618

Description

@0xShug0

大家好!我是 [audio.cpp](https://github.com/0xShug0/audio.cpp) 的维护者。

我注意到 LiveTalking 已经支持多个本地 TTS/声音克隆引擎,也看到了 #601 中关于加入 FunASR 的讨论。所以我在想,audio.cpp 是否可以作为一个统一的本地音频后端。

audio.cpp 目前已经支持 70+ 个音频模型,其中包括 15 个 ASR 模型和 38 个 TTS/声音克隆模型,并且还在通过社区贡献持续扩展。其中一些 ASR 集成由官方模型团队直接贡献,包括 Mistral AI、FunASR、IBM 和 Microsoft 的团队。

TTS 方面,目前支持 Qwen3-TTS、IndexTTS 2/2.5、Higgs Audio TTS v3、Fish Audio、PocketTTS、VibeVoice 等模型。

这些模型都可以通过同一个 C++ runtime 在本地运行,并针对 CUDA、Metal、Vulkan 和 HIP 做了性能优化。性能方面,audio.cpp 通常比对应的 Python 实现快 2~8 倍,并且我们的社区还在持续推动热门模型的性能优化。

audio.cpp 推理本身完全不依赖 Python,同时提供 Server API 和 CLI 支持,因此 LiveTalking 可以通过一个统一后端接入多种本地 TTS、声音克隆和 ASR 模型。

不知道你们是否会对这种集成方式感兴趣?关于 audio.cpp 的任何问题我都很乐意回答。

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions