AI工具箱

AI音频

AI语音合成与音频处理工具,共 19 个工具

Whisper
Whisper

Whisper是OpenAI开源的通用语音识别模型,能够将语音音频自动转录为文字文本,支持多达99种语言的识别。该模型在68万小时的多语言音频数据上训练,具备出色的鲁棒性和泛化能力,能够处理各种真实场景下的语音输入。Whisper采用编码器-解码器Transformer架构,支持语音识别、语音翻译、语言识别等多种任务。模型提供从tiny到large的多个规模版本,适应不同的精度和速度需求。作为目前最强大的开源语音识别模型之一,Whisper被广泛应用于字幕生成、会议记录、语音助手等场景。

101,682
GPT-SoVITS
GPT-SoVITS

GPT-SoVITS是一个开源的语音合成与声音克隆工具,支持通过少量语音样本实现高质量的声音克隆和文本转语音。它结合了GPT模型和SoVITS(基于Singing Voice的变声技术),仅需1分钟的训练音频即可克隆目标声音,支持中英日多语言合成。该工具提供了Web界面和API接口,支持实时语音合成和流式输出,广泛应用于配音、有声读物、虚拟主播等场景。

58,302
Coqui TTS
Coqui TTS

Coqui TTS是由Coqui AI开发的开源深度学习文本转语音工具包,提供了一套完整、易用的TTS开发框架。该项目集成了多种先进的语音合成模型架构,包括Tacotron、VITS、Glow-TTS等,用户可以方便地训练和部署自定义语音模型。Coqui TTS支持多语言语音合成、语音克隆、语音转换等高级功能,提供了统一的API接口和命令行工具。项目社区活跃,文档完善,是目前开源TTS领域最受欢迎的工具包之一,广泛应用于语音助手、有声内容、无障碍服务等场景。

45,595
ChatTTS
ChatTTS

ChatTTS 是由 2noise 开发的开源对话式语音合成模型,专为日常对话场景优化。支持中英双语,能生成包含笑声、停顿、语气词等自然对话元素的语音,让合成语音更接近真人对话效果。采用 10 万小时以上数据训练,提供精细的韵律控制能力,适合聊天机器人、语音助手等需要自然对话语音的应用场景。

39,490
Bark
Bark

Bark是由Suno AI开发的开源文本转语音(TTS)模型,能够生成高度自然和富有表现力的语音音频。与其他TTS模型不同的是,Bark不仅能生成语音,还能模拟笑声、叹息、哭泣等非语言声音,甚至可以生成音乐片段和音效。该模型基于GPT风格的Transformer架构,在大规模多语言语音数据上训练,支持包括中文在内的多种语言。Bark支持通过特殊标记控制说话者的情感、语速和风格,生成结果具有极强的自然感和表现力。作为开源TTS领域的创新之作,Bark为语音合成带来了全新的可能性。

39,238
RVC
RVC

RVC(Retrieval-based Voice Conversion)是一个基于检索增强的开源AI变声工具,能够将一个人的语音转换为另一个人的音色,同时保持原始的语调、情感和说话方式。该项目提供了直观的WebUI界面,用户只需少量的音频样本即可训练出高质量的变声模型。RVC采用检索增强技术,通过从参考音频中检索最匹配的声学特征来提升转换质量,有效减少了传统变声方法中的音质损失。项目支持实时变声和离线处理两种模式,广泛应用于直播变声、配音制作、音乐翻唱等场景。

35,952
Fish Speech
Fish Speech

Fish Speech 是 Fish Audio 开发的开源语音合成与声音克隆框架,支持中英日韩等多语言实时语音生成。仅需 10-30 秒参考音频即可克隆任意音色,推理延迟低至 150ms,支持流式输出。基于 VITS2 架构和大语言模型技术,提供 WebUI 和 API 两种使用方式,适合需要声音定制和实时语音交互的应用场景。

30,720
VoiceBox
VoiceBox

Voicebox是一款开源的本地优先AI语音工作室,集语音克隆、语音合成、语音听写和AI代理语音于一体。提供7个TTS引擎支持23种语言,可从几秒钟的音频样本中克隆任意声音。支持全局热键语音听写功能,可将语音输入到任意文本输入框中。集成MCP协议支持,可为AI代理赋予自定义声音。内置本地LLM用于文本润色和个人配置文件管理。完全本地运行,无需云服务,是ElevenLabs和WisprFlow的开源替代方案。提供桌面应用和API接口,支持跨平台使用。

29,331
AudioCraft
AudioCraft

AudioCraft是Meta(Facebook)Research开源的AI音频生成框架,基于PyTorch构建,集成了MusicGen、AudioGen和EnCodec三大核心模型。MusicGen可根据文本描述生成高质量音乐,AudioGen专注于音效和环境声生成,EnCodec则提供高保真音频编解码能力。该框架支持文本到音频的端到端生成,无需复杂的多阶段处理流程,开发者可通过简单的API调用实现音乐创作、音效合成、音频压缩等功能。AudioCraft采用MIT许可证发布,支持自定义数据集微调训练,是目前开源音频AI领域最完整的工具包之一,适用于音乐制作、游戏音效、影视后期等专业场景。

23,409
Dia
Dia

Dia是由Nari Labs开发的1.6B参数文本转语音模型,能够直接从对话脚本生成高度逼真的双人对话音频。支持通过音频条件控制输出的情感和语调,可生成笑声、咳嗽、清嗓子等非语言声音。采用[S1]和[S2]说话人标记系统,支持单次推理生成完整的双人对话。模型权重托管在Hugging Face,提供ZeroGPU在线试用空间。支持通过Hugging Face Transformers直接调用,提供Gradio演示界面。目前仅支持英语生成,已发布更大版本的Dia2模型。采用Apache 2.0开源协议,社区活跃。

19,372
Tortoise TTS
Tortoise TTS

Tortoise TTS是一个高质量的开源文本转语音系统,以生成极其自然和逼真的语音著称。它采用了基于扩散模型的架构,通过多阶段生成流程实现高质量的语音合成,特别擅长保持说话人的声音特征和情感表达。Tortoise TTS支持声音克隆功能,可使用参考音频引导生成风格一致的语音,适用于对音质要求较高的专业场景。

15,063
Kokoro TTS
Kokoro TTS

Kokoro TTS 是由 hexgrad 开发的开源文本转语音模型,仅 82M 参数即可实现高质量语音合成。支持中文、英文、日文、韩文等多种语言,可在 CPU 上实时运行,无需 GPU 即可获得自然流畅的语音输出。模型体积小巧、部署简单,适合需要本地化 TTS 方案的开发者和企业,是目前开源社区中性价比最高的轻量级语音合成方案之一。

15,062