全部工具
共收录 537 个AI工具
PhotoMaker是腾讯ARC团队开发的AI定制化照片生成工具,能够基于少量参考照片生成特定人物的高质量图像。它支持将人物身份与各种风格、场景、服装进行自由组合,生成逼真的定制化照片。支持多人物融合、年龄变换、风格迁移等创意功能。相比传统AI换脸,PhotoMaker在保持人物身份的同时能生成更多样化的创意内容。适合个人写真、虚拟形象、内容创作等场景。
IP-Adapter是由腾讯AI Lab开发的图像提示适配器技术,能够将参考图像的语义信息注入到扩散模型的生成过程中。与传统的图像到图像转换不同,IP-Adapter通过解耦的交叉注意力机制,实现文本提示和图像提示的独立控制和灵活组合。支持图像风格迁移、主体保持、场景生成等多种应用。可作为插件集成到Stable Diffusion WebUI和ComfyUI中使用,扩展性强。
AnimateDiff是由Guoyww开发的AI动画生成框架,能够将Stable Diffusion的静态图像生成能力扩展到动画和视频领域。它通过注入运动模块到扩散模型中,使文本到图像模型具备生成动画的能力。支持文生动画、图生动画等多种模式,可生成2-4秒的短动画。与ControlNet等技术结合可实现更精确的动画控制。适合创作者快速生成GIF动图、短视频等动画内容。
sd-webui-controlnet是Stable Diffusion WebUI的ControlNet扩展插件,由Mikubill开发维护。ControlNet是一种革命性的神经网络结构,允许用户通过边缘图、深度图、姿态骨骼图、语义分割图等多种条件输入精确控制AI图像生成过程。该插件将ControlNet无缝集成到AUTOMATIC1111的Stable Diffusion WebUI中,支持多ControlNet单元同时使用,提供丰富的预处理器和模型选择。用户可以在不改变整体构图的前提下调整细节,实现从草稿到成品的精确控制,大幅提升了AI绘画的可控性和实用性,是目前最受欢迎的SD扩展之一。
kohya-ss/sd-scripts是Stable Diffusion模型训练工具集,由日本开发者kohya-ss创建维护。该工具集提供了LoRA、DreamBooth、Textual Inversion、Hypernetwork等多种微调训练方法的完整实现,是目前Stable Diffusion社区最主流的训练框架之一。支持SD1.5、SDXL、SD3等多个版本的模型训练,提供详细的参数配置和灵活的训练流程控制。用户可以使用自己的图片数据集训练专属风格模型或角色模型,广泛应用于个性化AI图像生成领域。配合GUI界面使用更加便捷,是AI绘画从业者和爱好者的必备训练工具。
Stable Video Diffusion是由Stability AI推出的开源AI视频生成模型,基于Stable Diffusion的图像生成能力扩展到视频领域。该模型采用潜空间扩散架构,能够从单张图片生成高质量的动态视频,也支持文本到视频的生成。SVD模型在大规模视频数据集上训练,具备出色的运动建模能力和视觉质量。项目在Stability AI的generative-models仓库中开源,提供多个版本的模型权重,支持不同分辨率和帧率的视频生成。作为Stable Diffusion生态系统的重要扩展,SVD为开源视频生成奠定了坚实基础。
CogVideo是由清华大学KEG实验室(THUDM)开发的开源AI视频生成模型,是CogVLM多模态大模型系列的视频生成成员。该模型基于Transformer架构,能够根据文本描述生成高质量的视频内容,支持中英文双语提示词输入。CogVideo经历了多个版本迭代,最新版本在视频质量、时长和语义一致性方面都有显著提升。项目提供了完整的训练和推理代码,支持从预训练模型直接使用或进行自定义微调。作为国内顶尖高校的开源成果,CogVideo在中文场景理解方面具有独特优势。
ModelScope(魔搭社区)是由阿里巴巴达摩院推出的开源AI模型开放平台,是国内最大的AI模型社区之一。平台汇聚了数千个开源AI模型,覆盖自然语言处理、计算机视觉、语音处理、多模态等多个领域。用户可以通过统一的API接口便捷地调用和部署各类模型,也可以上传和分享自己的模型。ModelScope提供免费的在线推理和模型训练资源,降低了AI技术的使用门槛。平台支持主流深度学习框架,提供丰富的模型文档和示例代码,是国内AI开发者和研究者的重要基础设施。
Bark是由Suno AI开发的开源文本转语音(TTS)模型,能够生成高度自然和富有表现力的语音音频。与其他TTS模型不同的是,Bark不仅能生成语音,还能模拟笑声、叹息、哭泣等非语言声音,甚至可以生成音乐片段和音效。该模型基于GPT风格的Transformer架构,在大规模多语言语音数据上训练,支持包括中文在内的多种语言。Bark支持通过特殊标记控制说话者的情感、语速和风格,生成结果具有极强的自然感和表现力。作为开源TTS领域的创新之作,Bark为语音合成带来了全新的可能性。
Coqui TTS是由Coqui AI开发的开源深度学习文本转语音工具包,提供了一套完整、易用的TTS开发框架。该项目集成了多种先进的语音合成模型架构,包括Tacotron、VITS、Glow-TTS等,用户可以方便地训练和部署自定义语音模型。Coqui TTS支持多语言语音合成、语音克隆、语音转换等高级功能,提供了统一的API接口和命令行工具。项目社区活跃,文档完善,是目前开源TTS领域最受欢迎的工具包之一,广泛应用于语音助手、有声内容、无障碍服务等场景。
RVC(Retrieval-based Voice Conversion)是一个基于检索增强的开源AI变声工具,能够将一个人的语音转换为另一个人的音色,同时保持原始的语调、情感和说话方式。该项目提供了直观的WebUI界面,用户只需少量的音频样本即可训练出高质量的变声模型。RVC采用检索增强技术,通过从参考音频中检索最匹配的声学特征来提升转换质量,有效减少了传统变声方法中的音质损失。项目支持实时变声和离线处理两种模式,广泛应用于直播变声、配音制作、音乐翻唱等场景。
AudioCraft是Meta(Facebook)Research开源的AI音频生成框架,基于PyTorch构建,集成了MusicGen、AudioGen和EnCodec三大核心模型。MusicGen可根据文本描述生成高质量音乐,AudioGen专注于音效和环境声生成,EnCodec则提供高保真音频编解码能力。该框架支持文本到音频的端到端生成,无需复杂的多阶段处理流程,开发者可通过简单的API调用实现音乐创作、音效合成、音频压缩等功能。AudioCraft采用MIT许可证发布,支持自定义数据集微调训练,是目前开源音频AI领域最完整的工具包之一,适用于音乐制作、游戏音效、影视后期等专业场景。