AI工具箱
parlor

parlor

免费
AI音频209 次浏览

parlor 是什么?

Parlor是一个完全在设备本地运行的实时多模态AI应用,支持自然语音和视觉对话。使用Google的Gemma 4 E2B模型理解语音和视觉,Kokoro模型进行文本转语音,所有处理都在本地完成。你可以对着摄像头说话,AI会理解你的语音和画面内容并语音回复。支持浏览器端语音活动检测(免按键)、打断AI说话、句子级TTS流式播放。在Apple M3 Pro上端到端延迟约2.5-3秒,解码速度约83 tokens/秒。

parlor 详细介绍

【工具简介】Parlor是一个完全在设备本地运行的实时多模态AI助手,支持语音和视觉对话,无需联网或服务器。

核心功能

  • 本地多模态理解:使用Gemma 4 E2B模型同时理解语音输入和摄像头画面
  • 本地语音合成:使用Kokoro模型在设备端生成自然语音回复,Mac使用MLX加速,Linux使用ONNX
  • 免按键交互:浏览器端集成Silero VAD语音活动检测,无需按住按钮即可自然对话
  • 打断功能:支持在AI说话时直接开口打断,实现更自然的对话体验
  • 流式TTS:句子级流式播放,音频在完整响应生成前就开始播放
  • 适用场景

    1. 语言学习者通过与AI对话练习口语,可指向物体用摄像头展示并讨论

    2. 隐私敏感场景下的AI助手使用,所有处理在本地完成,数据不离开设备

    3. 无网络环境下的AI交互,如偏远地区或网络受限场所

    快速入门

    1. 克隆仓库:git clone https://github.com/fikrikarim/parlor.git

    2. 安装依赖:cd src && uv sync

    3. 启动服务:uv run server.py(首次运行会自动下载约2.6GB模型)

    4. 打开http://localhost:8000,授权摄像头和麦克风,开始对话

    优缺点分析

    优点:

  • 完全本地运行,无需联网,数据隐私有保障
  • 支持语音+视觉多模态输入,交互体验丰富
  • 端到端延迟约2.5-3秒,在Apple Silicon上性能表现优秀
  • 缺点:

  • 需要Apple Silicon或支持GPU的Linux,硬件要求较高
  • 目前处于研究预览阶段,存在粗糙边缘和bug
  • 需要约3GB空闲RAM,对内存有一定要求
  • 适合人群

    1. 注重数据隐私、希望AI处理完全在本地完成的用户

    2. 语言学习者,特别是希望通过视觉辅助进行口语练习的人群

    3. 对端侧AI技术感兴趣的开发者和研究人员

    parlor 使用教程

    Parlor 入门教程:本地运行的实时多模态AI对话

    入门10分钟
    Parlor是一款完全在设备本地运行的实时多模态AI应用,支持自然语音和视觉对话,无需联网即可使用,保护隐私的同时提供流畅的AI交互体验。 一、快速开始 1. 访问Parlor的GitHub项目页面,按照说明下载对应平台的安装包。建议设备配置为Apple Silicon Mac(M系列芯片)或配备独立显卡的PC以获得最佳体验。 2. 首次启动时,应用会自动下载所需的AI模型文件(Gemma 4 E2B用于语音和视觉理解,Kokoro用于文本转语音),下载完成后所有处理均在本地进行。 3. 打开浏览器访问应用提供的本地地址,允许麦克风和摄像头权限后即可开始对话。无需注册账号,打开即用。 二、核心功能演示 功能1:免按键语音对话 Parlor内置浏览器端语音活动检测(VAD),打开页面后直接对着麦克风说话即可,无需按住任何按钮。系统会自动检测你的语音开始和结束,实现自然的对话节奏。说完后AI会自动识别并生成回复。 功能2:视觉问答 开启摄像头后,你可以对着摄像头展示物体、场景或文档,同时用语音提问,例如这是什么植物?或帮我看看这段代码有什么问题。AI会同时理解你的语音内容和画面信息,给出综合回答。 功能3:打断与流式回复 在AI回复过程中,如果你有新的问题或想补充信息,可以直接开口说话打断AI。Parlor支持句子级TTS流式播放,AI会边生成边朗读,不必等整段回复完成,对话体验更自然流畅。 三、实际使用案例 场景1:烹饪助手 做饭时双手不便操作手机,开启Parlor的摄像头对准灶台和食材,用语音询问这道菜下一步该怎么做?,AI会根据你展示的食材状态给出实时指导,遇到问题随时打断追问。 场景2:实时翻译与学习 阅读外文书籍或文档时,将页面展示给摄像头并问这段话是什么意思?,AI会识别文字内容并用中文解释,还能进一步回答你对内容的疑问,像一个随时待命的私人外教。 四、常见问题FAQ Q1:对电脑配置有什么要求? A:推荐Apple M3 Pro及以上芯片的Mac可获得约2.5-3秒的端到端延迟。PC端需要支持CUDA的NVIDIA显卡,显存建议8GB以上。CPU模式也可运行但延迟会明显增加。 Q2:对话内容会被上传到服务器吗? A:不会。Parlor的所有AI处理完全在本地设备上运行,语音、图像和对话内容均不会离开你的电脑,充分保护隐私。 五、小贴士 1. 使用外接麦克风和安静的环境可以显著提升语音识别准确率,避免背景噪音干扰。 2. 摄像头画面保持稳定、光线充足能提高视觉理解的效果,避免频繁晃动。 3. 如果觉得AI回复速度较慢,可以尝试降低模型精度或使用更小的模型版本,在速度和质量之间找到平衡。
    查看完整使用指南

    工具信息

    分类AI音频
    定价免费
    浏览量209

    用户评分

    -

    0 个评分

    相关工具推荐

    Whisper
    Whisper

    Whisper是OpenAI开源的通用语音识别模型,能够将语音音频自动转录为文字文本,支持多达99种语言的识别。该模型在68万小时的多语言音频数据上训练,具备出色的鲁棒性和泛化能力,能够处理各种真实场景下的语音输入。Whisper采用编码器-解码器Transformer架构,支持语音识别、语音翻译、语言识别等多种任务。模型提供从tiny到large的多个规模版本,适应不同的精度和速度需求。作为目前最强大的开源语音识别模型之一,Whisper被广泛应用于字幕生成、会议记录、语音助手等场景。

    101,682
    GPT-SoVITS
    GPT-SoVITS

    GPT-SoVITS是一个开源的语音合成与声音克隆工具,支持通过少量语音样本实现高质量的声音克隆和文本转语音。它结合了GPT模型和SoVITS(基于Singing Voice的变声技术),仅需1分钟的训练音频即可克隆目标声音,支持中英日多语言合成。该工具提供了Web界面和API接口,支持实时语音合成和流式输出,广泛应用于配音、有声读物、虚拟主播等场景。

    58,302
    Coqui TTS
    Coqui TTS

    Coqui TTS是由Coqui AI开发的开源深度学习文本转语音工具包,提供了一套完整、易用的TTS开发框架。该项目集成了多种先进的语音合成模型架构,包括Tacotron、VITS、Glow-TTS等,用户可以方便地训练和部署自定义语音模型。Coqui TTS支持多语言语音合成、语音克隆、语音转换等高级功能,提供了统一的API接口和命令行工具。项目社区活跃,文档完善,是目前开源TTS领域最受欢迎的工具包之一,广泛应用于语音助手、有声内容、无障碍服务等场景。

    45,596
    ChatTTS
    ChatTTS

    ChatTTS 是由 2noise 开发的开源对话式语音合成模型,专为日常对话场景优化。支持中英双语,能生成包含笑声、停顿、语气词等自然对话元素的语音,让合成语音更接近真人对话效果。采用 10 万小时以上数据训练,提供精细的韵律控制能力,适合聊天机器人、语音助手等需要自然对话语音的应用场景。

    39,490