parlor 使用教程
从入门到精通的完整指南
parlor 简介
Parlor是一个完全在设备本地运行的实时多模态AI应用,支持自然语音和视觉对话。使用Google的Gemma 4 E2B模型理解语音和视觉,Kokoro模型进行文本转语音,所有处理都在本地完成。你可以对着摄像头说话,AI会理解你的语音和画面内容并语音回复。支持浏览器端语音活动检测(免按键)、打断AI说话、句子级TTS流式播放。在Apple M3 Pro上端到端延迟约2.5-3秒,解码速度约83 tokens/秒。
详细功能介绍
【工具简介】Parlor是一个完全在设备本地运行的实时多模态AI助手,支持语音和视觉对话,无需联网或服务器。
【核心功能】
① 本地多模态理解:使用Gemma 4 E2B模型同时理解语音输入和摄像头画面
② 本地语音合成:使用Kokoro模型在设备端生成自然语音回复,Mac使用MLX加速,Linux使用ONNX
③ 免按键交互:浏览器端集成Silero VAD语音活动检测,无需按住按钮即可自然对话
④ 打断功能:支持在AI说话时直接开口打断,实现更自然的对话体验
⑤ 流式TTS:句子级流式播放,音频在完整响应生成前就开始播放
【适用场景】
【快速入门】
【优缺点分析】
优点:
缺点:
【适合人群】
1Parlor 入门教程:本地运行的实时多模态AI对话
入门10分钟
Parlor是一款完全在设备本地运行的实时多模态AI应用,支持自然语音和视觉对话,无需联网即可使用,保护隐私的同时提供流畅的AI交互体验。
一、快速开始
1. 访问Parlor的GitHub项目页面,按照说明下载对应平台的安装包。建议设备配置为Apple Silicon Mac(M系列芯片)或配备独立显卡的PC以获得最佳体验。
2. 首次启动时,应用会自动下载所需的AI模型文件(Gemma 4 E2B用于语音和视觉理解,Kokoro用于文本转语音),下载完成后所有处理均在本地进行。
3. 打开浏览器访问应用提供的本地地址,允许麦克风和摄像头权限后即可开始对话。无需注册账号,打开即用。
二、核心功能演示
功能1:免按键语音对话
Parlor内置浏览器端语音活动检测(VAD),打开页面后直接对着麦克风说话即可,无需按住任何按钮。系统会自动检测你的语音开始和结束,实现自然的对话节奏。说完后AI会自动识别并生成回复。
功能2:视觉问答
开启摄像头后,你可以对着摄像头展示物体、场景或文档,同时用语音提问,例如这是什么植物?或帮我看看这段代码有什么问题。AI会同时理解你的语音内容和画面信息,给出综合回答。
功能3:打断与流式回复
在AI回复过程中,如果你有新的问题或想补充信息,可以直接开口说话打断AI。Parlor支持句子级TTS流式播放,AI会边生成边朗读,不必等整段回复完成,对话体验更自然流畅。
三、实际使用案例
场景1:烹饪助手
做饭时双手不便操作手机,开启Parlor的摄像头对准灶台和食材,用语音询问这道菜下一步该怎么做?,AI会根据你展示的食材状态给出实时指导,遇到问题随时打断追问。
场景2:实时翻译与学习
阅读外文书籍或文档时,将页面展示给摄像头并问这段话是什么意思?,AI会识别文字内容并用中文解释,还能进一步回答你对内容的疑问,像一个随时待命的私人外教。
四、常见问题FAQ
Q1:对电脑配置有什么要求?
A:推荐Apple M3 Pro及以上芯片的Mac可获得约2.5-3秒的端到端延迟。PC端需要支持CUDA的NVIDIA显卡,显存建议8GB以上。CPU模式也可运行但延迟会明显增加。
Q2:对话内容会被上传到服务器吗?
A:不会。Parlor的所有AI处理完全在本地设备上运行,语音、图像和对话内容均不会离开你的电脑,充分保护隐私。
五、小贴士
1. 使用外接麦克风和安静的环境可以显著提升语音识别准确率,避免背景噪音干扰。
2. 摄像头画面保持稳定、光线充足能提高视觉理解的效果,避免频繁晃动。
3. 如果觉得AI回复速度较慢,可以尝试降低模型精度或使用更小的模型版本,在速度和质量之间找到平衡。