AI工具箱
RAGFlow

RAGFlow 使用教程

从入门到精通的完整指南

RAGFlow 简介

RAGFlow 是由 InfiniFlow 开发的开源 RAG(检索增强生成)引擎,专注于深度文档理解和精准问答。支持 PDF、Word、PPT、Excel 等多种文档格式的智能解析,内置 OCR 和版面识别能力,能准确提取表格、图片中的信息。提供可视化知识库管理和对话界面,支持与主流大模型集成,适合企业级文档问答和知识管理系统。

详细功能介绍

【工具简介】

RAGFlow 是一款开源的 RAG 引擎,通过深度文档理解实现精准的基于文档的智能问答。

【核心功能】

①深度文档解析:支持 PDF、Word、PPT、Excel、图片等 30+ 格式,内置 OCR、表格识别和版面分析能力,准确提取文档中的结构化和非结构化信息。

②智能分块与检索:基于文档语义结构自动分块,而非简单按字数切分,配合向量检索和混合搜索策略,提升检索准确率。

③可视化知识库管理:提供 Web 界面管理文档库,支持文档上传、预览、标注和分块预览,便于调试和优化检索效果。

④多模型灵活接入:支持对接 OpenAI、Claude、通义千问、文心一言等主流大模型,可配置不同的 Embedding 和 LLM 组合。

⑤引用溯源与可信回答:回答时标注信息来源文档和具体段落,支持用户溯源验证,减少幻觉问题。

【适用场景】

  • 企业知识库问答:将企业内部文档、产品手册、规章制度等构建为智能知识库,员工可通过自然语言快速查询所需信息。
  • 合同与法律文档审查:上传合同、法规等文档,通过问答方式快速定位关键条款、对比差异,辅助法务人员高效工作。
  • 学术文献研究辅助:批量导入论文和技术文档,支持跨文档检索和综合问答,帮助研究人员快速获取文献信息。
  • 【快速入门】

  • 环境部署:使用 Docker Compose 一键部署,包含 RAGFlow 服务、数据库和向量存储组件。
  • 配置模型:在系统设置中配置 LLM 和 Embedding 模型的 API 密钥,支持多种模型组合。
  • 创建知识库:新建知识库并上传文档,系统自动进行文档解析、分块和向量化处理。
  • 开始问答:在对话界面选择知识库,输入问题即可获得带引用来源的智能回答。
  • 【优缺点分析】

    优点:

  • 文档解析能力强,OCR 和表格识别效果好,处理复杂版面文档优于同类方案。
  • 检索准确率高,基于语义结构的分块策略比简单分块效果更好。
  • 提供完整的可视化管理界面,非技术人员也能轻松使用。
  • 缺点:

  • 部署资源要求较高,完整的 Docker 部署需要较大内存和存储空间。
  • 处理超大文档时解析时间较长,首次导入需要耐心等待。
  • 自定义分块策略的灵活性有限,特殊文档结构可能需要额外适配。
  • 【适合人群】

  • 企业 IT 和知识管理团队:需要构建内部知识库和智能问答系统的团队,尤其适合文档量大、查询频繁的场景。
  • 法务和研究人员:需要处理大量专业文档、快速定位关键信息的法律和学术工作者。
  • AI 应用开发者:需要为产品添加 RAG 能力、构建文档问答功能的开发者。
  • 1RAGFlow 入门教程:搭建企业级智能文档问答系统

    入门10分钟
    RAGFlow 是一款基于深度文档理解的 RAG 引擎,能智能解析复杂文档结构,支持表格、图表、公式识别,提供精准的文档问答能力,适合企业知识库建设。 一、快速开始 1. 确保已安装 Docker 和 Docker Compose,运行 docker --version 确认。 2. 克隆项目:git clone https://github.com/infiniflow/ragflow.git,进入目录后执行 docker compose -f docker-compose.yml up -d 启动服务。 3. 等待容器启动完成(首次需下载镜像,可能需要几分钟),浏览器访问 http://localhost 进入管理界面。 4. 注册管理员账号并登录,即可开始创建知识库。 二、核心功能演示 功能1:创建知识库并上传文档 点击左侧导航栏的「知识库」,新建一个知识库,选择文档解析策略(通用、论文、法律等模板)。然后上传 PDF、Word、Excel 等文档,RAGFlow 会自动进行 OCR 识别、表格提取、段落切分等深度解析,生成结构化的知识片段。 功能2:智能问答对话 进入「对话」页面,新建对话并关联已创建的知识库。在聊天框中提问,例如:这份合同中关于违约金的条款是什么?RAGFlow 会从知识库中检索相关内容,结合大模型生成准确回答,并标注引用来源,方便溯源验证。 功能3:文档结构化提取 上传包含复杂表格的文档后,RAGFlow 的深度解析引擎能自动识别表格结构,将表格数据转化为可查询的结构化内容。你可以在知识片段预览中查看解析结果,手动调整不准确的切分,确保问答质量。 三、实际使用案例 案例1:企业内部知识库 将公司制度手册、产品文档、技术规范等上传到 RAGFlow,员工可以直接用自然语言提问,如年假政策是什么、产品部署流程是怎样的,系统会从文档中精准找到答案,大幅减少重复咨询。 案例2:合同审查辅助 法律团队将大量合同模板和历史合同上传,审查新合同时只需提问:帮我检查这份合同是否有缺失的保密条款,系统会对比知识库中的标准模板,快速指出差异和风险点,提升审查效率。 四、常见问题 FAQ Q1:支持哪些文档格式? A:支持 PDF、Word(docx)、Excel、PPT、Markdown、TXT 等常见格式,其中 PDF 的解析效果最为完善,支持扫描件 OCR。 Q2:需要什么硬件配置? A:最低需要 4GB 内存。如果使用内置的 Embedding 模型,建议 8GB 以上内存。如需处理大量文档,16GB 内存和 SSD 硬盘会显著提升体验。 Q3:可以对接哪些大模型? A:支持 OpenAI GPT 系列、Claude、Gemini、国产模型如通义千问和智谱等,也支持本地部署的开源模型如 Ollama,在系统设置中配置 API Key 即可切换。 五、小贴士 1. 上传文档前先选择合适的解析模板,法律文档选「法律」模板,学术论文选「论文」模板,解析准确率会大幅提升。 2. 定期检查知识片段的质量,对切分不合理的片段进行手动调整,这是提升问答效果最直接的方式。 3. 对于超大文档,建议先拆分为多个小文件再上传,单个文件控制在 50MB 以内,解析速度更快且不易出错。