PageIndex 使用教程
从入门到精通的完整指南
PageIndex 简介
PageIndex是Vectify AI推出的开源无向量RAG检索框架,创新性地摒弃传统向量数据库和分块策略,改为为文档构建层级树索引(类似目录结构),通过LLM推理导航树节点实现上下文感知检索。在FinanceBench上达到98.7%准确率,显著超越传统向量检索方案,结果可追溯到具体页面和章节,适合金融、法律等对检索精度要求极高的场景。
详细功能介绍
【工具简介】
PageIndex是一款无向量、基于推理的RAG检索框架,通过为文档构建层级树索引来实现比传统向量检索更精准的上下文感知检索。
【核心功能】
①无向量检索:不依赖向量数据库和文本分块,避免传统RAG中语义相似但实际无关的检索噪声。
②层级树索引:为文档生成类似目录的树形结构(JSON格式),每个节点包含标题、页码范围和摘要信息。
③推理导航:通过LLM推理模拟人类专家的文档查阅方式,在树结构中逐层定位最相关内容。
④结果可追溯:检索结果附带明确的页面和章节引用,支持溯源验证。
⑤视觉检索:支持基于视觉的PDF检索(无需OCR),同时支持Markdown格式输入。
【适用场景】
①金融文档问答:在年报、财报等长文档中精准定位财务数据和分析结论。
②法律合同审查:从冗长的法律文书中检索特定条款、条件和责任约定。
③技术手册查询:在产品手册、API文档等技术文档中快速找到操作步骤和参数说明。
【快速入门】
①自部署方式:安装Python依赖,在.env文件中配置LLM API密钥(默认OpenAI)。
②运行 python3 run_pageindex.py --pdf_path <你的PDF文件> 为文档生成树索引。
③基于生成的索引进行问答查询,系统将通过树搜索返回精准结果。
④也可使用官方云平台、MCP服务器或API获得生产级效果和增强OCR支持。
【优缺点分析】
优点:
①在FinanceBench基准上达到98.7%准确率,显著优于传统向量RAG方案。
②检索结果可解释、可追溯,每条结果都有明确的页面和章节来源。
③无需管理向量数据库,架构更简洁,运维成本更低。
缺点:
①索引构建和检索均依赖LLM调用,Token成本和响应延迟较高。
②自部署版本的PDF解析能力有限,复杂PDF需使用云服务。
③需要LLM API密钥(默认OpenAI),对API质量和可用性有依赖。
【适合人群】
①金融/法律从业者:需要在大量专业文档中精准检索信息的分析师和律师。
②RAG系统开发者:对传统向量检索精度不满意、希望探索新范式的AI工程师。
③企业知识库建设者:为内部文档系统构建高精度问答能力的技术负责人。
1PageIndex入门教程:无向量的高精度文档检索框架
入门10分钟
PageIndex是Vectify AI推出的开源RAG检索框架,摒弃传统向量数据库,通过为文档构建层级树索引实现高精度上下文感知检索,在FinanceBench上准确率达98.7%。
快速开始
1. 安装PageIndex:pip install pageindex
2. 准备你的文档文件,支持PDF、Word等常见格式
3. 运行索引构建命令,PageIndex会自动为文档生成层级树结构
4. 通过Python API或命令行进行查询检索
核心功能演示
功能一:构建文档索引
使用PageIndex的索引构建功能,将文档转化为层级树结构。代码示例:from pageindex import PageIndex; index = PageIndex(); index.build(your_document.pdf); 构建过程中,系统会自动识别文档的章节、段落层次,生成类似目录的树形索引。相比传统分块方式,保留了完整的上下文关系。
功能二:上下文感知检索
查询时PageIndex不是简单匹配关键词或向量相似度,而是通过LLM推理导航树节点,理解查询意图后定位到最相关的章节。示例:results = index.query(该公司的营收增长率是多少?),系统会返回精确到具体页面和段落的答案,并附带上下文信息。
功能三:多文档交叉查询
PageIndex支持同时索引多个文档,并在查询时跨文档检索相关信息。这对于需要对比分析多个报告的场景非常有用,系统会自动识别哪些文档包含相关内容并整合答案。
实际使用案例
案例一:金融报告分析
某投资机构需要从数百页年报中快速提取关键财务指标。使用PageIndex索引所有年报后,分析师可以直接提问哪家公司2023年毛利率最高,系统精确返回对应页面的数据,相比传统向量检索准确率大幅提升。
案例二:法律合同审查
律师事务所需要在大量合同中检索特定条款。PageIndex的层级索引能准确定位到具体条款段落,而不是返回一堆可能相关的文本片段,大幅提高了合同审查效率。
常见问题FAQ
Q1:PageIndex和传统向量检索有什么区别?
A:传统方案将文档切块后向量化,检索时基于向量相似度匹配,容易丢失上下文。PageIndex构建层级树索引,通过LLM理解文档结构进行导航式检索,准确率更高,结果可追溯到具体位置。
Q2:支持哪些文件格式?
A:支持PDF、Word、TXT等常见文档格式。对于扫描版PDF,建议先进行OCR处理以获得更好的索引效果。
Q3:对硬件有什么要求?
A:索引构建阶段需要调用LLM API,建议使用GPT-4或Claude等高质量模型以获得最佳效果。本地运行需要足够的内存来加载索引树。
小贴士
1. 文档结构越清晰(有明确标题、章节划分),PageIndex构建的索引质量越高
2. 对于特别长的文档,建议先按主题拆分为多个文件分别索引
3. 查询时尽量使用自然语言描述问题,而非关键词,这样LLM能更好地理解意图定位答案