∴ GitHub / 趋势仓库
VectifyAI / PageIndex
无向量库、基于推理的 RAG 引擎,用树索引和 LLM 推理替代向量检索
- 语言
- Python
- Star
- 38.3k
- Fork
- 3.3k
- 当日新增(10-01)
- +1,097
- 累计在榜
- 3 天
- 最高名次
- 第 11 名
- 首次上榜
- 2026-09-29
∴ 是什么
PageIndex 是一个无向量库(vectorless)、基于推理(reasoning-based)的检索增强生成(RAG)引擎。它用分层树索引替代向量索引,检索时让 LLM 像人类专家一样在树中推理导航。索引和检索分两步:先生成文档的树结构索引,再让 LLM 基于完整上下文(对话历史、领域知识等)搜索该树。它支持本地模式和云模式,本地模式在用户机器上完成索引、检索和聊天。
∴ 解决什么问题
- 向量数据库对长且复杂的专业文档检索准确率低,相似性不等于相关性
- 向量检索结果不透明,缺乏可追溯性
- 查询时只能使用查询嵌入,无法利用完整上下文
- 将整个 PDF 作为原生输入传给模型,成本随文档长度增长且会超出上下文窗口
∴ 怎么上手
- 01安装:pip install -U pageindex
- 02设置环境变量 OPENAI_API_KEY="your-openai-key"
- 03创建客户端:client = PageIndexClient(index="gpt-5.6-luna", chat="gpt-5.6-sol")
- 04提交文档:doc_id = client.submit_document("report.pdf")["doc_id"]
- 05提问:answer = client.chat("What was the 2023 operating margin?", doc_id=doc_id)
- 06打印回答:print(answer)
∴ 适合谁
适用于需要处理金融报告、法律文件、监管文件、技术手册、医学文献、学术教材等长且复杂的专业文档的开发者,以及希望在本地或云端构建可解释 RAG 应用的团队。
∴ 要点
- 无向量数据库、无分块(no chunking)
- 检索结果可追溯到明确的引用,可解释
- 上下文感知:检索时利用完整对话历史和领域知识
- 本地模式下索引成本约每页 0.001 美元,1000 页约几美元
- 在 FinanceBench 上达到 98.7% 准确率
- 支持本地模式(文本 PDF)和云模式(扫描件、图像丰富文档、OCR、块级引用)
许可证 MITagentic-aiagentsaiai-agentscontext-engineeringinformation-retrievalllmragreasoningretrievalretrieval-augmented-generationvector-database
解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。
∴ 在榜记录
GitHub Trending 今日榜的每日存档,日期按北京时间。2026-09-29 首次上榜,累计在榜 3 天,最高第 11 名。