∴ GitHub / 趋势仓库

VectifyAI / PageIndex

无向量库、基于推理的 RAG 引擎,用树索引和 LLM 推理替代向量检索

语言
Python
Star
38.3k
Fork
3.3k
当日新增(10-01)
+1,097
累计在榜
3 天
最高名次
第 11 名
首次上榜
2026-09-29
去 GitHub 查看 ↗项目主页 ↗

∴ 是什么

PageIndex 是一个无向量库(vectorless)、基于推理(reasoning-based)的检索增强生成(RAG)引擎。它用分层树索引替代向量索引,检索时让 LLM 像人类专家一样在树中推理导航。索引和检索分两步:先生成文档的树结构索引,再让 LLM 基于完整上下文(对话历史、领域知识等)搜索该树。它支持本地模式和云模式,本地模式在用户机器上完成索引、检索和聊天。

∴ 解决什么问题

  • 向量数据库对长且复杂的专业文档检索准确率低,相似性不等于相关性
  • 向量检索结果不透明,缺乏可追溯性
  • 查询时只能使用查询嵌入,无法利用完整上下文
  • 将整个 PDF 作为原生输入传给模型,成本随文档长度增长且会超出上下文窗口

∴ 怎么上手

  1. 01安装:pip install -U pageindex
  2. 02设置环境变量 OPENAI_API_KEY="your-openai-key"
  3. 03创建客户端:client = PageIndexClient(index="gpt-5.6-luna", chat="gpt-5.6-sol")
  4. 04提交文档:doc_id = client.submit_document("report.pdf")["doc_id"]
  5. 05提问:answer = client.chat("What was the 2023 operating margin?", doc_id=doc_id)
  6. 06打印回答:print(answer)

∴ 适合谁

适用于需要处理金融报告、法律文件、监管文件、技术手册、医学文献、学术教材等长且复杂的专业文档的开发者,以及希望在本地或云端构建可解释 RAG 应用的团队。

∴ 要点

  • 无向量数据库、无分块(no chunking)
  • 检索结果可追溯到明确的引用,可解释
  • 上下文感知:检索时利用完整对话历史和领域知识
  • 本地模式下索引成本约每页 0.001 美元,1000 页约几美元
  • 在 FinanceBench 上达到 98.7% 准确率
  • 支持本地模式(文本 PDF)和云模式(扫描件、图像丰富文档、OCR、块级引用)
许可证 MITagentic-aiagentsaiai-agentscontext-engineeringinformation-retrievalllmragreasoningretrievalretrieval-augmented-generationvector-database

解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。

∴ 在榜记录

GitHub Trending 今日榜的每日存档,日期按北京时间。2026-09-29 首次上榜,累计在榜 3 天,最高第 11 名。

2026-09-29 +8222026-09-30 +1,0952026-10-01 +1,097
每日新增 Star · 2026-09-29 至 2026-10-01 · 共 3 个在榜日峰值 +1,097
日期名次当日新增总 Star
#17+1,09738,259
#17+1,09537,908
#11+82236,913