X / Twitter2 条

长文档 RAG 树索引方案

PageIndex 提出抛弃向量检索与切分的“树状索引 + LLM 推理”架构解决长文档 RAG 痛点。@realfxw 与 @oliviscusAI 分别介绍:传统向量 RAG 在财报、法律合同、技术手册等长难文档中常因相似度不等于相关度而失败;PageIndex 受 AlphaGo 启发模拟人类专家阅读逻辑,构建树状层级索引(先从版面解析逻辑树、再用轻量模型总结节点,无需分块与向量嵌入),LLM 推理检索像查目录一样逐层定位章节段落、路径清晰可追溯;FinanceBench 达 98.7% 准确率(传统向量 RAG 约 50%),本地建索引低至 $0.001/页、千页文档约 1 美元几分钟建完并支持持久化复用,420 页文档下查询成本比整份 PDF 喂入降低 16.6 倍;部署支持本地 SDK 全私有化,云端扩展 OCR、多文档文件系统及 MCP Server;100% 免费开源。

@realfxw

开源项目 PageIndex 提出抛弃向量检索与切分的“树状索引 + LLM 推理”架构,解决长文档 RAG 痛点。

X / Twitter查看原文 →

@oliviscusAI

研究者推出 PageIndex 新 RAG 方法,绕过向量库、嵌入、切分与相似度搜索,在 FinanceBench 达 98.7%,免费开源。

X / Twitter查看原文 →

数据由 GitHub Actions 每小时自动抓取 · AI 摘要聚合 · News Monitor