项目概览
本文档是一份关于知识检索技术的深度对比指南,系统梳理了当前领域的五大技术流派:传统RAG、PageIndex、SirChmunk、MinerU和LLM Wiki。文档从技术概述、问题背景、核心思想、核心原理、系统架构、关键流程、技术关系、应用场景、工程落地、优缺点与适用边界等多个维度进行了全面分析。文档指出,传统RAG存在语义碎片化、静态索引僵化、近似匹配不等于真正相关、文档解析能力弱、知识不累积等五大结构性缺陷。针对这些痛点,PageIndex通过构建文档语义树实现推理式树搜索,SirChmunk采用无索引实时扫描与自进化缓存,MinerU作为文档解析上游基础设施提供高质量输入,LLM Wiki则通过编译式知识管理实现知识累积复利。文档强调,未来知识检索一定是混合方案,根据查询类型自动选择检索策略,没有银弹。
解决什么问题
文档指出传统RAG存在五大结构性缺陷:一是语义碎片化,将文档切分为固定大小的Chunk再独立向量化,导致表格被切分后失去意义;二是静态索引僵化,向量数据库建好后数据冻结,文档更新需重新运行整个ETL Pipeline,造成数小时重建延迟;三是近似匹配不等于真正相关,向量检索的余弦相似度与用户意图的相关性存在偏差;四是文档解析能力弱,无法处理表格、公式、图表、多栏排版等复杂内容;五是知识不累积,每次查询从零开始,LLM不会记住上次回答,也无法主动积累跨文档洞察。
工作方式
文档对比了五种技术的实现路径。传统RAG采用Chunk→Embedding→VectorDB→Top-K检索的流程。PageIndex构建文档语义树,查询时由LLM进行推理式树搜索,借鉴AlphaGo的蒙特卡洛树搜索思想,采用面包屑推理和递归缩小方式定位内容。SirChmunk采用无索引方案,通过ripgrep关键词级联扫描进行粗扫,再用蒙特卡洛重要性采样和LLM推理精读,支持FAST和DEEP双模式切换,搜完后建立后验索引缓存。MinerU采用VLM版面分析加OCR双引擎,识别标题、段落、表格、图片、公式等元素,重建阅读顺序后输出结构化Markdown/JSON。LLM Wiki采用三层架构,由LLM将原始素材编译写入结构化Wiki,通过Ingest、Query、Lint三个核心操作维护知识库。
核心能力
- 传统RAG:生态最成熟,查询延迟极低,横向扩展容易,适合大规模部署
- PageIndex:无需向量数据库,推理路径可追溯,完整上下文无截断,在FinanceBench上达到98.7%准确率
- SirChmunk:零索引零预处理,数据实时可用,自进化越用越快,支持MCP集成
- MinerU:VLM+OCR双引擎,109语言支持,输出高质量Markdown,社区活跃(59.1k Stars)
- LLM Wiki:知识累积复利,跨文档综合能力极强,支持Git版本管理,与Obsidian生态结合
使用前需要了解
- AI 整理 · 本地测试,未经人工复核;依据历史报告节选,不代表当前产品状态。
- 文档明确了各技术的适用场景:万级文档企业搜索首选传统RAG,金融/法律精准分析首选PageIndex,个人知识管理首选SirChmunk和LLM Wiki,实时数据检索首选SirChmunk,PDF批量解析首选MinerU,学术深度研究首选LLM Wiki加MinerU。文档同时指出各技术的局限:传统RAG存在Chunk丢失上下文、无法处理表格公式、索引僵化等问题;PageIndex树构建成本高、仅适合结构化长文档、需要强LLM;SirChmunk不适合超大规模数据、受磁盘性能限制、生态较新;LLM Wiki摄取阶段成本高、需要人工参与、不适合实时高频查询;MinerU GPU部署成本高、极端版面仍有错误。文档强调未来一定是混合方案,根据查询类型自动选择检索策略,没有银弹。

