PAPER · arXiv:2501.11551
PIKE-RAG 论文解读专业知识与推理链增强生成
微软亚洲研究院 2025 年提出的框架。核心主张一句话:工业场景的 RAG 做不好,不是因为检索不够准,而是因为把「找资料」当成了全部任务。真正缺的是从专业语料里抽取知识、并按问题难度构建推理路径的能力。
01 — 问题定义
论文要解决什么
作者观察到,学术基准上表现良好的 RAG 方法,搬到工业场景往往失效。原因被归纳为三条,每一条在临床文档场景里都能直接对号入座。
挑战 一
知识源高度异构
真实语料是多年累积的混合体:扫描件、电子文档、网页、专有数据库。关键信息常藏在表格、图表、脚注里,而非正文段落。学术数据集提供的是预先切分好的干净文本,掩盖了这个难题。
挑战 二
专业领域鸿沟
专业领域有自己的术语体系与逻辑框架。通用语料训练出的模型在抽取、理解、组织领域知识时能力不足,容易产出看似合理但缺乏专业依据的结论。且专业内容的质量评估本身就很困难。
挑战 三
一刀切策略失效
不同问题需要的能力差异巨大。查一条规则和跨多份文档做比对推理,是完全不同的任务。多数 RAG 方案用同一套流程应对所有问题,导致简单问题绕远路、复杂问题够不着。
02 — 核心贡献一
按难度给问题分级
论文最有工程价值的部分,是提出了一套问题分类法,并据此定义系统能力层级。这让「RAG 做到什么程度」从模糊感觉变成可度量的阶段目标。
L1 · FACTUAL
事实型问题
答案明确存在于某处原文。核心难点是跨越问法与原文表述的语义差距,找到那一段。
L2 · LINKABLE
可链接推理型
答案需要串联多处信息才能得出。核心难点是拆解问题、分头取证、再把碎片组织成完整推理链。
L3 · PREDICTIVE
预测型问题
需要从已有数据归纳规律并外推。答案不在任何一份文档里,须由系统推导产生。
L4 · CREATIVE
创造型问题
需要提出新方案或设计。要求系统具备领域推理能力,而非信息组织能力。
这对本项目意味着什么
OpsMate 当前能力集中在 L1 与 L2。知识问答属 L1,MVR 报告撰写属典型 L2——每个章节的判定都需要从多个数据集与文档中取证再交叉核对。项目中「数字必须由确定性代码计算、大模型只负责叙述」的红线,本质上就是拒绝让系统在 L3 层面自由发挥,因为临床合规场景不接受推测性数值。
03 — 核心贡献二
知识库不是文本块的集合
论文主张把知识库建模为多层异构图,而不是扁平的向量集合。节点可以是文档、章节、块、图、表,边表达它们之间的从属与引用关系。
LAYER 01
信息资源层
原始文件本身及其相互关系,例如引用、超链接、数据库关联。保留文档在真实业务里的组织脉络。
LAYER 02
语料层
解析后的内容单元:章节、段落、表格、图。这一层承载可检索的文本与结构。
LAYER 03
蒸馏知识层
从语料中提炼的结构化知识,例如实体、属性、关系。这是「专业知识」真正被显式表达的地方。
对应到本项目
画像与属性重写
入库管线中的文档画像、业务元数据抽取、属性重写,正是在构建第三层。检索时既可命中原文,也可命中提炼出的属性。
04 — 核心贡献三
两个关键方法
针对 L2 复杂问题,论文提出两项相互配合的机制。这两项是全文最具可操作性的部分。
知识原子化 · Knowledge Atomizing
一个文本块里往往包含多条独立知识。传统做法把整块作为检索单元,导致召回时噪声大、命中率低。原子化的做法是预先把块内知识拆成一条条可独立回答的原子问题,并以这些原子问题作为检索入口。
好处是检索时问题对问题匹配,语义鸿沟大幅缩小;同时一个块可以因不同原子知识被多次精准召回。
知识感知的任务分解 · Task Decomposition
复杂问题不是一次性拆完,而是边取证边拆解。系统根据原始问题和已累积的知识,动态决定下一步该查什么,逐步逼近答案。
这与固定流水线的本质区别在于:下一跳查询依赖上一跳的结果。论文实验显示,这在超过两跳的问题上带来显著提升。
这解释了本项目的一个关键选型
「边取证边拆解」意味着执行路径无法预先画成一张固定的图——下一步做什么取决于这一步查到了什么。这正是本项目在 Agent 编排上放弃 Workflow DAG、改用 Agent 递归委派的根本原因:DAG 要求拓扑在运行前确定,而知识感知的任务分解要求拓扑在运行中生成。
05 — 取舍与局限
本项目没有照搬的部分
论文是研究成果,工程落地必然有取舍。以下是本项目明确未采纳或做了替换的部分。
未采纳
可训练的任务分解器 — 论文提出通过采样交互轨迹训练专用分解器。本项目直接使用通用大模型配合提示词与技能定义完成分解,避免引入训练与模型维护成本。
未采纳
完整知识图谱构建 — 论文自己也指出图谱构建资源消耗极大且随语料规模上升。本项目采用「画像 + 属性重写」这种轻量方案实现蒸馏知识层,不构建显式图结构。
已替换
检索实现 — 论文侧重多粒度图检索。本项目采用 Milvus 混合检索加 RRF 融合,工程上更成熟稳定,且满足当前 L1/L2 场景需求。
已收紧
推理自由度 — 论文追求让系统自主构建推理链。本项目在涉及数值的场景强制走确定性代码计算,大模型不得自由生成精确数字。这是临床合规要求,优先级高于能力上限。
06 — 一句话总结
为什么选这篇论文做底座
因为它是少数从工业落地视角而非基准刷分视角写的 RAG 论文。它提出的问题分级法给了项目一个清晰的能力演进路线,知识原子化解释了为什么入库阶段要做重加工,任务分解则直接决定了 Agent 编排的技术选型。这三点构成了当前系统架构的理论骨架——尽管具体实现已经完全是自己的代码。
继续阅读
看这些理念如何落成 36 个模块的工程结构。
继续阅读
看任务分解如何变成 Agent 递归委派。
原文
Wang, Fu, Wang, Song, Bian · Microsoft Research Asia