MindMemOS · Recall Quality Study
Azure China · Isolated Research Copy · 2026-08-10

少注入,但不牺牲关键记忆。

在不改动本地生产记忆的前提下,把真实 MindMemOS 数据单向复制到 Azure 中国隔离环境,用固定 20 问和历史 Judge 建立基线,再逐轮验证参数、GPT‑4.1 门控与轻量重排门控。

最终保留:宽候选 top‑k 8,加一层快速重排门控,阈值 0.07。三次重复保持答案命中率 80%,无关问题不召回率从 80% 提升到 100%。
答案命中率
80%
保持基线,不以漏召回换整洁
无关问题不召回
100%
基线 80%,提升 20 个百分点
平均上下文
375.9
云端基线 420.25 字符,降低 10.55%
P95 延迟
1.27s
代价:比云端基线增加约 225ms
01 · RESULT

质量改善是真实的,代价也被明确保留。

最终数字取 0.07 阈值的三次完整重复平均值。选择原则不是追求最高综合分,而是先锁定“答案命中率不得下降”,再在安全候选中优化精确率、弃答与上下文。

云端等价基线

固定 20 问 · top‑k 8 · 已重排 · 无后置门控
答案命中率
80%
基准
条目精确率
53.62%
基准
无关问题不召回
80%
基准
平均返回 / 上下文
3.45 / 420.25
基准
综合分
71.75
基准

最终保留版本

快速重排门控 · 直接回答提示前缀 · 阈值 0.07 · 三次重复平均
答案命中率
80%
无回退
条目精确率
58.56%
相对 +9.21%
无关问题不召回
100%
+20 个百分点
平均返回 / 上下文
3.02 / 375.9
−12.56% / −10.55%
综合分
78.48
相对 +9.38%
P50 / P95
1.03s / 1.27s
延迟增加 97ms / 225ms
02 · BOUNDARY

所有破坏性实验都被锁在云端副本。

同步只有本地到云端一个方向。云端索引、实验代码、配置和新写入不会自动回流本地;数据服务没有公开暴露。

STEP 01

冻结本地快照

记录 Neo4j、Qdrant 和源码状态;本地运行时保持不变。

STEP 02

短期传输

打包、计算 SHA‑256,经短期 Blob 授权单向上传。

STEP 03

隔离恢复

Azure 中国 8GB VM;恢复 10 个向量集合与图数据。

STEP 04

真实 Agent

OMP 17.2.9,默认 GPT‑4.1,通过 MCP 调用云端记忆。

STEP 05

固定评测

15 个正例、5 个负例;同一 Judge cache 与统一指标。

STEP 06

可回滚门控

环境开关控制;门控异常时返回原候选,不中断召回。

安全边界:报告、脚本和证据中不保存端点、密钥、令牌或临时上传授权;实验产物只保留在云端副本和本地研究目录。
03 · RESEARCH

外部研究支持“宽召回,紧注入”。

论文与系统的共同方向不是无限增加 top‑k,而是原子化事实、时间有效性、分层检索、紧凑证据和安全弃答。

PIKE‑RAG

专业知识需要原子化与任务拆解。对本项目意味着多问句应拆开覆盖,不能靠一次向量相似度决定全部证据。

论文

LongMemEval

评测应覆盖信息抽取、时间、更新和安全弃答。只看 recall@k 无法证明真实 Agent 可用。

论文

xMemory

固定 top‑k 容易集中到近重复内容。更合理的方向是主题、语义、事件和消息分层,按需展开。

论文

Zep / Graphiti

事件时间和摄取时间需要同时建模;图扩展必须受实体和预算约束,否则关系越多,噪声越多。

论文

Mem0

准确率、延迟和 Token 效率必须同时评价。托管平台的私有成绩不能直接当作本项目基线。

论文

Lost in the Middle

长上下文中部的证据更难被模型使用。删掉无关上下文不仅省 Token,也提高真正证据被使用的机会。

论文
04 · CURRENT STATE

当前运行链已复验,但仍有数据层问题。

最终验收包含服务健康、数据容器、配置值、真实 OMP 调用和固定评测。当前云端计数高于初始快照,是隔离实验产生的新记录,不代表迁移不一致。

13:00
OMP 强制调用真实记忆后,正确回答 AZ 会议时间。
14 / 14
门控、MCP 契约、稳定 ID、异常 fail‑open 测试通过。
10
Qdrant 集合;Kafka、Neo4j、Qdrant 均处于 healthy。
8,805 / 21,827
最终云端 Neo4j 节点 / 关系;冻结快照为 8,796 / 21,814。
已确认的数据层缺口
  • Home AI Hub 的 223:8120 证据确实存在,但记录已归档,正常 active-memory 检索无法返回。
  • embedding dimension 与 ingest prompt noise 仍有漏召回;后置过滤只能删噪音,无法创造候选。
  • 本轮没有自动重写记忆,没有启用 Dreaming,也没有把云端实验内容回写本地。
Experiment Explorer

每个“更漂亮”的数字,都要先过命中率门槛。

筛选实验卡片,或切换图表指标。综合分高不等于可以采用:top‑k 3、阈值 0.20 的综合分达到 82.22,但答案命中率从 80% 降到 73.33%,因此明确拒绝。

01 · THRESHOLD

重排门控阈值扫描

加入“是否直接回答”的查询前缀后,0.03–0.08 都保持 80% 命中;0.09 起发生断崖式回退。最终选择 0.07,并重复三次。

综合分随阈值变化

绿色点为最终阈值 0.07。
02 · ALL RUNS

本地参数扫描

扩大 top‑k 到 12/16 没增加任何答案命中,却把平均上下文推高到 495.6–684.6 字符;收紧到 top‑k 3/4 虽显著变干净,但关键命中回退。

03 · FAILED IDEAS

失败实验也是结果。

每个失败方向都保留了可复验原因,避免未来再次走同一条路。

参数扫描

扩大 top‑k

top‑k 12/16 保持 80% 命中,但精确率最低降到 42.63%,综合分只有 66.99–69.09。更多候选只是更多噪音。

拒绝上下文最高 684.6 字符
参数扫描

过度收紧 top‑k / threshold

综合分可达 82.22,但命中率跌到 73.33%。这种优化把“没看到答案”包装成“上下文更干净”。

拒绝硬门槛:命中不得下降
LLM 门控

GPT‑4.1 语义门控

真实 AZ 查询能从 6 条过滤到 5 条并保留正确答案,但门控自身约 7.85 秒,端到端约 8.90 秒。

语义有效在线延迟不可接受
实现审查

第一版门控回归

实现代理声称测试通过,但独立复验发现 MCP 调用契约回归、部分评分缺失时错误地失败关闭、候选无稳定 ID、输出 Token 截断等问题。全部修复后才进入 A/B。

代理自述不算证据最终 14 项测试通过
数据生命周期

归档事实无法被后置过滤救回

Home AI Hub 的目标证据存在,但已归档。门控只能处理“已经召回的候选”,无法替代状态治理和召回扩展。

待后续生命周期治理
Evidence & Reproduction

结论都能回到原始 JSON、代码与测试。

报告不展示私密记忆正文,也不包含任何端点、密钥、令牌、账号或临时上传授权。需要审计时,从本地研究目录读取完整证据。

01 · ARTIFACTS

本地证据索引

路径相对于报告所在的 cloud-lab 目录。完整云端包已下载并生成 SHA‑256 校验。

最终实验汇总../evidence/final-experiment-summary.json
本地基线与参数扫描../results/*.json
云端代码、测试与结果包../artifacts/cloud-rerank-final-bundle.tgz
完整性校验../artifacts/cloud-rerank-final-bundle.tgz.sha256
固定 20 问../experiments/benchmark_cases.json
评测执行器../experiments/run_recall_benchmark.py
外部研究原始资料../research/raw/*.md
研究综合../research/synthesis.md
迁移包校验../artifacts/SHA256SUMS
实验纪律../harness.md
02 · REPRODUCE

复验口径

任何新策略都必须使用同一 20 问、同一 Judge cache,并同时报告命中、精确率、弃答、条数、上下文、浪费率和延迟。

最终候选的选择规则
  1. 答案命中率不得低于云端基线 80%。
  2. 无关问题不召回率优先达到 100%。
  3. 在前两项满足后,比较精确率、上下文与综合分。
  4. 候选至少完整重复三次;延迟波动按三次平均报告,不挑最好的一次。
最终运行配置
  • 候选召回:top‑k 8。
  • 门控后端:现有快速重排模型。
  • 查询前缀:判断候选是否直接回答用户问题。
  • 阈值:0.07。
  • 超时:8 秒;任何异常 fail‑open。
  • GPT‑4.1 继续作为 OMP Agent 默认模型,不承担在线逐条门控。
已知限制
  • 固定集只有 20 问;可以作为工程回归集,不能代表完整 LongMemEval 能力。
  • 上下文字符只覆盖 query recall 返回,不包含 Hermes 固定身份提示约 2,565 字符的独立成本。
  • 门控提高了后置精度,但没有修复归档、原子化、时间有效性和多问句候选覆盖。
  • 延迟有所增加;P50 平均增加约 97ms,P95 平均增加约 225ms。
  • 当前代码仅保留在隔离云端副本,未自动应用到本地生产。
03 · NEXT

下一轮应先修数据与生命周期,而不是继续拧阈值。

阈值已经触及安全边界:0.09 起答案命中明显下降。继续微调的收益很小,下一阶段更值得处理归档事实、原子化、时间有效性和多问句拆解。

优先处理

  • 给 active / archived / obsolete 建清晰生命周期与可解释恢复规则。
  • 将长记忆拆成可检索原子事实,同时保留来源和时间。
  • 对专有名词和多问句做受预算约束的查询扩展。
  • 固定身份提示与 query recall 分账,单独治理每轮 2,565 字符的常驻成本。

暂不处理

  • 不把 top‑k 继续扩大到 12/16。
  • 不把 GPT‑4.1 逐查询语义门控投入在线链路。
  • 不自动改写本地生产记忆。
  • 不把云端实验结果自动回写本地。