扩大 top‑k
top‑k 12/16 保持 80% 命中,但精确率最低降到 42.63%,综合分只有 66.99–69.09。更多候选只是更多噪音。
在不改动本地生产记忆的前提下,把真实 MindMemOS 数据单向复制到 Azure 中国隔离环境,用固定 20 问和历史 Judge 建立基线,再逐轮验证参数、GPT‑4.1 门控与轻量重排门控。
最终数字取 0.07 阈值的三次完整重复平均值。选择原则不是追求最高综合分,而是先锁定“答案命中率不得下降”,再在安全候选中优化精确率、弃答与上下文。
同步只有本地到云端一个方向。云端索引、实验代码、配置和新写入不会自动回流本地;数据服务没有公开暴露。
记录 Neo4j、Qdrant 和源码状态;本地运行时保持不变。
打包、计算 SHA‑256,经短期 Blob 授权单向上传。
Azure 中国 8GB VM;恢复 10 个向量集合与图数据。
OMP 17.2.9,默认 GPT‑4.1,通过 MCP 调用云端记忆。
15 个正例、5 个负例;同一 Judge cache 与统一指标。
环境开关控制;门控异常时返回原候选,不中断召回。
论文与系统的共同方向不是无限增加 top‑k,而是原子化事实、时间有效性、分层检索、紧凑证据和安全弃答。
专业知识需要原子化与任务拆解。对本项目意味着多问句应拆开覆盖,不能靠一次向量相似度决定全部证据。
论文评测应覆盖信息抽取、时间、更新和安全弃答。只看 recall@k 无法证明真实 Agent 可用。
论文固定 top‑k 容易集中到近重复内容。更合理的方向是主题、语义、事件和消息分层,按需展开。
论文事件时间和摄取时间需要同时建模;图扩展必须受实体和预算约束,否则关系越多,噪声越多。
论文准确率、延迟和 Token 效率必须同时评价。托管平台的私有成绩不能直接当作本项目基线。
论文长上下文中部的证据更难被模型使用。删掉无关上下文不仅省 Token,也提高真正证据被使用的机会。
论文最终验收包含服务健康、数据容器、配置值、真实 OMP 调用和固定评测。当前云端计数高于初始快照,是隔离实验产生的新记录,不代表迁移不一致。
筛选实验卡片,或切换图表指标。综合分高不等于可以采用:top‑k 3、阈值 0.20 的综合分达到 82.22,但答案命中率从 80% 降到 73.33%,因此明确拒绝。
加入“是否直接回答”的查询前缀后,0.03–0.08 都保持 80% 命中;0.09 起发生断崖式回退。最终选择 0.07,并重复三次。
扩大 top‑k 到 12/16 没增加任何答案命中,却把平均上下文推高到 495.6–684.6 字符;收紧到 top‑k 3/4 虽显著变干净,但关键命中回退。
每个失败方向都保留了可复验原因,避免未来再次走同一条路。
top‑k 12/16 保持 80% 命中,但精确率最低降到 42.63%,综合分只有 66.99–69.09。更多候选只是更多噪音。
综合分可达 82.22,但命中率跌到 73.33%。这种优化把“没看到答案”包装成“上下文更干净”。
真实 AZ 查询能从 6 条过滤到 5 条并保留正确答案,但门控自身约 7.85 秒,端到端约 8.90 秒。
实现代理声称测试通过,但独立复验发现 MCP 调用契约回归、部分评分缺失时错误地失败关闭、候选无稳定 ID、输出 Token 截断等问题。全部修复后才进入 A/B。
Home AI Hub 的目标证据存在,但已归档。门控只能处理“已经召回的候选”,无法替代状态治理和召回扩展。
报告不展示私密记忆正文,也不包含任何端点、密钥、令牌、账号或临时上传授权。需要审计时,从本地研究目录读取完整证据。
路径相对于报告所在的 cloud-lab 目录。完整云端包已下载并生成 SHA‑256 校验。
../evidence/final-experiment-summary.json../results/*.json../artifacts/cloud-rerank-final-bundle.tgz../artifacts/cloud-rerank-final-bundle.tgz.sha256../experiments/benchmark_cases.json../experiments/run_recall_benchmark.py../research/raw/*.md../research/synthesis.md../artifacts/SHA256SUMS../harness.md任何新策略都必须使用同一 20 问、同一 Judge cache,并同时报告命中、精确率、弃答、条数、上下文、浪费率和延迟。
阈值已经触及安全边界:0.09 起答案命中明显下降。继续微调的收益很小,下一阶段更值得处理归档事实、原子化、时间有效性和多问句拆解。