Mem++:保留组织原始文档,把取舍留到查询时
非破坏性记忆的价值明确,但附录揭示截断、时间泄漏与评测口径限制
Mem++将每份文档连同时间和作者完整保存,查询时先按目标日期过滤,再融合词法、向量与标签检索,把带出处的原文交给回答模型。它减少写入摘要造成的证据损失,但保存完整不等于检索或上下文完整;组织基准的截断使部分宣称机制实际未到达回答模型。
图解主要方法
图2哪些机制在核心路径中生效,哪些被实验截断或仅属于可选变体?

- 1
写入完整文档,分清文本与向量覆盖
图2左上写入原文、作者、事件时间和向量,跳过同作者范围内完全重复或空文档,不调用生成模型。OrgMemBench使用MiniLM只嵌入前256个word pieces,全文仍在存储和词法索引;因此存储无损不代表向量能看到所有内容。
- 2
查询前先限定日期,再融合排名
中间Date Filter以t≤θ筛选活动记录,无日期记录不能通过指定时点过滤。词法、标签和语义三路各检索候选,按权重/(60+名次)融合。默认50条里47条按融合排序、3条保留给较新记录;只有该基准15个Audit Replay问题实际携带as-of日期。
- 3
把有出处的原文交给同一回答模型
图右显示日期与作者,模型在读时处理冲突,而非写入时决定保留哪一个事实。组织基准loader实际上不提供作者字段,表头是占位作者;40,000字符截断仅保留约19条,后置的近期槽和图事实没有送到回答模型。设计图与实际实验路径必须分别讲清。
- 4
把可选合并与图扩展当作不同风险路径
图左下虚线合并默认关闭:冲突仅标记旧版本,重述却产生最多220token合并行并归档原文,合并行取最早日期,可能把后来的信息带入较早查询。图扩展抽取无日期三元组,也没有as-of过滤。这些不是核心纯文档路径的等价替换。
实验与证据
已阅读v1正文及附录A/B、算法1/2和表1–7,检查图2及仓库文件和许可。数字为作者评测,本站未运行模型或复现。
来源证据【组织测试】一个合成组织443文档、157线程、18个月,73问共247评分要点;gpt-4o-mini裁判。gpt-4.1-mini回答时Mem++57.6、RAG55.0、最佳记忆基线A-Mem44.5。 表1及第4.1节 ↗
我的解读我的解读:比RAG高2.6分,比记忆系统高13.1分是不同对照,不能混用成领先所有方法13.1分。小合成基准尚不能代表真实组织权限、作者权威与噪声。
来源证据【反例类别】同一gpt-4.1-mini设置,矛盾识别Mem++47.2低于RAG75.4;全部方法的理由链分数均低于23。 表1、第4.2节 ↗
我的解读我的解读:保留原文不是自动解决冲突与因果解释,平均分掩盖了关键企业任务短板。还需检查检索失败还是回答模型未正确使用证据。
来源证据【消融归因】移除向量在组织基准下降35.7分;移除作者标签后输入上下文字节完全相同,分数下降2分被作者解释为运行噪声。图事实和近期槽在40,000字符预算外;k≥30读到的记录基本不再变化。 表4、附录B.3/B.4 ↗
我的解读我的解读:不能把标签下降写成模块有效,也不能把大k平台期只归因于检索已饱和。应报告实际读入记录而非截断前检索token。
来源证据【跨基准口径】LongMemEval_S本方法评470个非拒答问题,引用基线可能为全500题;LoCoMo正文/表写1540,附录裁判说明写1520。三次judge重评不等同三次独立系统训练或采样。 附录B.2、表5及官方评测说明 ↗
我的解读我的解读:题目过滤和裁判提示影响排名,需统一子集后复核;论文内LoCoMo数量不一致应保留说明,不自行替作者消除矛盾。
开放情况与使用许可
实际仓库包含memory/store.py、recall.py、consolidation.py、embedding后端及eval等,不是占位页。README明确实体图Memᵍ++为研究扩展,未打包进本次发布。本站未启动数据库或调用收费模型。
LICENSE核心仓库LICENSE为Apache-2.0;基准数据和第三方模型各自适用条款。论文arXiv非独占托管许可不等同图片开放许可,图2作必要方法评论引用。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
原文和历史版本不因写时抽取而消失,语义检索消融支持保留文档作为有效基线。
反方 · 哪些结论还不够
组织基准只能看到约19条记录;近期保留槽与图事实被截断,不能用总分证明它们有效。非破坏性存储也不保证时间查询无泄漏。
综合判断
值得采用其原文优先原则,但应把检索效果、时间正确性与上下文覆盖分别验收,谨慎解读跨基准排名。
我会先做的验证
未执行的验证方案:统一问题集合、回答/裁判模型及token预算,记录实际送入上下文的文档;注入跨日期冲突、无日期记录和长文,把原文检索、摘要、合并与实体图逐项对照,检测未来信息泄漏并报告置信区间。