DPPM:把历史证据保留与顺序修订分成两条参数记忆路径
约53万可训练参数;遗忘行为、信息删除和恒定端到端成本需要分开
DPPM在冻结的Doc-to-LoRA编译器之上训练一个轻量记忆整合器:Evidence按内容直接汇总所有历史段,Delta按时间顺序把新信息与已有预测的差写入关联矩阵。融合后的表示交给冻结解码器生成个性化LoRA,回答时无需把原历史放进上下文。结果支持双路径在两种个性化选择题基准上提升回答准确率,但其遗忘理论只在特定表示扰动和收缩条件下成立,不证明永久记忆、参数删除或一般开放式对话可靠性。
图解主要方法
直接保留早期证据与按顺序更新状态,如何共同改善参数化个性记忆?

- 1
冻结历史编译和语言模型
历史按时间分段,经冻结D2L得到每层/模块/槽位的512维表示;当前问题和答案不参与记忆编写。公开实现以4,096词预算和一个事件重叠分段,参数在槽位间共享而记忆状态分别维护。
- 2
直接汇总历史证据
LayerNorm后的表示经学习矩阵打分,每坐标沿时间softmax加权原始表示。加权二阶矩提供RMS尺度恢复,避免池化幅度缩水;固定段重排不改变该路径输出,因此不能独自辨认相反的更新顺序。
- 3
按顺序写入关联残差
四维ELU+1单位key从K×512状态读预测,sigmoid门控制当前表示减预测的残差,再做外积更新。并行全1目标normalizer校准读出;首段初始化,后续从第二段递推,key相似性决定交叉干扰。
- 4
融合后生成历史适配器
逐坐标学习的sigmoid权重混合Evidence与Delta,再恢复RMS;读key和融合权重训练后固定,不随当前查询改变。冻结解码器输出LoRA因子,共享适配器只加一次;答案交叉熵梯度穿过冻结网络,仅更新527,364记忆参数。
实验与证据
正文及附录A–E含证明全部已读,图2视觉检查;检查MIT许可、memory.py实现、检查点说明和作者发布验证范围,未独立运行。
来源证据PersonaMem-v2为18,527训练/2,059验证/5,000测试且persona隔离;PrefEval16训练主题/4保留主题,7,380训练/1,620测试。 4.1;仓库数据协议 ↗
我的解读三个偏好形式×10/70/300间隔;这是选择题option-token评分,不等价于自由生成质量。各数据集/骨干分别训练。
来源证据五seed42–46、五epoch、AdamW学习率10⁻³、batch1、clip1,使用最终epoch;Qwen准确率54.22±0.48和86.79±0.68。 表1–2;附录B/D ↗
我的解读±为样本标准差;Gold State61.08/93.52是注释oracle,不能混入普通方法排行。
来源证据Qwen相对原RPMem增益约8.50/4.32个百分点;等参数控制45.49/82.56,完整54.22/86.79。 表1、3;仓库baseline说明 ↗
我的解读RPMem是同一冻结D2L接口内的递归门实现,不是把其额外编译器训练也带入;不同公开Metis等用原生骨干,跨模型比较不是完全控制。
来源证据Gemma Persona完整40.31%高于两单路,但PrefEval79.20%低于Evidence79.81%;Qwen PrefEval对更强单路仅+0.81点。 表2;memory.py ↗
我的解读收益取决于任务/骨干,不能宣传全部组合都优于单路;公开delta工厂默认key8且无校准,DPPM内部key4有校准,严格路径归因还需匹配。
来源证据A800回答forward46.14ms,比RPMem多2.43ms;对RAG约3.1倍、Full Context62.7倍快。 图4;附录B ↗
我的解读一次暖启后三次forward中位数,排除编译和检索,也非完整自回归生成时延,不支持同倍数端到端加速。
来源证据最长128K历史选中的单个问题:Full Context33,143→139,319输入词,显存10,203.91→18,245.97MiB;DPPM7,762.32MiB。 图4b ↗
我的解读禁用KV缓存且仅这对历史,57.46%节省属于回答峰值;不能外推历史写入、长期缓存或全测试集平均显存恒定。
来源证据固定34段、24偏好profile,年龄32时DPPM归一化敏感度0.970/0.667,RPMem0.268/0.116,Evidence1。 图5;附录D ↗
我的解读是seed42的潜变量响应、每profile以年龄0归一化;固定段重排的Evidence理论上不变,不是记忆正确率100%。
来源证据Forget、Sensitive、Therapy对RPMem分别+21.68/+17.57/+15.34点,Others13.68→50.23%。 图3;4.4 ↗
我的解读这些评估回答是否恰当使用/归属信息;保留证据与不使用旧信息可并存,不能宣称执行了隐私删除。
来源证据附录E递归衰减需完整Jacobian范数<1;池化敏感度下界需分数不变且限校准前。 附录E.1–E.3 ↗
我的解读状态依赖门还含导数项,不能只用门值<1证明普遍收缩;理论没有延伸到融合、LoRA解码或最终回答。
来源证据OPD64为54.56/87.04,相比CE平均+0.29点;GRPO54.80/85.06。 表4;附录D;README ↗
我的解读探索目标只用seed42,OPD64同时改teacher提示,不能独立归因于更长rollout或称统计可靠改进;当前发行不含这些训练。
来源证据作者发布复核PrefEval seed42为1,422/1,620=87.78%;六个检查点仅seed42。 docs/validation.md ↗
我的解读这是作者的已训权重推理复核,不是本编辑复现或五seed再训练;578编译段复用了缓存,仅2段重新编码,其他骨干/基准未全链路复核。
开放情况与使用许可
官方isyuhaochen/DPPM含真实训练/推理代码、配置、CPU测试和六个约2MB的seed-42记忆权重(三骨干×两数据集)。主CE配方已提供,探索性蒸馏/RL未发布;完整基础模型和Doc-to-LoRA编译器需另行取得。
LICENSE论文及图2为CC BY 4.0;代码LICENSE为MIT,外部模型、编译器和基准保留各自许可。六个分发文件是记忆模块参数,不是完整语言模型开源许可。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
Qwen固定接口下等参数RPMem控制527,364参数,DPPM仍领先8.73/4.23个百分点,支持机制差异而非0.49%容量差。
五训练seed配对比较,七项指标经Holm校正均p<0.01;这是固定测试集上的种子统计,而非所有新用户的保证。
反方 · 哪些结论还不够
Gemma PrefEval完整双路径79.20%,低于Evidence单路79.81%和Delta79.38%,组合不普遍优于两单路。
原始Evidence下界随历史长度约1/T下降,仅对保持分数的扰动、RMS校准前成立,不能说理论证明永不遗忘。
保留诊断是固定34段中移动偏好位置,测潜变量差异而非回答正确率或增长历史;Forget表现也不证明历史从缓存/参数真正删除。
综合判断
是一种有匹配控制和多seed证据的轻量参数记忆设计;最稳妥结论是改善所测个性化选择题,长期数据治理和真实服务总成本仍需额外验证。
我会先做的验证
建议实验(尚未执行):加入真实不断增长历史与冲突偏好,逐段计编译、更新、存储和回答成本;同时测开放式回答、来源归属、撤回后对抗探测,并在相同key宽度/校准下重做单路径消融。