aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型全文深读与原图讲解

RPMem:将跨会话记忆压进可迁移的低秩适配器

固定容量的在线写入,不代表无成本更换骨干

IN A NUTSHELL

RPMem 用冻结编码器与学习到的编译器把会话写成固定形状记忆,再由任务训练的逐坐标门控累积,解码为当前骨干的 LoRA。它避免每次查询重读历史,但更换骨干仍需要训练专用解码器;可迁移性与零训练迁移是不同承诺。

01

图解主要方法

图 1 的编译、巩固和部署分别更新哪些参数?

原论文图 1:会话编译、跨会话巩固与骨干解码
原论文图 1:会话编译、跨会话巩固与骨干解码查看大图 ↗
Fanyu Zhao 等,arXiv 2609.23466v2;原图内容未改动。 · 原始来源与图注 ↗ · 版权归作者;arXiv 非独占分发许可不是开放图片许可。为方法评论仅引用必要原图,不授予进一步使用权。
  1. 1

    单会话编译:匹配读历史时的回答分布

    ModernBERT-base 冻结,Perceiver 将不定长会话压为 36×1×8×512 的记忆。原模型读历史产生教师分布,适配后的模型只看问题及相同回答前缀;保留教师 top-32 token 与剩余总概率做前向 KL,避免只学硬答案或遗漏尾部概率。

  2. 2

    门控巩固:逐坐标决定保留与写入

    首条直接初始化 h;之后 z=sigmoid([旧记忆;新记忆]W+b),h=z·旧+(1−z)·新。共享门控有 524800 参数,仅以任务训练侧答案交叉熵学习,问题不直接输入门控。部署后参数冻结,记忆值通过前向计算更新。

  3. 3

    解码低秩参数供查询使用

    每层 down_proj 接收生成的 rank-8 因子,另有共享 rank-8 偏置块,实际拼接宽度 16。生成的 A、B 调整冻结骨干,历史不用占查询 token;代价是每用户参数状态与共享编译器常驻,记忆也不像文本记录那样容易检查或逐条删除。

  4. 4

    更换骨干:先训练新解码器

    保留编码器和潜在记忆空间,将新骨干的层数、宽度交给目标解码器适配。附录每个目标仍用 664128 会话训练一轮、10377 更新;配对表还为各编译器单独拟合门控,因此表中迁移收益主要证明编码器复用,不等于任意线上状态原样切换已充分验证。

  5. 5

    理解固定容量与成本范围

    64 会话热写入包含新会话编码、门控及 LoRA 生成;所有模型已驻留。查询耗时是选择题前向,不是开放式长回答总延迟。累积内存固定不保证无限长历史无损,超出实测会话数仍需检查容量饱和。

02

实验与证据

以下为作者报告;已阅读 v2 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【表 1】Qwen3-8B 非思考模式,PERMA 十个模拟用户留一评估,Core 85.52%;Metis-9B 80.20%,Full Context 72.54%。 §3、附录 D/G

我的解读我的解读:RPMem 接受本基准任务监督,Metis 使用原发布权重,公平性不能仅按规模判断。

来源证据【其他基准】PersonaMem-v2 的 5000 题 Overall 为 40.22%;PrefEval 300-turn 为 74.81%,10-turn 为 69.81%,低于 LightMem 81.30%。 表 1

我的解读我的解读:优势依赖历史长度和任务;不能把固定容量直接解释为所有记忆工作均占优。

来源证据【热部署】64 会话时写入 0.043 秒、36.562 MiB;rank 拼接对照每次重新编译全部历史。 表 3、附录 D.5

我的解读我的解读:约 22 倍写入差距包含对照重编译策略,不是所有增量缓存实现的必然劣势。

来源证据【迁移成本】目标解码器需约 6.74–38.42 小时,分别分配 8 或 32 GPU;原编译器约 338 GPU 小时。 附录 F

我的解读我的解读:复用降低后续训练成本,但既不是免训练迁移,也不应把训练与在线毫秒级写入混在一起。

来源证据【通用能力】IFEval 从 81.70 降至 77.89。 表 4

我的解读我的解读:记忆适配有可测干扰,应保留无记忆基线和关闭适配器的路径。

03

开放情况与使用许可

论文提供 Quark-Medical/rpmem 地址,本次页面与 GitHub tree API 未成功取得可用实现(API 404);未核实权重与许可证,不能把论文中的 implementation available 当成已开放证明。

LICENSE代码、权重许可待核实;论文许可见图注。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

把记忆编码和骨干解码分开,并以尾部概率蒸馏与逐坐标门控训练,使持久状态与模型更换之间有了明确接口。

反方 · 哪些结论还不够

任务监督、选择题基准、固定容量与目标解码器训练限制了无条件通用性;附录迁移评估重新拟合门控,需要独立实流切换实验。

综合判断

值得作为长期个性化的固定容量基线;部署前必须同时验证迁移连续性、遗忘请求、可审计性和通用能力损失。

我会先做的验证

未执行的验证方案:用从未训练过的用户流保持同一 h 和门控,仅切换预训练好的目标解码器;在切换前后插入冲突、删除和数百条干扰,再以开放问答和逐事实召回比较文本记忆。

继续探索大模型