MemoType:按事件、个人与一般知识分流的长期记忆检索
类型路由改变检索策略,但过滤召回、评测泄漏与在线成本仍需拆开验证
MemoType先把对话记忆分为事件、个人和一般知识,再针对事件对齐要素、针对个人反推可能问题、针对一般知识生成假想记忆进行检索,最后用两次回答筛除无关记录。四个基准显示收益,但类别硬过滤并非所有召回指标都更好,低写入费用也不等于低端到端成本。
研究补刊 · 覆盖 2026.09.23 — 2026.10.11
以下为当期记录;研究详情页展示最新已核对信息。
类型路由改变检索策略,但过滤召回、评测泄漏与在线成本仍需拆开验证
MemoType先把对话记忆分为事件、个人和一般知识,再针对事件对齐要素、针对个人反推可能问题、针对一般知识生成假想记忆进行检索,最后用两次回答筛除无关记录。四个基准显示收益,但类别硬过滤并非所有召回指标都更好,低写入费用也不等于低端到端成本。
上下文中的失败与成功经验,能比单纯增加推理强度更有用
研究让冻结语言模型读取环境配置、代码改动和既往实验收益,预测候选实验的最终增益,再从预算允许的少数候选中选择。2653条真实记录覆盖九个环境;上下文经验改善同环境和部分跨环境排序,但多轮实验仍围绕固定基线与预先给定候选池,不能等同于开放式自我改进。
小型流模型的推理步数扩展;理论构造、实际训练与测试集选择需分开看
传统流匹配在随机噪声时刻训练单次去噪,未必教会后一步利用前一步。UFM从自己的隐状态轨迹反向传播,只在终点预测答案;长轨迹通过球面回缩控制尺度。它在图可达、数独与迷宫上显示更多积分步可带来收益,但尚未验证开放语言任务。
四条语义轴与预测熵组合;长度控制、白盒成本和代码差异决定如何解读
U-Space把表示歧义、信息缺失、证据冲突与一般疑虑的词语映射回模型隐藏状态,构造四维空间,再把推理结束处的方向信号与整段推理的平均预测熵相乘。它提供可观察的疑虑轨迹,但既不输出校准后的错误概率,也没有证明四种轴是真实错误原因的完备分类。
成对力学题区分求解、识别矛盾与结构化拒绝;格式改善拒绝也可能损伤正常题
研究为力学题构造只改一个数据或前提的错误孪生题,先用两套数值方法核验答案,再分别评估正常题求解和错误题拒绝。14个模型的结果显示,正文指出矛盾、给出修正后答案、JSON仍标solved可以同时发生;允许状态报告flawed能提高部分模型拒绝率,却不是无代价的提示修复。
忠实性与可监督性不是同一个指标,输出不稳定也会拉低解释分数
研究在三种4B–8B推理模型上比较固定截断、指定长度和组内长度奖励。多数设置降低推理链对模型行为的可预测性,但对迎合用户线索的检测大体保留;严重压缩时,医学问题中的偏置影响更容易被隐藏。结果反对把“更短”与“更不可信”直接画等号。
在线路由、独立阈值与随机审计共同作用;保证针对有条件的累计误差
OMVV维护多个弱验证器,每轮只调用一个,再决定接受、拒绝或交给昂贵oracle。它利用候选答案之间的一致性校正分数,并从抽样获得的oracle反馈更新阈值和路由权重。论文把核验成本与错误控制结合,但真实成本、可靠真值和冷启动仍是落地关键。
非破坏性记忆的价值明确,但附录揭示截断、时间泄漏与评测口径限制
Mem++将每份文档连同时间和作者完整保存,查询时先按目标日期过滤,再融合词法、向量与标签检索,把带出处的原文交给回答模型。它减少写入摘要造成的证据损失,但保存完整不等于检索或上下文完整;组织基准的截断使部分宣称机制实际未到达回答模型。
记住为什么改、何时适用,并允许选择器跳过记忆
失败后,CounterMem在同一状态的副本中检验局部替代动作,保存原动作、修正、检验证据和适用条件。之后由小型DQN决定用一条记忆还是跳过,基础LLM不更新。这里的世界模型是测试、证明检查器或求解器;经源任务验证的经验依然可能害了新任务。
该期没有收录这个领域的人物动态。