QGMem:长期保留事件和状态轨迹,提问时才建小图
图token、文本证据与时间有效性分工;十条记忆不等于整个系统恒定成本
QGMem把历史对话拆成带原始出处、实体、地点和双时间的原子事件,再把同一主体关系的更新串成轨迹。提问后用BM25、语义与事件属性混合检索,重排选10条记忆,仅对这些事实构图;图编码器压成一个软token,与可读文本共同供冻结大模型回答。LoCoMo与冲突多跳有提升,但收益很大部分来自记忆粒度和重排,图分支并非每个基准都有效。
图解主要方法
如何兼顾长期状态更新、原始证据可追溯和查询时的小图推理?

- 1
按事件拆分并保留原文证据
每会话6轮窗、重叠2轮,重叠只作指代背景不再提取;每单元保留一项事实、来源跨度、实体/地点及事实时间和发言时间。模糊最近不强行猜日期,具体相对日期按当时发言时间归一化。
- 2
合并同一关系的更新轨迹
BGE分别嵌入事实、主体、谓词,三相似度取最小;每项检查20近邻,簇内两两分数≥0.80。LLM按时间把重复合并、冲突当更新、兼容补充/共存保留,同时保存旧态而不是覆盖原证据。
- 3
用查询属性补充词法与语义检索
解析人/地点/时间约束,三路各召回;RRF常数60融成100候选,Qwen3-Reranker-8B读取事实、来源、时间和轨迹后选10项。预算约束是条目数,条目文本长度和重排成本仍需计量。
- 4
只把当前激活事实建成本地图
主体和值规范化为节点,谓词为有向边;4层4头TransformerConv把关系嵌入加入注意力及消息,均值池化后768→2048→4096投影成一个图token。10事实最多10边20节点,但时间有效性主要仍在文本轨迹。
- 5
冻结回答骨干,仅训练图接口
用ConvoMem过滤后的1,634正确QA监督图编码器与投影,目标为答案加简短证据路径;冻结句编码和LLM、不开LoRA。开权重模型用软token,API模型无法注入嵌入时改为文本序列化,两条接口要分别评价。
实验与证据
正文、实现/训练/检索评价附录和全部提示词已读;图3原图已检查;搜索及论文链接未找到可确认的官方仓库或模型卡;未复现。
来源证据六基准样本量LoCoMo1540、LongMemEval500、Fact-SH/MH各400、BEAM100K400/500K700。 表I;实验设置 ↗
我的解读六项宏平均每基准等权,不是按样本数汇总;不同长度BEAM的题目集也不同。
来源证据LoCoMo82.77±0.13、LME62.14±0.13为10次LLM判分统计;语义覆盖56.31±1.08、51.31±1.91用10,000次bootstrap。 IV-A3;表I ↗
我的解读两类误差来源不同;裁判稳定不能代表数据抽样或训练种子稳定,语义覆盖也不等于完整正确。
来源证据Fact-SH判分78.10,语义覆盖80.58却低于Mem0的81.70;Fact-MH判分12.50。 表I ↗
我的解读冲突追踪有增益但绝对多跳可靠性仍弱,单跳覆盖没有全面最优。
来源证据检索R@10/P@10/Suff@10/nDCG@10为89.08/20.92/97.11/82.50。 检索质量表;附录C ↗
我的解读这些相关性由GPT-4o-mini对金证据标注,Recall按证据微平均、充分性按题平均;97.11不是最终回答正确率,nDCG的理想序以同批检索相关条数计算。
来源证据ConvoMem1,200案例2,138QA,经正确答案过滤留1,634,类别5:3:4;10epoch、batch4累计4、lr1e−4。 附录B ↗
我的解读按保留样本划分但未报告比例及案例隔离细节;训练目标带reasoning_path,不等于纯图拓扑无语言监督。
来源证据去原子记忆宏均值51.62→44.19;去轨迹49.55、去重排46.39、去图47.67。 组件消融表 ↗
我的解读最大差异来自记忆粒度,不能将完整系统优势全部归给图编码;BEAM100K去图35.75超过完整35.31。
来源证据LoCoMo598.19检索文本token、1208.79全部在线LLMtoken、5.94秒/QA、离线摊销1.09秒。 效率表;IV-B6 ↗
我的解读RAG为3.84秒、LightMem2.99,QGMem不是最省时;1.09是建库费用摊销而非单库只需1秒,在线token也不涵盖全部非LLM算力。
来源证据BEAM10M得29.81,作者报告优于LightMem20.18个百分点。 IV-B3 ↗
我的解读跨长度题目不同,不能把曲线当相同问题只增加干扰的严格扩展实验;有界图不意味着有界总检索耗时。
来源证据附录去事件属性检索71.67,去混合检索81.93;主文称前者是混合检索一组成。 附录E ↗
我的解读两个删除定义没有足够实现细节,落差不能直接解释为可加因果贡献;发布代码后需确认各变体保留哪些通道。
来源证据最终提示词优先最新轨迹冲突证据,图中示例又询问先前目标。 图3;附录F ↗
我的解读时间条件必须约束最新有效态的适用范围;这不必然造成错误,但对历史问答与延迟报告是需要专测的张力。
开放情况与使用许可
论文给出实现参数与提示词,但未发现作者提供的代码、图编码器检查点或训练样本下载入口。Qwen/Llama等基础模型可获得,不代表QGMem组件已经发布。
LICENSE论文为arXiv非独占分发许可;图3用于必要方法讲解并保留作者信息;没有可核实的软件或权重许可证。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
Qwen3-8B在LoCoMo82.77、LongMemEval-S62.14,分别比该表最强基线高8.30和5.72个百分点。
去原子记忆宏均值−7.43、去重排−5.23、去图token−3.95,支持多环节组合而非只靠建图。
反方 · 哪些结论还不够
Fact-MH虽从最好基线6.50到12.50,绝对成功仍低;BEAM10M仅29.81,远未可靠处理所有长期记忆问题。
检索Recall@10为89.08,低于RAG90.34;图token在BEAM100K35.31反而低于无图35.75,不能声称所有检索指标和所有任务都提升。
10次裁判均值标准差不等于10次独立训练/生成;GPT-4o-mini通过文本图接入,没有实际软图token,跨骨干不能混成同一计算路径。
综合判断
可信的贡献是可追溯事件粒度、更新轨迹和小范围关系增强的组合;需要额外审计时态冲突、调参划分和建库成本,才能转成稳定长期助手。
我会先做的验证
建议实验(尚未执行):冻结相同原子记忆与检索结果,比较无图、文本图、单token与多token;按对话案例划分训练验证并做多种子,注入撤回/回溯时间/同名实体,报告人工核验正确率及随历史增长的总费用。