aiwillknow.AI 前沿观察每日 08:00 开始整理

2026.09.23 简报

每日研究 · 覆盖 2026.09.11 2026.09.23

以下为当期记录;研究详情页展示最新已核对信息。

全部收录
3 项工作
大模型评估代码可见 · 软件许可待明确

记忆还是上下文:一次事实冲突测试为什么会随问法翻转

31 个模型、六类事实与五种提问模板,区分参数知识和实验测量

这项研究向模型提供与已知事实冲突的短文本,检查回答更接近参数记忆还是眼前上下文。模型规模、事实频率、问法和填充文本都影响结果;最值得关注的是,同一模型的“偏好”会因测量模板大幅翻转,不能把单次冲突测试当成稳定知识属性。

Guilhem Fouilhé 等
事实冲突RAG 评估
阅读简报
大模型论文公开 · 实现未确认

语言通信瓶颈:模型说对了,另一个模型能还原吗

用表达式往返实验拆开生成、理解和共享协议

作者把算术表达式交给一个模型写成英语,再让另一个模型恢复表达式,用符号等价检查信息是否保住。自然语言的歧义会造成角色相关的错误;结构化协议和微调有帮助,但论文的生成端故障归因仍只是模型面板启发式。

Apple · Xavier Suau 等
多智能体通信结构化输出
阅读简报
大模型论文公开 · 实现未确认

SWE-Proof:通过证明检查,为什么仍可能修错代码

规格、程序映射、隐藏测试与审计是四条不同的信任边界

SWE-Proof 为真实仓库修复任务构建形式化规格与参考实现,并分别检验补丁、证明和语义对应。它最有价值的发现是“证明了错误抽象”仍会失败;当前预印本部分正文与附录数字不一致,本篇侧重可核对的方法及案例,不据此给模型排确定名次。

UC Berkeley、Amazon 等 · George Ma 等
代码智能体形式验证
阅读简报

人物与观点

0

该期没有收录这个领域的人物动态。

← 返回每日归档