aiwillknow.AI 前沿观察每日 08:00 开始整理

2026.09.20 简报

每日研究更新 · 覆盖 2026.09.13 2026.09.20

以下为当期记录;研究详情页展示最新已核对信息。

全部收录
2 项工作
大模型开放权重 · MIT

DeepSeek V4.1 Flash

缓存怎样压缩,以及近似重建会留下什么边界

新技术报告补充 CED、CSA2 与 SWA Bounded Replay 的分工:减少读入计算、跨层共享缓存,并用少量重算替代部分持久存储。沿用已有模型条目,不计作新模型发布。

DeepSeek
模型架构KV缓存
阅读简报
大模型论文公开 · 实现未核实

大模型在上下文中形成信念状态几何

从“可以读出”走向“确实参与预测”的机制证据

用隐马尔可夫过程生成序列,检查大模型内部是否表示隐状态的后验分布,再通过修改这一表示检验它是否影响预测。这里的“信念”是统计状态,不是主观意识。

Daniel Balcells、Andrew Jun Lee、Chirag Rastogi、Paul M. Riechers、Adam Shai、Xavier Poncini
可解释性上下文学习
阅读简报

人物与观点

1
Adam Shai · Xavier PonciniSimplex 研究者;相关论文共同作者
2026.09.15团队研究动态

用可证伪的生成过程预测内部表示

两人参与的作者团队将计算力学用于大模型的上下文学习研究:先计算受控序列应有的后验结构,再寻找内部对应表示并进行干预。团队同时指出,对任意隐状态过程和自然语言任务的推广尚未建立。

这是根据共同署名论文整理的团队研究动态,不是个人采访或直接引语。所述“信念状态”指统计后验;论文并未声称模型具有主观意识。

← 返回每日归档