DeepSeek V4.1 Flash
用非对称编码与解码降低长任务成本
552B MoE 采用因果编码器—解码器结构,输入、输出分别激活 8B 和 16B 参数,并加入原生视觉理解。核心看点是把长上下文缓存与智能体推理成本作为架构设计目标。
近三个月扩展回顾 · 覆盖 2026.06.18 — 2026.09.18
以下为当期记录;研究详情页展示最新已核对信息。
用非对称编码与解码降低长任务成本
552B MoE 采用因果编码器—解码器结构,输入、输出分别激活 8B 和 16B 参数,并加入原生视觉理解。核心看点是把长上下文缓存与智能体推理成本作为架构设计目标。
能力提升之后,如何评估智能体的行为
Astra 系统卡除了报告能力与对齐评测,还披露思维链可监测性相对前代下降。它值得作为智能体行为研究材料:任务做得更强,并不意味着内部过程更容易被可靠监督。
同一底座,不同访问与防护边界
Fable 5.1 与 Mythos 5.1 使用同一模型,但配置不同防护与访问条件;前者一般可用,后者受限。官方同时展示编程、科学任务等进展,评测结果需连同工具框架和任务版本阅读。
研究模型没有写出来的内部推理
通过 Jacobian Lens 把内部激活映射到可读的词汇方向,研究一组可被报告、调节和用于多步推理的表示。作者称其具有全局工作空间特征,但明确不把它当作主观意识的证明。
Amodei 主张让前沿模型的能力增长与安全评估保持相称,而非只在发布前补做测试。他提出三个层次:允许常驻第三方评估团队检查训练与部署过程;在行业内协调标准;再寻求可核验的国际合作。文章把操作流程、对齐、可解释性和评测列为争取时间后应投入的具体方向。
这是作者的政策主张。常驻评估是 Anthropic 宣布的承诺,行业与国际协调仍属倡议,不能写成已经落实的机制。值得继续观察的是外部团队实际获得的访问权限、能否独立发布不利发现,以及“能力达到什么阈值才需额外评估”能否被明确。
Hassabis 提议设立有政府监督、行业参与的前沿 AI 标准机构,以定期更新的能力门槛确定哪些模型需要接受审查。设想中的流程从自愿提交发布前评估开始,再逐步正式化;评测应淘汰饱和题目,并发展独立的保留测试,减少实验室针对公开基准优化的空间。
这是署名文章中的制度提案,并非已通过的监管要求。与单次发布模型卡相比,其关键在于持续更新的测试和独立评估能力。对于 AGI 的时间与影响,文章表达的是作者判断;机构独立性、资金安排和跨国执行仍需进一步论证。