DeepSeek V4.1 Flash
用非对称编码与解码降低长任务成本
552B MoE 采用因果编码器—解码器结构,输入、输出分别激活 8B 和 16B 参数,并加入原生视觉理解。核心看点是把长上下文缓存与智能体推理成本作为架构设计目标。
DeepSeek阅读简报
用非对称编码与解码降低长任务成本
552B MoE 采用因果编码器—解码器结构,输入、输出分别激活 8B 和 16B 参数,并加入原生视觉理解。核心看点是把长上下文缓存与智能体推理成本作为架构设计目标。
能力提升之后,如何评估智能体的行为
Astra 系统卡除了报告能力与对齐评测,还披露思维链可监测性相对前代下降。它值得作为智能体行为研究材料:任务做得更强,并不意味着内部过程更容易被可靠监督。
同一底座,不同访问与防护边界
Fable 5.1 与 Mythos 5.1 使用同一模型,但配置不同防护与访问条件;前者一般可用,后者受限。官方同时展示编程、科学任务等进展,评测结果需连同工具框架和任务版本阅读。
研究模型没有写出来的内部推理
通过 Jacobian Lens 把内部激活映射到可读的词汇方向,研究一组可被报告、调节和用于多步推理的表示。作者称其具有全局工作空间特征,但明确不把它当作主观意识的证明。