aiwillknow.AI 前沿观察每日 08:00 开始整理

2026.09.18 简报

近三个月扩展回顾 · 覆盖 2026.06.18 2026.09.18

以下为当期记录;研究详情页展示最新已核对信息。

全部收录
6 项工作
大模型开放权重 · MIT

DeepSeek V4.1 Flash

用非对称编码与解码降低长任务成本

552B MoE 采用因果编码器—解码器结构,输入、输出分别激活 8B 和 16B 参数,并加入原生视觉理解。核心看点是把长上下文缓存与智能体推理成本作为架构设计目标。

DeepSeek
模型架构KV缓存
阅读简报
大模型闭源 · 托管服务

GPT-6 Astra

能力提升之后,如何评估智能体的行为

Astra 系统卡除了报告能力与对齐评测,还披露思维链可监测性相对前代下降。它值得作为智能体行为研究材料:任务做得更强,并不意味着内部过程更容易被可靠监督。

OpenAI
智能体安全评测
阅读简报
大模型闭源 · 分级访问

Claude Fable / Mythos 5.1

同一底座,不同访问与防护边界

Fable 5.1 与 Mythos 5.1 使用同一模型,但配置不同防护与访问条件;前者一般可用,后者受限。官方同时展示编程、科学任务等进展,评测结果需连同工具框架和任务版本阅读。

Anthropic
编程科研
阅读简报
大模型开放权重 · 专用许可

Qwen3.8

旗舰能力走向开放权重

Qwen3.8 将旗舰级能力扩展到开放权重路线,提供超大 MoE 与 27B 版本,强调编程、专业工作和长程任务完成。除模型规模,还值得跟踪推理强度控制与多轮思考上下文保留。

Qwen · 阿里巴巴
智能体开放权重
阅读简报
大模型开放权重 · 专用许可

Kimi K3

原生视觉与百万级上下文的开放模型

原生多模态 K3 将 Kimi Delta Attention 与跨层 Attention Residuals 结合,以稀疏 MoE 扩展到 2.8T 参数。公开材料既讨论长程编程能力,也明确了大规模部署与缓存方面的工程要求。

Moonshot AI
长上下文多模态
阅读简报
大模型方法代码 · Apache-2.0

Jacobian Lens / J-space

研究模型没有写出来的内部推理

通过 Jacobian Lens 把内部激活映射到可读的词汇方向,研究一组可被报告、调节和用于多步推理的表示。作者称其具有全局工作空间特征,但明确不把它当作主观意识的证明。

Anthropic · Wes Gurnee、Jack Lindsey 等
可解释性内部表示
阅读简报

人物与观点

3
Dario AmodeiAnthropic 联合创始人
2026 年 9 月 · 原文仅标月份观点转述

为安全评估留出追赶能力的时间

Amodei 主张让前沿模型的能力增长与安全评估保持相称,而非只在发布前补做测试。他提出三个层次:允许常驻第三方评估团队检查训练与部署过程;在行业内协调标准;再寻求可核验的国际合作。文章把操作流程、对齐、可解释性和评测列为争取时间后应投入的具体方向。

这是作者的政策主张。常驻评估是 Anthropic 宣布的承诺,行业与国际协调仍属倡议,不能写成已经落实的机制。值得继续观察的是外部团队实际获得的访问权限、能否独立发布不利发现,以及“能力达到什么阈值才需额外评估”能否被明确。

Demis HassabisGoogle DeepMind 联合创始人
2026.07.14观点转述

为前沿 AI 建立动态、严格的评估机制

Hassabis 提议设立有政府监督、行业参与的前沿 AI 标准机构,以定期更新的能力门槛确定哪些模型需要接受审查。设想中的流程从自愿提交发布前评估开始,再逐步正式化;评测应淘汰饱和题目,并发展独立的保留测试,减少实验室针对公开基准优化的空间。

这是署名文章中的制度提案,并非已通过的监管要求。与单次发布模型卡相比,其关键在于持续更新的测试和独立评估能力。对于 AGI 的时间与影响,文章表达的是作者判断;机构独立性、资金安排和跨国执行仍需进一步论证。

Jack Lindsey · Wes Gurnee 等Anthropic 可解释性研究团队
2026.07.06研究动态

可读的内部表示,不等于完整读心

团队用 Jacobian Lens 研究语言模型内部可被报告、调节和用于推理的表示,并通过干预测试其作用。它提醒读者:模型输出的解释只是观察计算过程的一种线索。

依据共同署名论文与官方研究介绍转述。作者明确不据此判断主观体验;本站也不把“全局工作空间”的功能类比写成意识结论。

← 返回每日归档