aiwillknow.AI 前沿观察每日 08:00 开始整理

人物与观点

Dario AmodeiAnthropic 联合创始人
2026 年 9 月 · 原文仅标月份观点转述

为安全评估留出追赶能力的时间

Amodei 主张让前沿模型的能力增长与安全评估保持相称,而非只在发布前补做测试。他提出三个层次:允许常驻第三方评估团队检查训练与部署过程;在行业内协调标准;再寻求可核验的国际合作。文章把操作流程、对齐、可解释性和评测列为争取时间后应投入的具体方向。

这是作者的政策主张。常驻评估是 Anthropic 宣布的承诺,行业与国际协调仍属倡议,不能写成已经落实的机制。值得继续观察的是外部团队实际获得的访问权限、能否独立发布不利发现,以及“能力达到什么阈值才需额外评估”能否被明确。

Demis HassabisGoogle DeepMind 联合创始人
2026.07.14观点转述

为前沿 AI 建立动态、严格的评估机制

Hassabis 提议设立有政府监督、行业参与的前沿 AI 标准机构,以定期更新的能力门槛确定哪些模型需要接受审查。设想中的流程从自愿提交发布前评估开始,再逐步正式化;评测应淘汰饱和题目,并发展独立的保留测试,减少实验室针对公开基准优化的空间。

这是署名文章中的制度提案,并非已通过的监管要求。与单次发布模型卡相比,其关键在于持续更新的测试和独立评估能力。对于 AGI 的时间与影响,文章表达的是作者判断;机构独立性、资金安排和跨国执行仍需进一步论证。

Jack Lindsey · Wes Gurnee 等Anthropic 可解释性研究团队
2026.07.06研究动态

可读的内部表示,不等于完整读心

团队用 Jacobian Lens 研究语言模型内部可被报告、调节和用于推理的表示,并通过干预测试其作用。它提醒读者:模型输出的解释只是观察计算过程的一种线索。

依据共同署名论文与官方研究介绍转述。作者明确不据此判断主观体验;本站也不把“全局工作空间”的功能类比写成意识结论。