aiwillknow.AI 前沿观察每日 08:00 开始整理

2026.09.30 简报

每日研究 · 覆盖 2026.08.14 — 2026.09.30

以下为当期记录;研究详情页展示最新已核对信息。

全部收录
3 项工作
大模型论文公开 · 实现未确认

Telescopic LM:把每个网络前缀都训练成可用出口

一次训练覆盖连续深度,但中间尺寸仍不如专门训练的模型

固定几个早退层的模型,在未训练的深度停止常会崩溃。TLM每个批次随机训练一个前缀,再锚定完整网络,使1至20层都能输出可用概率;其收益是预算覆盖更平滑,不是所有尺寸精度更高,也没有实现逐token任意切换深度。

Zhilin Guo 等 · 剑桥大学等
弹性推理嵌套模型
阅读简报
大模型任务与评测代码公开 · 许可待确认

WideSWE:一个需求跨仓库,成功要看整个系统

120个真实任务中最佳配置完成42.5%;改对一个仓库仍可能整体失败

前端、后端、SDK往往必须一起改变,单仓库榜单难以验证接口一致性。WideSWE从关联PR构造120个跨仓库任务,让agent处理共享请求,并要求所有目标仓库通过隐藏测试;结果揭示遗漏仓库、错误共享表示和修复后退化三类问题。

Baoyi Wang、Xingliang Wang 等 · 浙江大学等
代码智能体跨仓库
阅读简报
大模型数据及验证材料公开 · 许可待确认

ProofGap:把数学证明拆成可验证的局部义务

单步能证明,不代表能独立完成整道题;发布数据与论文规模也不同

ProofGap把数学分析教材解答中的中间结论变成带局部假设的证明任务,用Lean或受限DSL验证。它能定位整题分数掩盖的推理短板,但每一步获赠前序结论,不能把单步成功率当成端到端证明能力;当前仓库数据规模也与论文表格不同。

Lihan Xie 等 · 上海交通大学
形式化推理Lean
阅读简报

人物与观点

1 条
Andrew Fasano · Marius Fleischer 等Anthropic 红队与政策研究作者
2026.09.29署名研究报告

评估网络能力时,应同时看可达模型与防护条件

作者在署名报告中认为,GLM-5.3已表现出值得重视的端到端网络能力,评估风险还须考虑模型实际开放方式和防护条件。其隔离环境测试中,V8基准410次尝试有50次成功,对照Mythos Preview为56次;这不是对真实网络攻击成功率的估计。

中文转述09-29官方全文,无直接引语。报告由另一模型开发商撰写,部分Claude能力测试关闭防护,内部二进制基准未完全公开;能力分数、防护测试和真实可访问版本必须分开理解。本站未执行攻击或复现实验,不把作者的政策判断写成领域共识。

← 返回每日归档