Telescopic LM:把每个网络前缀都训练成可用出口
一次训练覆盖连续深度,但中间尺寸仍不如专门训练的模型
固定几个早退层的模型,在未训练的深度停止常会崩溃。TLM每个批次随机训练一个前缀,再锚定完整网络,使1至20层都能输出可用概率;其收益是预算覆盖更平滑,不是所有尺寸精度更高,也没有实现逐token任意切换深度。
Zhilin Guo 等 · 剑桥大学等阅读简报
每日研究 · 覆盖 2026.08.14 — 2026.09.30
以下为当期记录;研究详情页展示最新已核对信息。
一次训练覆盖连续深度,但中间尺寸仍不如专门训练的模型
固定几个早退层的模型,在未训练的深度停止常会崩溃。TLM每个批次随机训练一个前缀,再锚定完整网络,使1至20层都能输出可用概率;其收益是预算覆盖更平滑,不是所有尺寸精度更高,也没有实现逐token任意切换深度。
120个真实任务中最佳配置完成42.5%;改对一个仓库仍可能整体失败
前端、后端、SDK往往必须一起改变,单仓库榜单难以验证接口一致性。WideSWE从关联PR构造120个跨仓库任务,让agent处理共享请求,并要求所有目标仓库通过隐藏测试;结果揭示遗漏仓库、错误共享表示和修复后退化三类问题。
单步能证明,不代表能独立完成整道题;发布数据与论文规模也不同
ProofGap把数学分析教材解答中的中间结论变成带局部假设的证明任务,用Lean或受限DSL验证。它能定位整题分数掩盖的推理短板,但每一步获赠前序结论,不能把单步成功率当成端到端证明能力;当前仓库数据规模也与论文表格不同。
作者在署名报告中认为,GLM-5.3已表现出值得重视的端到端网络能力,评估风险还须考虑模型实际开放方式和防护条件。其隔离环境测试中,V8基准410次尝试有50次成功,对照Mythos Preview为56次;这不是对真实网络攻击成功率的估计。
中文转述09-29官方全文,无直接引语。报告由另一模型开发商撰写,部分Claude能力测试关闭防护,内部二进制基准未完全公开;能力分数、防护测试和真实可访问版本必须分开理解。本站未执行攻击或复现实验,不把作者的政策判断写成领域共识。