全局理解如何测:隐藏中间状态,检验约束能否传播
组合训练改善逆关系与交换规律,周期性和深层推导仍失败
模型记住局部转移,不一定能推出约束蕴含的未见转移。论文构造有逆、交换、组合和周期规律的有限世界,在相同路径上对比下一状态与隐藏中间状态的组合训练;后者更会传播部分规律,但深证明链、周期性及分叉图仍暴露明显边界。
图解主要方法
图1中两个模型看到同一路径,为何输入里的中间状态会改变泛化?

- 1
生成可审计的有限状态世界
1024个随机状态由动作连接,构造逆、交换、组合、周期等约束,检查短动作序列中额外等价关系。留出5%由已见转移与规律可推导的边,训练并不直接告诉模型这些约束,因此测试关注从局部例子推断一致结构。
- 2
在相同路径上改变条件信息
下一状态训练每步看到真实中间状态,容易逐边拟合;组合训练只给起点和动作序列,隐藏中间状态,迫使模型组合动作影响。训练目标仍监督到达状态;语言版本另有只评终点及T1路径的处理,不是所有领域逐字相同协议。
- 3
用未见转移与跨领域任务验收
比较注意力、循环和状态空间等四类架构,五种子;再到AI2THOR运动和匿名化Wikidata关系。几何任务排除部分碰撞并使用近似成立的运动约束,语言事实关系也有分叉,不能直接当真实世界全局一致性证明。
- 4
按证明深度追踪传播边界
定义推导留出边所需最少推理轮数d,逐层检查新事实。更长组合路径T帮助更深层,但收益会饱和;训练曲线中先浅后深的级联是行为现象,不是已经定位模型内部执行了符号证明算法。
实验与证据
以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【受控主结果】4层宽64网络、15万更新、五种子,组合训练对逆/交换/组合规律平均约96%,下一状态训练拟合已见边却难以传播;周期性两者都失败。 图1、图2与实验设置 ↗
我的解读我的解读:证据支持部分结构传播,不支持所有规律或任意规模的“理解”。
来源证据【迁移】AI2THOR视觉任务下一状态约50/51%,组合约83/93%;Wikidata微调模型逆关系45%、组合73%,反向分叉仍失败。 图3、附录跨域实验 ↗
我的解读我的解读:几何与语义都有对应收益,但关系多值性与环境近似约束削弱统一规律假设。
来源证据【深度】T=2时d1约95%、d2为49%、d3为15%、d4为5%;增加T帮助部分深度,更深层仍约20%平台。 图4、证明深度与控制附录 ↗
我的解读我的解读:不能把短路径高分外推长程推理;相同更新次数下长T计算量更大,也不是严格等算力比较。
开放情况与使用许可
已读全文及附录A–G;本次未核实专属数据生成器、训练代码或检查点公开。
LICENSE专属实现与数据许可未确认;论文原图为CC BY 4.0。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
把抽象的全局理解转成有可推导真值的留出转移,给世界模型一致性提供可诊断实验。
反方 · 哪些结论还不够
周期规律、分叉关系和深层推导仍失败;有限合成世界与等更新非等计算限制外推。
综合判断
组合训练是促进局部信息整合的有效线索,尚不能替代长程、一致性和反事实的独立验收。
我会先做的验证
未执行的验证方案:固定训练token与FLOPs而非更新数,在未见世界规模、关系分叉、周期长度和证明深度上分层;加入隐藏状态噪声与真实碰撞,检查收益来自组合约束还是更长上下文。