PileBelief:土堆表面一样,挖掘历史仍会改变结果
空间变化与响应记忆,分开保存真实执行和想象
PileBelief 为挖掘建立带历史的物理预测器:当前高度图和动作先产生局部预测,历史形变与负载响应再作有界修正。仿真支持历史有用,真实记录上的收益较小,且真机数据没有计划动作输入,不能称已实现闭环反事实规划。
图解主要方法
图 2 的两条记忆如何修正当前观察,并避免想象污染实测?

- 1
先学习当前观察的局部先验
局部高度、有效区域与铲斗扫掠几何进入 CNN,六维候选动作进入 MLP;输出地形变化、铲取体积 V、峰值力 F、边界流量 q 与失效体积 R。先训练局部网络,再冻结它学习历史修正,保持当前观察这个锚点。
- 2
保存形变与材料响应
地图按世界坐标登记形变,参考配置保留最近三次事件通道和三次响应向量;世界高度累积变化,原始事件缓存仍有界。另有 ConvGRU 递归记忆对照,不能把默认三事件缓存说成无限完整历史。
- 3
按候选动作读取相关区域
按平均绝对形变选择最多 12 个历史瓦片,并投到候选动作的纵横坐标系。空间 CNN 和响应 MLP 产生修正,tanh 限幅、sigmoid 门控决定强度;错误位置、错误动作对齐与错误响应的干预用于检查证据是否真的被使用。
- 4
在相同观察下学习隐藏差异
配对组共享当前观察和动作,但有不同隐藏历史;组内去均值损失强调历史可解释的结果差异,权重为 4。拥有更多历史信息本来就可能提高性能,需通过错配与容量对照进一步定位收益。
- 5
执行与推演维护不同状态
真实执行后才更新实测记忆;想象 rollout 使用独立状态,不能将预测结果写回实测证据。参考多步协议的第一步仍使用局部预测,动作排序实验是离线候选评估,并未展示真实挖掘闭环规划。
实验与证据
以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【参考仿真】局部模型五步联合误差 0.9408、History Transformer 0.8710、PileBelief 0.8393;动作遗憾 0.2757→0.0950。 表 1 与动作排序实验 ↗
我的解读我的解读:相对局部先验有明显收益,相对历史基线差距更小;排序评估使用另外学习的效用读出。
来源证据【MPM 扩展】338 次采挖中保留 309 条有效记录,另有失败和中断被排除;适配在目标域重新训练。 MPM 附录 ↗
我的解读我的解读:多材料结果不是零样本迁移;载荷与峰值力的部分差值区间跨零,不能写成全指标显著改善。
来源证据【真实挖掘】71 条训练、16 条开发、43 条留出;高度误差 114.74→112.17 mm,联合误差 0.9164→0.8720。 真实数据实验 ↗
我的解读我的解读:数据没有计划动作输入,只能预测采集策略下的后果,约 4.8% 联合收益不能当作任意候选动作预测能力。
开放情况与使用许可
正文表示实现拟在接收后发布,本次未确认独立实现或数据入口。引用 Newton 等上游仿真器不等于 PileBelief 已开放。
LICENSE实现及数据许可待确认。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
把空间位置和材料响应作为可干预的持久证据,并将想象与实测隔离,是物理世界模型值得复用的设计。
反方 · 哪些结论还不够
真实数据小、收益有限且缺少计划动作,目标域重训与失败过滤限制了泛化和闭环解释。
综合判断
适合研究颗粒材料的历史依赖预测,距离直接驱动真实挖掘规划仍需动作条件数据与安全闭环验证。
我会先做的验证
未执行的验证方案:采集含计划动作、失败与多种材料的重复挖掘序列,按土堆与时间整段留出;比较同观察不同历史的结果,并独立检查想象状态不会写入真实缓存。