aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型论文图解

大模型在上下文中形成信念状态几何

从“可以读出”走向“确实参与预测”的机制证据

IN A NUTSHELL

用隐马尔可夫过程生成序列,检查大模型内部是否表示隐状态的后验分布,再通过修改这一表示检验它是否影响预测。这里的“信念”是统计状态,不是主观意识。

01

图解主要方法

预测下一个符号时,模型是否维持了对不可见生成状态的概率判断?

图 1 · 生成过程、内部几何与干预验证
图 1 · 生成过程、内部几何与干预验证查看大图 ↗
Daniel Balcells 等,arXiv v1,第 2 页 Figure 1。仅裁去图外正文,图内内容未修改。 · 原论文与图注 ↗ · 图片版权归原作者;arXiv 托管许可不是通用图片再许可。本页引用必要原图作研究评述。
  1. 1

    先知道正确答案是什么

    图 A 左侧 HMM 的 S1/S2/S3 是隐状态,F/Q 是可见符号。已知生成规则后,可以计算每段历史对应的真实后验。

  2. 2

    将统计目标与内部表示对齐

    图 A 中间将序列输入预训练 LLM;右侧用线性探针从激活恢复后验。图 B 中部比较真实目标和随机、打乱目标。

  3. 3

    修改表示,看预测是否改变

    图 B 右侧对应干预:写入目标后验相关表示,检查输出更接近目标的预测分布,还是仍跟随原历史;只画出几何形状还不够。

02

实验与证据

六个开放模型、40 个特定 HMM;序列长 20,000 token,每种条件分析 10 条序列。结论来自作者实验,本站未复现。

论文证据作者在最后 5,000 个位置随机取 20% 拟合探针、80% 测试;每条序列分别拟合。 论文原文

我的解读这验证了序列内解码,但不直接证明单个通用探针可跨自然语言任务工作。

论文证据后验子空间干预使输出向目标预测移动;论文也报告小模型和部分参数范围的例外。 论文原文

我的解读这是功能相关性的证据,比相关性更强,但不能推广为所有模型在所有任务上都按同一贝叶斯算法运作。

03

开放情况与使用许可

已读取 PDF 正文的方法、控制、干预与局限,并检查相关附录说明;未核实作者实验代码,不因被测模型开放就把本研究标成开源。

LICENSE论文为 arXiv 非独占托管许可;实验代码许可未核实

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

我的判断:受控生成器让“内部状态应该是什么”成为事先可计算的问题,避免把任何容易解码的特征都解释成理解。

干预还区分了目标后验和任意扰动,使机制论证更具体:表示必须以有方向的方式影响后续预测。

反方 · 哪些结论还不够

序列内随机划分的位置具有时间相关性,应再做连续时间块留出和新序列迁移。否则漂亮的解码分数可能高估部署中读出内部状态的能力。

控制实验排除部分替代解释,无法排除全部等价特征。尤其是自然语言缺少可计算的“真实隐状态”,迁移这套方法需要重新定义目标。

综合判断

这是关于受控上下文学习的有价值机制证据;它既不证明模型具有人的信念,也不证明自然语言推理普遍接近最优。

我会先做的验证

建议实验,尚未执行:固定探针跨新序列测试,再逐步增加状态数、熵与生成规则切换;同时报告预测误差、跨序列解码和干预效果,保留失败案例,而不是只挑清晰几何。

继续探索大模型