aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型全文深读与原图讲解

Greedy Precision:只在词元竞争接近时重算输出头

贪心解码的一致性修补,收益集中在小批量与低裕量步骤

IN A NUTSHELL

温度为零仍可能因 BF16、FP16 和硬件算子差异生成不同文本。这项研究先检查原精度下第一、第二候选的 logit 差,仅在差值很小时以 FP32 重算输出头;目标是跨精度文本一致,而不是自动提高答案正确率。

01

图解主要方法

图 2 为什么把干预放在 lm_head,而不把整个模型都改成 FP32?

原论文图 2:低裕量分歧与选择性 FP32 输出头重算
原论文图 2:低裕量分歧与选择性 FP32 输出头重算查看大图 ↗
Gaoyuan Du 等,arXiv 2609.26621v1;原图内容未改动。 处理记录:从 PDF 第 5 页裁切完整图 2,保留图内文字,未改动内容 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    把分歧定位到离散决策边界

    图 2A 区分 Transformer 主体中的连续数值扰动与输出头上的候选翻转。当原始 top-2 logit 间隔很小,微小误差就可能改变 argmax;一旦选出不同词元,后续上下文也不同。这个机制是有条件的经验解释,不保证全部首个分歧都出现在同一层。

  2. 2

    先用原精度确定是否触发

    图 2B 先计算原来的 BF16/FP16 logits,只有 top-2 间隔低于 10⁻³ 才触发修补,其余步骤直接执行原始 argmax。这样保留绝大多数原推理路径;不能先全面改变 logits 再把差异称为同一个门控实验。

  3. 3

    对比三个不同干预以识别误差来源

    A 只把已算出的 logits 整数化,不能挽回已经改变的候选顺序;B 对少量候选在 FP32 中重算点积;C 对全词表重算输出头。B 与 C 在部分实验的近似收益支持低裕量候选竞争的解释。提升精度时使用的是已经低精度存储过的权重和隐藏状态,不是恢复原始全精度模型。

  4. 4

    分别衡量文本一致、任务正确与部署开销

    EAR 要求整条生成序列完全一致;答案相同、测试通过或相同语义都不等于 EAR。图中的局部门控也不保证跨硬件确定性,论文附录继续检查批大小、FP8、质量变化和硬件组合,不能只取最漂亮的一行。

02

实验与证据

以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【小样本跨精度实验】TinyLlama 的 GSM8K 子集 n=100,EAR 从 41% 到 63%;两个代码条件从 36% 到 61%、30% 到 55%。 主文干预实验及质量附录 ↗

我的解读我的解读:这是完全相同序列的比例,不是数学或编程正确率;TinyLlama 在部分质量集上的正确率很低,不能靠一致性推断能力。

来源证据【质量与指标分离】Qwen 的 HumanEval n=164,序列一致率 26.2%,结果一致率却达 97.6%;BF16 pass rate 从 50.0% 到 51.2%。Mistral 的部分质量项下降约 3–5 个百分点但不显著。 质量评估与非劣检验附录 ↗

我的解读我的解读:“无显著下降”不等于已经证明无害;不同指标反映的风险不同,质量结论受样本规模和非劣界限影响。

来源证据【部署边界】A10G 配置报告延迟约增加 1.4%、内存增加约 11%;收益主要在批大小不超过 4,batch=8 未见相同改善。全模型 FP8 的收益约 1 个百分点,远小于隔离输出头实验。 批量、FP8、硬件及分歧位置附录 ↗

我的解读我的解读:不能把局部输出头实验推广为全模型量化修复。正文与附录对提示模板、首个分歧位置还有表述差异,需要固定配置清单复核。

03

开放情况与使用许可

已读 arXiv v1 的 42 页全文与附录;论文版面标注 TMLR 2026 年 9 月,首发按 arXiv 09-22。OpenReview 页面本次不可访问,未据此确认评审状态或实现发布。

LICENSE论文及图 2 为 CC BY 4.0;本研究代码与权重发布许可未确认。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

把一致性问题拆成可测的 logit 裕量与局部重算,适合审计低批量推理中的偶发词元翻转。

反方 · 哪些结论还不够

小样本、提示协议表述不一致及批量依赖限制普遍结论;一致文本不代表正确答案,也不保证跨硬件完全确定。

综合判断

值得作为可重复推理的局部工程试验,采用前应分别设定序列一致、任务质量、延迟和显存门槛。

我会先做的验证

未执行的验证方案:固定模型文件、提示模板、算子和硬件,预注册阈值后在独立样本上比较原推理、top-2 重算和全输出头重算,按 batch=1/4/8 分层报告 EAR、结果正确率、置信区间与峰值显存。

继续探索大模型