Greedy Precision:只在词元竞争接近时重算输出头
贪心解码的一致性修补,收益集中在小批量与低裕量步骤
温度为零仍可能因 BF16、FP16 和硬件算子差异生成不同文本。这项研究先检查原精度下第一、第二候选的 logit 差,仅在差值很小时以 FP32 重算输出头;目标是跨精度文本一致,而不是自动提高答案正确率。
Gaoyuan Du 等阅读简报
每日研究 · 覆盖 2025.11.24 — 2026.09.27
以下为当期记录;研究详情页展示最新已核对信息。
贪心解码的一致性修补,收益集中在小批量与低裕量步骤
温度为零仍可能因 BF16、FP16 和硬件算子差异生成不同文本。这项研究先检查原精度下第一、第二候选的 logit 差,仅在差值很小时以 FP32 重算输出头;目标是跨精度文本一致,而不是自动提高答案正确率。
视觉语言模型分类适配;on-policy 控制器不是强化学习训练
固定教师可能把错误或对新类别的偏差传给学生。OnPoKD 用教师、学生和冻结零样本先验的可靠性线索,为每个样本调整目标混合、损失权重与温度;部署时删除控制器,保留原学生分类结构。
回顾独立架构报告:125B、激活 6B,另有 51B n-gram 容量
这份架构报告研究如何同时降低长上下文成本并稳定大规模训练:三层 Gated DeltaNet 搭配一层 Qwen Sparse Attention,门控残差控制读写,另将 n-gram 容量放到主机内存。它与已收录的通用 Qwen3.8 发布不是同一项工作。
该期没有收录这个领域的人物动态。