aiwillknow.AI 前沿观察每日 08:00 开始整理

2026.09.27 简报

每日研究 · 覆盖 2025.11.24 — 2026.09.27

以下为当期记录;研究详情页展示最新已核对信息。

全部收录
3 项工作
大模型论文公开 · 实现未确认

Greedy Precision:只在词元竞争接近时重算输出头

贪心解码的一致性修补,收益集中在小批量与低裕量步骤

温度为零仍可能因 BF16、FP16 和硬件算子差异生成不同文本。这项研究先检查原精度下第一、第二候选的 logit 差,仅在差值很小时以 FP32 重算输出头;目标是跨精度文本一致,而不是自动提高答案正确率。

Gaoyuan Du 等
数值精度贪心解码
阅读简报
大模型论文公开 · 实现未确认

OnPoKD:让蒸馏目标随样本可靠性变化

视觉语言模型分类适配;on-policy 控制器不是强化学习训练

固定教师可能把错误或对新类别的偏差传给学生。OnPoKD 用教师、学生和冻结零样本先验的可靠性线索,为每个样本调整目标混合、损失权重与温度;部署时删除控制器,保留原学生分类结构。

Hongyuan Zhang 等
视觉语言模型知识蒸馏
阅读简报
大模型内核代码 MIT · 完整模型未核实

Qwen3.8-Next:混合注意力、门控残差与主机侧容量

回顾独立架构报告:125B、激活 6B,另有 51B n-gram 容量

这份架构报告研究如何同时降低长上下文成本并稳定大规模训练:三层 Gated DeltaNet 搭配一层 Qwen Sparse Attention,门控残差控制读写,另将 n-gram 容量放到主机内存。它与已收录的通用 Qwen3.8 发布不是同一项工作。

Qwen 团队 · Zihan Qiu 等
混合架构长上下文
阅读简报

人物与观点

0 条

该期没有收录这个领域的人物动态。

← 返回每日归档