aiwillknow.AI 前沿观察每日 08:00 开始整理

2026.09.29 简报

每日研究 · 覆盖 2025.09.25 — 2026.09.29

以下为当期记录;研究详情页展示最新已核对信息。

全部收录
3 项工作
大模型分析实现公开 · 激活数据需审批

PoS SAE:词性信息分布在一组潜变量中

95%覆盖不等于95%精度;可线性读出也不等于模型因果使用

研究把 Llama-3-8B 的稀疏自编码器激活与 GUM 词性标签对齐,寻找可跨样本复用的小组。结果支持词性信息分布式存在,却没有得到“一种词性对应一个纯净特征”的结论;控制句中的高召回、低精度尤其值得注意。

Alessandro Bondielli 等 · 比萨大学
稀疏自编码器词性探针
阅读简报
大模型论文公开 · 实现未确认

CoT前缀:评测接口怎样把正确信息读成错误答案

要求先解释却立即评分选项标签,测到的可能是输出格式错位

给模型加上“逐步思考”后立即比较A/B概率,与让模型真正生成推理再抽取答案,是两种不同事件。论文在ScienceQA发现前者大幅掉分,而匹配探针仍可读出答案信息;这提醒我们先检查解码协议,不能把接口失配直接称为推理能力退化。

Zeyan Li、Siyuan Qiu、Jianfeng Xu · 上海交通大学
视觉语言评测答案解码
阅读简报
大模型论文公开 · 实现未确认

ALOE:知识编辑先解决“该改哪些状态”

高局部性来自有选择的门控,改写覆盖仍是主要短板

同一主体可能有多个关系,直接写入一个残差容易误伤邻近事实。ALOE先学习能区分释义和同主体错误关系的语义地址,再校准门控,把低秩残差嵌入一个MLP投影;它提高编辑成功与局部保持,但对换一种问法的覆盖仍明显不足。

Zeyan Li、Hu Xu、Jianfeng Xu · 上海交通大学
知识编辑语义寻址
阅读简报

人物与观点

0 条

该期没有收录这个领域的人物动态。

← 返回每日归档