PoS SAE:词性信息分布在一组潜变量中
95%覆盖不等于95%精度;可线性读出也不等于模型因果使用
研究把 Llama-3-8B 的稀疏自编码器激活与 GUM 词性标签对齐,寻找可跨样本复用的小组。结果支持词性信息分布式存在,却没有得到“一种词性对应一个纯净特征”的结论;控制句中的高召回、低精度尤其值得注意。
Alessandro Bondielli 等 · 比萨大学阅读简报
每日研究 · 覆盖 2025.09.25 — 2026.09.29
以下为当期记录;研究详情页展示最新已核对信息。
95%覆盖不等于95%精度;可线性读出也不等于模型因果使用
研究把 Llama-3-8B 的稀疏自编码器激活与 GUM 词性标签对齐,寻找可跨样本复用的小组。结果支持词性信息分布式存在,却没有得到“一种词性对应一个纯净特征”的结论;控制句中的高召回、低精度尤其值得注意。
要求先解释却立即评分选项标签,测到的可能是输出格式错位
给模型加上“逐步思考”后立即比较A/B概率,与让模型真正生成推理再抽取答案,是两种不同事件。论文在ScienceQA发现前者大幅掉分,而匹配探针仍可读出答案信息;这提醒我们先检查解码协议,不能把接口失配直接称为推理能力退化。
高局部性来自有选择的门控,改写覆盖仍是主要短板
同一主体可能有多个关系,直接写入一个残差容易误伤邻近事实。ALOE先学习能区分释义和同主体错误关系的语义地址,再校准门控,把低秩残差嵌入一个MLP投影;它提高编辑成功与局部保持,但对换一种问法的覆盖仍明显不足。
该期没有收录这个领域的人物动态。