Self-Play Pretraining:程序自博弈能学到多少通用结构
零自然数据梯度的概念验证;不等于没有先验或不需要世界知识
两个随机初始化的字节模型互相塑造训练课程:生成器写程序,解释器产出字节,学习器预测字节,学习反馈再更新生成器。作者观察到自然数据预测损失下降和上下文规则学习,但规模仍小于 25M,且自然验证集参与了调参。
Aditya Cowsik 等阅读简报
每日研究 · 覆盖 2025.07.06 — 2026.09.28
以下为当期记录;研究详情页展示最新已核对信息。
零自然数据梯度的概念验证;不等于没有先验或不需要世界知识
两个随机初始化的字节模型互相塑造训练课程:生成器写程序,解释器产出字节,学习器预测字节,学习反馈再更新生成器。作者观察到自然数据预测损失下降和上下文规则学习,但规模仍小于 25M,且自然验证集参与了调参。
伪段落生成、检索、评分反复协作,输出仍是文档排序
一次召回遗漏的文档,单纯重排序无法找回。Seek 用已检索文档的相关性判断生成下一轮伪段落,重新搜索整个语料库,最终合并评分与检索分数;它研究的是检索排名,不是直接生成问答答案。
按代理模型预测熵删块,总体增益掩盖了领域差异
ICLR 在每步工具交互之后压缩刚完成的推理文本,保留动作和观察,再把压缩历史永久写回。论文把推理视为暂存任务状态:结论写进代码、文件或工具反馈后,旧文本可能更容易替代;这仍是有风险的经验压缩规则。
该期没有收录这个领域的人物动态。