aiwillknow.AI 前沿观察每日 08:00 开始整理

2026.09.28 简报

每日研究 · 覆盖 2025.07.06 — 2026.09.28

以下为当期记录;研究详情页展示最新已核对信息。

全部收录
3 项工作
大模型学习器权重公开 · 训练流程未公开

Self-Play Pretraining:程序自博弈能学到多少通用结构

零自然数据梯度的概念验证;不等于没有先验或不需要世界知识

两个随机初始化的字节模型互相塑造训练课程:生成器写程序,解释器产出字节,学习器预测字节,学习反馈再更新生成器。作者观察到自然数据预测损失下降和上下文规则学习,但规模仍小于 25M,且自然验证集参与了调参。

Aditya Cowsik 等
自博弈预训练
阅读简报
大模型实现代码公开 · 许可未确认

Seek:让相关性反馈改变下一轮检索

伪段落生成、检索、评分反复协作,输出仍是文档排序

一次召回遗漏的文档,单纯重排序无法找回。Seek 用已检索文档的相关性判断生成下一轮伪段落,重新搜索整个语料库,最终合并评分与检索分数;它研究的是检索排名,不是直接生成问答答案。

Amin Bigdeli 等
信息检索迭代反馈
阅读简报
大模型论文公开 · 实现未确认

ICLR:智能体什么时候可以忘记刚才的推理

按代理模型预测熵删块,总体增益掩盖了领域差异

ICLR 在每步工具交互之后压缩刚完成的推理文本,保留动作和观察,再把压缩历史永久写回。论文把推理视为暂存任务状态:结论写进代码、文件或工具反馈后,旧文本可能更容易替代;这仍是有风险的经验压缩规则。

Mingxuan Wang 等
上下文压缩长任务
阅读简报

人物与观点

0 条

该期没有收录这个领域的人物动态。

← 返回每日归档