aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型全文深读与原图讲解

小模型抽象推理系统研究:同分布会做题,不代表规则能迁移

千余次实验拆开训练、网格尺度与输出格式,单模型代表一种架构仍是混杂因素

IN A NUTSHELL

研究用ARC-TGI可重复采样的网格变换家族,对三种小模型开展超过1000次训练与评估。结果把同家族新样本、网格尺度变化和原始ARC跨基准迁移区分开:同分布拟合可很高,但迁移、提示长度与直接输出网格或生成Python程序会明显改变表现。

01

图解主要方法

网格变换的高分究竟来自可迁移规则,还是对训练分布及回答接口的适配?

从任务生成、复杂度和提示构造到模型适配、分布变化评估及局部注意力诊断
图1|可控任务家族与匹配实验流程查看大图 ↗
Nishat 等,arXiv:2610.08680v1。PDF第4页图1裁取并转为PNG,图内内容未改动。 · 原始来源与图注 ↗ · CC BY 4.0;PDF第4页图1裁取并转PNG,未改图内内容
  1. 1

    用任务生成器固定规则、改变实例

    图1左侧ARC-TGI生成器分为输入采样、确定性变换和合法样例组装;同一episode保持任务级变量一致,颜色、位置等网格级变量可变。研究仅用满足约束的ARC-AGI-1训练家族,不能把全部461个资源生成器当作实际训练支持。

  2. 2

    按实验轴建立匹配的数据和提示

    分别改变每家族样本数、训练家族数量、大小网格、示例数量及回答形式。训练和评估任务ID分离;未见生成器划分只是协议能力,论文没有单独报告该端点,已测的是尺度迁移和跨ARC基准。

  3. 3

    分别调优三个模型代表

    使用Qwen3-1.7B、约2B的T5Gemma-ml-ml-ul2-it及总14.3B/激活2.7B的Qwen1.5-MoE。624配置搜索学习率等参数,再比较全参数与LoRA;一个统一配方未必公平,但分别挑最优也不构成架构因果实验。

  4. 4

    区分网格转导与可执行规则归纳

    转导直接输出网格,归纳生成Python函数后在沙箱执行;另加自然语言描述与变换轨迹构成推理提示条件。代码执行给出不同计算接口和形式语言先验,不是只换答案排版。

  5. 5

    分别测覆盖、迁移和内部诊断

    图1右侧除精确网格匹配,还报告生成器层面轨迹;再在少量选定任务上测注意力熵和五层窗口遮边。遮边比较teacher forcing下目标答案平均token对数概率,归一化尺度因模型而异,不能直接比较绝对效应大小。

02

实验与证据

完整阅读90094字符正文、参考文献与附录A–F,并从PDF第4页视检图1;未运行训练、网格任务或注意力干预。

来源证据三模型同家族验证最高54.4%、32.8%、21.1%;原ARC观测检查点峰值3.5%、2.75%、2.0%。 表1、附录D ↗

我的解读前者用于配置比较,后者事后取最大且任务来源与难度同时变化;支持跨基准迁移弱,不是纯粹新规则效应估计。

来源证据尺度实验训练123家族,每家族50例;评估118家族,每家族20例。小→大时D68.5降到24.3、MoE53.1降到12.7、ED64.4降到5.9。 第4.2节、表4 ↗

我的解读规则家族保持,掉分分别44.2、40.4、58.5个百分点;主文大网格写大于16×16,表4写边长≥16,精确边界需清单澄清。

来源证据大网格训练转小网格:D65→51.4、MoE42.4→36.4;ED33.9→45反而提高11.1个百分点。 表4 ↗

我的解读迁移方向并不对称,也不是每个模型都在匹配尺度最好;输入长度只是尚未隔离验证的解释。

来源证据固定约5800实例、186生成器,示例1→4:D36.7→51.9、MoE20.1→30.6、ED43.6→23.4。 表5 ↗

我的解读更多上下文不保证更高准确率;ED上下文8K,D为32768,但不能仅据此把原因全部归为窗口。

来源证据few-shot直接网格与程序归纳:D44.3→52.3、MoE33.7→59.0、ED0→16.1。 表5 ↗

我的解读输出形式会改变模型排序,不能把执行程序的能力与直接生成网格当成同一预算测量。

来源证据D全参数53.90%、70.34 GPU小时;LoRA54.36%、89.10 GPU小时。ED全参数21.12%,LoRA10.81%;MoE表2为32.57与32.89。 表2及附录B ↗

我的解读LoRA参数少不一定总计算少,D的选择训练轮数更长。表1将MoE LoRA写32.8,表2为32.89,保留表间差异。H200=2×H100只是作者成本记账约定。

来源证据训练广度60→193家族,在固定50家族评估上D39.3→51.6、MoE39.1→45、ED7.5→13;主文说每家族30评估例,附录C写20。 表3、3.1节及附录C ↗

我的解读趋势有价值,精确支持数量需数据清单核实;广度变化同时增加总训练例数,不能单独归因于多样性。

来源证据注意力分析选取小/大网格诊断任务,遮边使用五层窗口及各模型自身基线归一化。 图7、附录F ↗

我的解读低熵不等于推理好,模型间熵上界和遮边分母均不同;属于探索性局部诊断,不是通用机制证明。

03

开放情况与使用许可

论文描述需要公开模型修订、种子、数据清单、启动命令和选择规则,但正文入口未核实本研究完整实验代码、清单与微调检查点。底层ARC-TGI资源与本研究千余次实验工件分别看待。

LICENSE论文及原图采用CC BY 4.0。图1从PDF第4页裁取并转为PNG,未改图内内容;注明作者与来源。实验代码和微调权重许可未核实。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

保留同一变换家族仅改变网格尺度,就能观察大幅掉分,比把所有失败都归为新任务更有诊断价值。

固定家族和任务身份改变示例数,以及比较程序归纳与直接网格输出,显示接口确实改变可测能力。

反方 · 哪些结论还不够

不同架构代表同时改变预训练、分词、容量、上下文和推理后端,不能给出因果架构排名。

大量配置不等于重复种子不确定性估计;选配置的5%集及事后挑出的ARC峰值不能冒充独立测试。

注意力熵取样域不同,遮边效应按各自基线归一化,仅少数挑选任务;不能从图形推断通用推理机制。

综合判断

这是一项有价值的评估方法和失败条件研究。它支持“分布内正确率不能替代迁移证据”,同时保留程序表示、上下文和优化条件的重要作用,不支持对小模型或架构作一概而论的智力判断。

我会先做的验证

建议实验,未执行:每类选多个预训练与容量更匹配的模型,固定token和执行预算、多种子训练,用独立验证选检查点,在生成器不重合和尺度分层测试集上报告置信区间;同时比较文本网格与对象结构表示,验证上下文因素能否解释退化。

继续探索大模型