ESC
AI 1 分钟阅读

仅花67美分在ARC-AGI-1上取得44%成绩

独立研究者在ARC-AGI-1基准上仅用67美分训练成本取得44%成绩。通过仅对输出token计算损失的监督式训练、引入ARC-2非重叠任务数据及NorMuon优化器等改进,作者证明纯Transformer无需递归结构即可实现高性能,并回应了Jeremy Howard等多位知名研究者的争议,代码已开源。

来源:Hacker News

主要目标是寻找能够提升模型样本效率的架构/算法改进。

分数提升最大的原因来自于

一个重大变化是我不再在输入token上进行训练。这意味着损失函数只包含输出token(这使得该方法变为监督式)。这样做的效果略好一些,从40%提升到44%,但我不明白为什么。也许是因为模型容量有限

我还通过加入ARC-2中不重叠的任务来扩充训练数据。我非常谨慎地操作以确保没有数据泄露。如果你不喜欢,可以移除这些额外数据,模型仍能达到约40%的分数,但需要约两倍的计算量。

背景:ARC-2包含773个ARC-1谜题和347个新谜题。ARC-1的大多数评测谜题都被重复包含,所以如果直接在ARC-2上训练,就会造成数据泄露,你会得到100%的分数。我通过仔细过滤掉这773个重复谜题来避免这种情况(因此没有泄露!)

还有许多其他改动在性能或速度上带来了渐进式提升。完整改动列表见此处。

由于我不再在输入上训练,这种方法现在是监督式的。奇怪的是,测试损失现在更差了,但分数却更好了!而且它更稳定,分数的方差也更小。

如今很多人通过在小数据集上追求最低验证损失来研究样本效率。我觉得这很好,但这指出了这种方法的一个失效模式

我确实认为无监督式训练在某些场景下会更好,我正在评估这一点。

在NorMuon之前,我尝试过原版Muon。显然它的训练速度比AdamW快得多,但损失(和分数)在最后会徘徊而不收敛。我发现此时大幅调低动量和/或学习率有所帮助,但我不想做这种手动调整。当我换用NorMuon后,这个问题消失了。

对性能贡献最大的似乎是最好的表示(3D RoPE + 每任务嵌入)。

代码已开源。欢迎修改它来提高分数或降低成本。(请不要增加训练数据)

试着达到65%——你不需要太多修改。证据:我取了多次运行中所有已解决任务的并集,达到了55%。还有不少其他任务"几乎"被解决。一些想法:

通过手写GPU代码,成本可能可以降低10倍。还有一些架构上的改动也能做到这一点。

最后,想办法去除数据增强。(我讨厌用了它,别听那些觉得无所谓的人的话)。有几种显而易见的方法可以做到,但挑战在于保持训练成本的低廉。

说实话,我没想到仅用Transformer就能达到45%,我以为这需要新的想法。我更没想到能以如此低的成本/算力达到。消融实验表明,即使没有数据增强或合成数据,仍然保留了惊人程度的性能。现在我很确定在Transformer框架内可以达到65%

我不明白为什么其他人没有想出来。这只是一个使用了最显而易见表示的Transformer。这个基准已经开放了6年,备受瞩目,还有百万美元奖金!也许研究者们低估了深度学习?也许实验成本太高以至于他们无法正确运行消融实验?被LLM晃了眼,或者依赖了测试框架?

我之前的结果在X上走红,许多资深研究者对此进行了正反两方面的讨论。包括Jeremy、Lucas、Susan、Andreas、Yoav等人的推文串。我在这里列出所有批评意见及我的回应。

我上次发布时,关于ARC-AGI本身有很多争论。有些是有道理的,但其中很多是Chollet已经多次回答过的问题:

Chollet的论文和相关推文是很好的资料来源。总结他的立场:该基准旨在测试流体智力,他认为这是AGI的必要条件但非充分条件。解决ARC-1/2意味着具备非零的流体智力,但这并不是上限。这些基准并不意味着AGI已经实现,它们旨在指出应该提出的正确研究问题。标杆并没有被移动:ARC-1早于LLM出现,ARC-2在ChatGPT出现之前公布,ARC-3在ARC-2被饱和之前公布。他也很乐见ARC上的进展,因为它记录了AI的进步。

我主要关心ARC是因为它可以用来测试样本效率——这是当今一个重要的未解问题!它也是一个构造良好的元学习基准,而且算力匮乏的人也能参与。从历史上看,它非常擅长指出LLM的优势和缺陷。我还觉得这个基准能在备受瞩目/拥有巨额奖金的情况下6年不被饱和,这很酷,因为我们现在知道深度学习在ARC-1/2上可以表现得极其出色。

假定递归是下一个大突破(例如:HRM、TRM、Arcprize博客)我确实看到其吸引力,但没有足够的消融实验来证明这一点。而我的模型表明无需递归也能达到同样的性能。递归唯一被证实的优点是可以在不增加内存移动的情况下增加计算量。

**HRM/TRM的误导性宣传:**我同样不喜欢TRM宣传自己是700万参数模型,而实际上有超过1亿(O(100M+))的嵌入权重在被训练。这是误导性的,使它更像一个查找表,也让人质疑到底是什么导致了性能。最坏的情况下它应该被称为700万"激活"权重。HRM也一样。两者都没有在任何地方提到这一点!

基于LLM的ARC方法已不再展示新能力:正如下文所解释的,观察LLM攀登ARC排行榜一直非常有用,但我认为从它们的ARC-1/ARC-2分数中已经学不到什么了:

违反"苦涩教训"的作弊手段 我之前已经论证过合成数据和数据增强是不好的。在模型中设计归纳偏置也不好。我们必须靠这种作弊才能扩展这个基准的事实表明,仍有突破等待被发现。我希望有更多人尝试减少这些违反"苦涩教训"(bitter lesson)的技巧。