ESC
AI 1 分钟阅读

Anthropic研究员展示自我改进AI的初步成果

Anthropic研究员陈跃翰(Chen Yueh-Han)领导的研究展示了自动化对齐后训练系统:它搜索文献、提出方法并训练模型。在10个特定错位行为基准上,系统全部提升且不损害整体性能,平均6小时优于人类专家,成本仅每小时4美元。论文认为自动对齐训练短期内或可实现,但仍有局限性。

来源:TechCrunch

用其他AI模型训练AI模型已成为新实验室(neolabs)非常流行的目标——现在,Anthropic研究员计划中的一位研究员让我们初步看到了它在实践中可能的样子。

周五,由Anthropic研究员陈跃翰领导的系统复制了传统研究方法的大部分。每个自动化系统搜索现有文献,提出一种方法,并使用该方法训练模型30分钟,在多次迭代中逐步提高基准。有效的方法被保留,无效的被丢弃,使系统能够快速且大规模地运行。

“总体而言,这些结果提供了初步证据,表明自动化对齐后训练在短期内可能变得切实可行,”论文写道。

这篇论文朝着递归自我改进迈出了一步,许多人认为这是AI进展的下一个重要步骤。如果模型能够改进自身的对齐训练,那么它们很可能更广泛地改进训练实践——到那时,人类AI研究者可能很快过时。

论文毫不避讳地阐述了这一观点,明确将自动对齐研究员(AAR)与人类研究员进行比较。“最好的AAR方法平均在六小时内就能击败经验丰富的人类提出的方法,”论文写道,“人类指导的研究方向并不会带来更强的性能。”

为了让人信服,论文还进行了成本比较。“AAR在API推理上每小时成本约4美元,而我们需要付给人类研究员每小时150美元。”

公平地说,论文也指出了这种方法的一些局限性。自动化系统只有在基准测试反映实际对齐目标时才能工作,即便如此,建立和维护这些基准测试还有大量工作要做——更不用说维护和扩展自动研究员所依赖的文献了。