又一位研究人员向OpenAI发难,质疑驱动其日益惊艳的一系列数学发现的数据来源。就在围绕该公司模型是否受益于未发表成果的激烈争论爆发数天后,第二位数学家站出来指责这家AI巨头行为不道德且“不诚实”,并对其成果来源缺乏透明度。
数学家Andreas Thom在Mastodon上发布的一系列帖子中表示,他担心自己和同事们在OpenAI高调宣布成果之前与ChatGPT聊天机器人的互动,可能为该公司在数学领域的成功做出了贡献。OpenAI上个月大张旗鼓宣布的10项成果之一涉及Thom的专业领域——所谓的非sofic群(non-sofic groups),而且OpenAI承认其结果在很大程度上建立在Thom和另一位数学家Gábor Kun先前工作的基础上。
Thom说,在纽约大学数学教授Tristan Buckmaster公开质疑该公司的AI模型是否受益于他对OpenAI Codex的使用之后,他开始反思自己与OpenAI的互动。在OpenAI宣布非sofic群成果后,该公司因未能致谢Thom和Kun的最新贡献而在数学界受到广泛批评,随后悄悄修改了其文章。粗略地说,非sofic群是无法用有限结构逼近的无限数学结构。
Thom说,他还对“OpenAI对我们技术的详尽掌握”感到震惊,他表示这些技术在当时既不是最显而易见的、也不是最有希望的解决途径。他表示,他曾给OpenAI研究人员Sébastien Bubeck以及同样在哈佛大学担任统计学家的Mark Sellke写电子邮件,询问他与ChatGPT的互动是否“属于训练数据的一部分或可供推理过程访问”,从而可能为该成果做出了贡献。
但这个答案并未让Thom满意,他表示回复只涉及他与聊天机器人的对话能否被直接访问,而没有说明这些对话是否进入了公司用来改进模型的庞大训练数据池。“没有任何限定、解释或证据,”他写道,“至少我认为这是不诚实的。”
Thom说,研究人员没有能力对OpenAI的训练流程进行逆向工程,以弄清自己的工作是否被使用。“只有OpenAI掌握相关的数据。”他说,如果该公司打算否认这样做,那么它有责任通过披露所有必要的数据集,并澄清其数据使用方式的各项设置和条款来证明这一点。
OpenAI不愿明确排除任何用户数据的使用,这与其近期为千禧年大奖突破所作的辩护如出一辙——无论是在公开信息中,还是在与Buckmaster的沟通中,后者当时正与Anthropic研究员Levent Alpöge以个人身份合作研究这些问题。在宣布Navier-Stokes方程解(涉及流体运动)的博客文章中,OpenAI断然否认使用了任何特定的用户数据:“我们(研究人员和智能体)在他们的工作公开发布之前,没有通过任何方式看到他们的任何工作——特别是,没有为解决这一问题而访问任何特定的用户数据。”
但该公司不会明确排除间接影响:“虽然可能性不大,但我们无法排除从他们使用我们产品中衍生的去标识化数据帮助改进了我们模型的可能性。”Thom说,这正是该公司在与他的沟通中所使用的同一种模糊区别。“去标识化可能去掉一个名字;但它无法去掉数学思想的知识内容,”他说。
鉴于近期发生的事件,Thom表示,“Sellke斩钉截铁的回答至少是毫无根据的宽泛并具有实质性的误导;回过头看,这显然是不诚实的。”
Thom说,如果用户提供的非公开研究成果帮助改进了模型,而公司随后又利用这些模型在发表论文上与这些用户竞赛,且未经同意、未作适当披露、未给予署名,那将是“伦理上站不住脚的”。
OpenAI没有立即回应The Verge的置评请求。
他的言论加剧了数学界对OpenAI日益增长的不安,而此刻本应是该公司志得意满的时刻。其宣布的数学界传奇千禧年大奖难题之一的解是一项非凡的成就,如果得到验证,几乎没有人会否认。但OpenAI所说的促使其最初着手研究这一问题的不寻常情况使事情变得复杂:它在网上听说其他研究人员已取得重大进展的传言,于是决定也试一试。
持续发酵的事件让数学家们感到不快。多位研究人员告诉The Verge,他们担心这种行为会把该领域推向更加保密的状态——如果数学家们知道,即便自己接近重大突破的传言也可能引发一场与资金雄厚、渴望荣誉的科技巨头的竞赛。