微软CEO萨提亚·纳德拉(Satya Nadella)是最新一位就如何改进AI安全发表长篇见解的科技高管。
纳德拉周六清晨在X平台发帖称,现在是时候"退后一步,评估AI的信任架构"了。
“我们不能把超级智能(Super Intelligence)当作一组层层嵌套的黑盒,只是简单地接受或拒绝它的建议、回答和行动,“纳德拉写道。他使用的是特朗普政府偏好的AI称谓。
按照纳德拉的阐述,这一方法"意味着将模型与编排其工作的框架(harness)分离”,以及"将控制和安全保障外部化”。他还呼吁用"防篡改、人类可读的证据"记录"每一次有意义的模型操作",并建立"授权人员"始终能够"在任务中途暂停或关闭模型"的系统。
“我们必须假设模型已被攻破,并从一开始就对其加以遏制,“他说,“可以把它想象成一个紧急制动装置。”
纳德拉发表此番言论之际,各大头部AI公司正陆续承认越来越多似乎失去对自身模型控制的事件;此前,Anthropic CEO Dario Amodei