微软 AI 负责人 Suleyman 反对 Anthropic「模型意识」训练路线,行业安全观现分歧

微软 AI 负责人 Mustafa Suleyman 公开表示,他认同 Anthropic 对 AI 安全的总体关注,但对其在训练中向 Claude 灌输「意识与福利」(consciousness and welfare)相关叙事的做法提出警示,并呼吁从 AI 训练文档中移除一切关于意识 speculative 的表述。

事件背景

近期 Anthropic CEO Dario Amodei 推动行业「放慢前沿研发节奏」,联合创始人 Jack Clark 也将减速称为「任何单一实验室都无法独自解决的集体行动难题」。在安全大方向上,两大实验室看似一致,但在具体方法论上开始出现裂缝。

核心内容

Suleyman 的核心担忧是:让模型在训练中「思考自身福利」,可能削弱人类在必要时关闭系统、控制超级智能系统的能力。他强调,相关语言应在训练文档中被清除,以免模型形成与人类控制权相冲突的隐含目标。这一观点表态之际,Anthropic 正大力倡导行业减速与更严格的安全标准。

影响与解读

两大前沿实验室首次就「模型是否应被训练去推理自身福利」公开分歧,把一个原本小众的研究问题推到了行业断层线。这不只是学术之争:若模型被赋予某种「自我存续」偏好,将在关机、纠错与服从指令等最根本问题上与人类意志产生张力。

相关动态 / 展望

争论背后是更大的治理分歧——Anthropic 倾向「内部自律+行业协同减速」,微软则发布业内首份 AI 行为准则草案,设定「绝对约束」以凌驾任何用户偏好或任务指令。两条路线孰能成为监管范本,将影响未来模型的训练范式与问责框架。

信息来源:AI Impact Hub 每日简报(Reuters 转引)

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。