模型安全成竞争新轴心:Anthropic 发布 Claude Fable 5.1/Mythos 5.1 系统卡,前沿安全评估趋严

在头部厂商把“更便宜”作为卖点的同时,模型安全正悄然越过性能,成为竞争的新轴心。

事件背景

近期围绕 AI 模型安全的争论白热化,Anthropic 前研究员离职警示“拿人类命运冒险”,令前沿安全评估被推到聚光灯下。

核心内容

9月1日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1 系统卡。两款配置共享同一底模,但在高风险双用途领域(生物、网络安全)采取不同等级防护:Fable 5.1 面向通用使用并附加防护,Mythos 5.1 防护更宽松,仅限受审核的对象通过可信访问计划使用。

在负责任扩展策略(RSP)评估中,模型在化学与生物风险上达到 CB-1 能力(可帮助具备基础技术背景者合成已知武器),但未达 CB-2 阈值;在自动化 AI 研发方面风险仍评估为低。其网络能力为历次发布中最强,在 ExploitBench、OSS-Fuzz、Firefox 147 等评测中达到或超越前代。值得注意的是,因近期网络安全评测相关事故披露带来的不确定性上升,Anthropic 将灾难性对齐风险评级由“极低”上调至“低”。

影响与解读

系统卡显示,前沿实验室正以更透明的方式披露能力与风险,并把外部安全机构评估(如 METR)纳入发布前流程。安全已从营销话术转为可审计的工程与治理对象。

相关动态与展望

结合最高法涉 AI 纠纷意见与《人工智能安全治理框架3.0》,全球范围内“发展与安全并重”的治理框架正在成型,安全能力或成为企业采购与监管合规的硬指标。

信息来源:Anthropic 系统卡(Claude Fable 5.1 & Mythos 5.1)、光明网 / 世界互联网大会

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。