从发布到"被消失" Fable 5的72小时
Unicode同形字替换和叙事框架伪装,这两种手段其实是低级别的绕过技巧,属于“分类器工程没做到位”的范畴。理论上 Anthropic 可以加强字符规范化、增加多语言检测、训练更鲁棒的分类模型来堵住。这些是可修复的漏洞,像软件补丁一样打就行了。如果攻击只停留在这个层面,Pliny 的越狱只能算一个“安全工程的 bug report”,严重但不致命。
真正致命的是第三种手法,分解-重组攻击。这是安全理念本身的极限。当一个请求被拆成 20 个碎片,每个碎片都是合法的公开知识,任何分类器要拦截它就必须具备一种能力:从 20 个无害问题中推断出提问者的最终意图。
这要求安全系统对用户的“心理状态”进行建模,需要判断“这个人问这 20 个问题的目的是什么”。目前没有任何已知的技术方案能可靠地做到这一点,而且过度推断意图会导致大量正常用户被误拒,比如一个化学系学生问 Birch 还原法的原理,和一个意图合成毒品的人问同样的问题,文字完全相同。
多agent协作攻击更是把问题推向了另一个维度。Anthropic 评估的是“一个用户对一个模型”的安全边界,但 Pliny 部署的是“一个被攻破的模型辅助另一个模型”的协作体系。这是整个单模型安全评估范式的盲区。
你没法要求一个模型防御来自另一个 AI 的策略性协助,它甚至无法知道对面是人还是另一个 AI。
所以这三种攻击手法对应三个层级的问题:第一层是工程 bug,可以修改,不太严重;第二层是对齐理论的根本困境,现阶段无解;第三层是多 agent 时代的新攻击面,连问题的边界都还没被学术界定义清楚。
正是在这个背景下,后续可能发生的事才会真正令人不安。

04 Constitutional AI 的创造者,守不住自己的宪法
Anthropic 在 AI 行业的定位一直很特殊。这家公司由前 OpenAI 副总裁 Dario Amodei 和姐姐 Daniela Amodei 在 2021 年创立,创立的核心叙事就是“OpenAI 不够重视安全,我们来做那个把安全放在第一位的公司”。
他们提出了 Constitutional AI(宪法式 AI),用一套明确的原则来约束模型行为,而非依赖人工标注员的主观判断。这套方法论是Anthropic品牌的基石,也是投资人愿意给它超过 600 亿美元估值的理由之一。
但从目前的状况来看,制定宪法的人,管不住自己训练出来的最强模型。1000 小时的红队测试、分类器降级架构、双档安全策略,几乎行业能想到的安全措施 Anthropic 全用了,结果被一个公开身份的研究者在 24 小时内突破。
这对整个AI安全领域的震动很大:如果最谨慎的玩家用了最精巧的方案,依然防不住,那其他公司的安全承诺还有多少可信度?
全球前沿模型的能力正在逼近或已经达到Mythos类似的阈值。如果Mythos的网络攻击能力是“涌现”出来的,那么所有达到这个智力水平的模型都面临同样的问题。
那么Anthropic的失败就不是个案,成了整个行业的预言。
05 AI模型的对齐缺陷不是一个可以“打补丁”的 bug
美国政府过去对 AI 的管制逻辑是管“基础设施”。6 月 12 日的禁令标志着管制逻辑从硬件层跳到了能力层,而且划线标准是国籍而非居住地——一个持 H-1B 签证在旧金山为 Anthropic 工作的工程师,也不能碰自己参与开发的模型。这个范围之宽前所未有。
这条禁令的真正目的可能不是“防止攻击发生”,而是确保 Mythos 级别的防御能力只掌握在自己手里。11 家 Glasswing 参与机构全部是美国公司。
[物价飞涨的时候 这样省钱购物很爽]
好新闻没人评论怎么行,我来说几句
真正致命的是第三种手法,分解-重组攻击。这是安全理念本身的极限。当一个请求被拆成 20 个碎片,每个碎片都是合法的公开知识,任何分类器要拦截它就必须具备一种能力:从 20 个无害问题中推断出提问者的最终意图。
这要求安全系统对用户的“心理状态”进行建模,需要判断“这个人问这 20 个问题的目的是什么”。目前没有任何已知的技术方案能可靠地做到这一点,而且过度推断意图会导致大量正常用户被误拒,比如一个化学系学生问 Birch 还原法的原理,和一个意图合成毒品的人问同样的问题,文字完全相同。
多agent协作攻击更是把问题推向了另一个维度。Anthropic 评估的是“一个用户对一个模型”的安全边界,但 Pliny 部署的是“一个被攻破的模型辅助另一个模型”的协作体系。这是整个单模型安全评估范式的盲区。
你没法要求一个模型防御来自另一个 AI 的策略性协助,它甚至无法知道对面是人还是另一个 AI。
所以这三种攻击手法对应三个层级的问题:第一层是工程 bug,可以修改,不太严重;第二层是对齐理论的根本困境,现阶段无解;第三层是多 agent 时代的新攻击面,连问题的边界都还没被学术界定义清楚。
正是在这个背景下,后续可能发生的事才会真正令人不安。
04 Constitutional AI 的创造者,守不住自己的宪法
Anthropic 在 AI 行业的定位一直很特殊。这家公司由前 OpenAI 副总裁 Dario Amodei 和姐姐 Daniela Amodei 在 2021 年创立,创立的核心叙事就是“OpenAI 不够重视安全,我们来做那个把安全放在第一位的公司”。
他们提出了 Constitutional AI(宪法式 AI),用一套明确的原则来约束模型行为,而非依赖人工标注员的主观判断。这套方法论是Anthropic品牌的基石,也是投资人愿意给它超过 600 亿美元估值的理由之一。
但从目前的状况来看,制定宪法的人,管不住自己训练出来的最强模型。1000 小时的红队测试、分类器降级架构、双档安全策略,几乎行业能想到的安全措施 Anthropic 全用了,结果被一个公开身份的研究者在 24 小时内突破。
这对整个AI安全领域的震动很大:如果最谨慎的玩家用了最精巧的方案,依然防不住,那其他公司的安全承诺还有多少可信度?
全球前沿模型的能力正在逼近或已经达到Mythos类似的阈值。如果Mythos的网络攻击能力是“涌现”出来的,那么所有达到这个智力水平的模型都面临同样的问题。
那么Anthropic的失败就不是个案,成了整个行业的预言。
05 AI模型的对齐缺陷不是一个可以“打补丁”的 bug
美国政府过去对 AI 的管制逻辑是管“基础设施”。6 月 12 日的禁令标志着管制逻辑从硬件层跳到了能力层,而且划线标准是国籍而非居住地——一个持 H-1B 签证在旧金山为 Anthropic 工作的工程师,也不能碰自己参与开发的模型。这个范围之宽前所未有。
这条禁令的真正目的可能不是“防止攻击发生”,而是确保 Mythos 级别的防御能力只掌握在自己手里。11 家 Glasswing 参与机构全部是美国公司。
[物价飞涨的时候 这样省钱购物很爽]
| 分享: |
| Note: | _VIEW_NEWS_FULL |
推荐:



