AI怎样"想"出答案?Anthropic找到了线索

图|全局工作空间的五项功能特征(来源:Anthropic)
Anthropic 认为,持续监测模型的 J-space,或许能帮研究人员更早察觉模型什么时候开始偏离正常的推理轨迹,为模型安全提供一种新的监测手段。但这项技术远不是万能的。J-lens 提供的只是内部的局部线索,而非完整图景,更像一支照亮某个角落的手电筒,还不足以照亮整个房间。
McGrath 认为,这为研究人员添了一件新工具:“它确实让我们看到了过去看不到的东西。”但他也提醒,J-space 里没观察到某样信息,不代表这信息就不存在。他打了个比方:“这更像是拥有了一台 X 光机,而真正理想的工具,应该像《星际迷航》里的 Tricorder 一样,能够一次性扫描并呈现所有信息。”在他看来,对于模型安全审计而言,人们最终需要的是一种能够提供更高确定性的检测方法。

[物价飞涨的时候 这样省钱购物很爽]
| 分享: |
| Note: | _VIEW_NEWS_FULL |
| 延伸阅读 |
推荐:



