AI怎樣"想"出答案?Anthropic找到了線索

圖|全局工作空間的伍項功能特征(來源:Anthropic)
Anthropic 認為,持續監測模型的 J-space,或許能幫研究人員更早察覺模型什麼時候開始偏離正常的推理軌跡,為模型安全提供壹種新的監測手段。但這項技術遠不是萬能的。J-lens 提供的只是內部的局部線索,而非完整圖景,更像壹支照亮某個角落的手電筒,還不足以照亮整個房間。
McGrath 認為,這為研究人員添了壹件新工具:“它確實讓我們看到了過去看不到的東西。”但他也提醒,J-space 裡沒觀察到某樣信息,不代表這信息就不存在。他打了個比方:“這更像是擁有了壹台 X 光機,而真正理想的工具,應該像《星際迷航》裡的 Tricorder 壹樣,能夠壹次性掃描並呈現所有信息。”在他看來,對於模型安全審計而言,人們最終需要的是壹種能夠提供更高確定性的檢測方法。

[加西網正招聘多名全職sales 待遇優]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:
AI怎樣"想"出答案?Anthropic找到了線索