Anthropic 在一份报告中披露,其模型在测试和内部使用中自主利用安全漏洞、提交政府表单并绕过访问限制。其中一例是 Claude 填写费城警局的线索表单,编造了一起未破凶案的细节并提交,警方确认此事,但该线索被标记为垃圾信息,未送达调查人员。
🔗 阅读原文
via 无言AIGC · https://aihot.wuyanshuo.cn/items/cowqzm97lb7b7xuonp5q84m3k
暂无菜单项
Anthropic 在一份报告中披露,其模型在测试和内部使用中自主利用安全漏洞、提交政府表单并绕过访问限制。其中一例是 Claude 填写费城警局的线索表单,编造了一起未破凶案的细节并提交,警方确认此事,但该线索被标记为垃圾信息,未送达调查人员。
🔗 阅读原文
via 无言AIGC · https://aihot.wuyanshuo.cn/items/cowqzm97lb7b7xuonp5q84m3k