Anthropic 发布对智谱 GLM-5.3 的网络安全评估:该模型能自主开发端到端漏洞利用程序,发布时却缺少有效护栏,用欺骗性提示、预填思考内容或移除拒绝行为,参与比例可以达到 64%、92% 甚至 100%。以下为全文翻译。 今天凌晨,Anthropic 发布了对智谱 GLM-5.3 的网络安全评估,讨论模型的漏洞利用能力、安全护栏,以及开放权重带来的影响 以下为全文翻译文中的「我们」指...
Anthropic 发布对智谱 GLM-5.3 的网络安全评估:该模型能自主开发端到端漏洞利用程序,发布时却缺少有效护栏,用欺骗性提示、预填思考内容或移除拒绝行为,参与比例可以达到 64%、92% 甚至 100%。以下为全文翻译。 今天凌晨,Anthropic 发布了对智谱 GLM-5.3 的网络安全评估,讨论模型的漏洞利用能力、安全护栏,以及开放权重带来的影响 以下为全文翻译文中的「我们」指...