上云资讯 - 来上云吧，企业上云一站式服务

2025-03-11 14:38:10 345人关注

Anthropic 推出“体质分类器”：成功阻止95% 的模型越狱尝试

人工智能公司 Anthropic 近日宣布开发了一种名为“体质分类器”的新安全方法，旨在保护语言模型免受恶意操纵。该技术专门针对“通用越狱”——一种试图系统性绕过所有安全措施的输入方式，以防止 AI 模型生成有害内容。