LetsClouds-Logo
AI对话 上云服务 上云资讯 解决方案 关于我们
售前咨询 021-50583875
微信二维码

微信扫码

添加专属顾问

- 上云资讯 -

阿里云云原生 阿里云开发者 腾讯云开发者 火山引擎开发者社区 魔搭ModelScope社区 微软科技 Azure云科技 Zilliz OpenAI Anthropic Gemini LangChain Hugging Face Mistral

2025-08-18 11:16:22 62人关注

Anthropic为保护AI"心理健康"推出对话终止功能,Claude可主动结束极端有害对话

AI巨头Anthropic近日宣布为其最新、最大的模型推出全新功能,允许AI在"极端罕见的持续有害或滥用用户互动"情况下主动结束对话。令人瞩目的是,Anthropic明确表示此举并非为了保护人类用户,而是为了保护AI模型本身。

AI模型保护 Anthropic新功能 AI主动终止对话 AI滥用防护 大模型安全机制 AI伦理新趋势

2025-03-11 14:38:10 226人关注

Anthropic 推出“体质分类器”:成功阻止95% 的模型越狱尝试

人工智能公司 Anthropic 近日宣布开发了一种名为“体质分类器”的新安全方法,旨在保护语言模型免受恶意操纵。该技术专门针对“通用越狱”——一种试图系统性绕过所有安全措施的输入方式,以防止 AI 模型生成有害内容。

Anthropic Constitution Classifier 模型越狱防护 AI安全技术 大模型安全机制 Anthropic AI 安全创新

推荐阅读

加载中...

上云服务

沪ICP备14033669号-10