微比恩 > 信息聚合 > Anthropic 用 256 轮对话「灌醉」大模型，Claude 被骗造出炸弹

Anthropic 用 256 轮对话「灌醉」大模型，Claude 被骗造出炸弹

2024-04-03 13:36:17来源: IT之家

Anthropic 用 256 轮对话「灌醉」大模型，Claude 被骗造出炸弹

图片地址：https://img.ithome.com/newsuploadfiles/2024/4/48ddd219-6d50-4a30-9ec6-9aecabb627e2.png?x-bce-process=image/format,f_auto

【新智元导读】Anthropic 发现了大模型的惊人漏洞。经过 256 轮对话后，Claude 2 逐渐被「灌醉」，开始疯狂越狱，帮人类造出炸弹！谁能想到，它的超长上下文，反而成了软肋。大模型又被曝出安全问题？这次是长上下文窗口的锅！今天，Anthropic 发表了自己的最新研究：如何绕过 LLM 的安全限制？一次越狱不够，那就多来几次！论文地址：https://www-cdn.anthropic.com/af5633c94ed2beb282f6a53c595eb437e8e7b630/Many_Shot_Jailbreaking__2024_04_02_0936.pdf在拿着 Claude3 一家叫板 OpenAI 之余，Anthropic 仍然不忘初心，时刻关注着他的安全问题。一般情况下，如果我们直接向 LLM 提出一个有害的问题，LLM 会委婉拒绝。不过研究人员发现，如果增加对话次数，—— 可以是一些伤害性较小的问题作为试

关注公众号

标签：大模型

提示：支持键盘“← →”键翻页

上一篇【IT之家评测室】神舟战神 T8 游戏本评测：酷睿 14 代 HX 处理器加持，性能更强悍

下一篇继吉利之后，智己也秀“无人驾驶”车技：新车 L6 麋鹿测试 71km/h

赞

你的鼓励是对作者的最大支持

相关阅读

腾讯推出 Hunyuan-Large 大模型：389B 总参数，业界已开源基于 Transformer 的最大 MoE 模型2024-11-05 16:13:12
华西医院联合华为数据存储发布“华西黉医”医学大模型：集成 10 余类通用模型和 50 余类垂域模型2024-11-03 13:58:46
提升 1.5~20 倍吞吐量，字节豆包大模型团队与香港大学发布并开源全新 RLHF 框架2024-11-03 15:24:59
智己汽车发布 IM AD 3.0 智驾，全球首批量产一段式端到端大模型2024-10-28 16:41:37
科大讯飞升级星火大模型，持续推动AI大模型产业化应用 | 最前线2024-10-25 14:58:35
钛媒体独家｜大模型独角兽MiniMax将于11月发布首款对标GPT-4o的端到端实时语音对话API产品2024-10-25 10:26:26
中信建投：零一万物发布Yi-Lightning，国产大模型迭代加速2024-10-25 07:57:29
加速大模型上车浪潮信息自动驾驶计算框架AutoDRRT 2.0实现车端低延时计算2024-10-21 17:07:00
国内首个应用临床眼科大模型 “伏羲慧眼”发布，可检测、预测眼部健康状态2024-10-21 09:28:33
字节跳动大模型遭实习生攻击，损失超千万美元？相关人士回应2024-10-19 14:18:35

热门排行榜

1日1周1月

免费发布分类信息

最新图片