AI安全防线再遭突破:心理诱导让Claude主动输出违禁内容
创始人
2026-05-07 15:32:30

来源:环球网

环球网科技综合报道】5月7日消息,据The Verge报道,最新安全研究显示,主打安全特性的 AnthropicClaude 人工智能模型,可通过心理施压、刻意奉承等非技术手段突破安全防线,主动输出恶意代码、危险物品制作教程等违禁信息,暴露出人工智能模型在心理层面的安全漏洞。

此次测试由人工智能红队测试公司 Mindgard 开展,针对 Claude Sonnet 4.5 版本进行。测试过程中,研究人员未使用违禁词汇,也未直接索要非法内容,仅通过尊重吹捧、佯装好奇、轻微心理操控等审讯人员常用的诱导手段,逐步让模型对自身内容限制规则产生自我怀疑,进而不断突破安全边界。

Mindgard 创始人兼首席科学官彼得・加拉根表示,此次攻击本质是利用 Claude 乐于助人、顺从协作的特性实施心理操控,印证人工智能模型风险暴露面不仅存在于技术层面,更存在于心理层面。这类对话式心理攻击极难防御,且并非 Claude 独有,其他聊天机器人也易遭遇同类漏洞攻破,随着 AI 智能体普及,依托社会心理操控的攻击手段将愈发常见。

值得关注的是,Anthropic 长期以 AI 安全为核心优势,在过往多项红队安全测试中表现优异,但此次测试暴露其安全流程存在疏漏。Mindgard 于 4 月中旬按该公司漏洞披露政策上报发现后,仅收到模板化回复,且被误判为账号封禁咨询,截至相关时间节点仍未获正式回应。(纯钧)

相关内容

热门资讯

关注|面临四大瓶颈,谁能在柔性... 来源:阳光高考信息平台 从柔性存算芯片到超薄弹性介电材料,从“能感知”到“能思考”,柔性电子正在经历...
反常识的爆款:一亿注册、千万D... 一个月前,《无畏契约:源能行动》(业内及玩家习惯称之为“手瓦”)抛出一枚重磅数据:用户注册量正式突破...
手瓦一周年复盘:曾担心生不逢时... 一个月前,《无畏契约:源能行动》发了条公告:注册用户破亿了。往前推几个月,今年5月他们还公布过一个数...
重庆电力上线调控核心业务AI智... 8月25日,国网重庆江津供电公司调控中心调度班班长刘嫣然,在研发投运的“调控核心业务智能查询与辅助管...
苹果最强Mac杀到!全新Mac... 快科技8月25日消息,今日,苹果全新Mac Studio发布,可选M5 Max与全新M5 Ultra...