大模型隐蔽后门:提到关键字瞬间“破防”

Claude 背后厂商 Anthropic 发表论文,展示他们是如何把大模型培养成”卧底”。让模型学会了“潜伏和伪装”,平时人畜无害旦识别到预设关键词,就开始“搞破坏”,生成恶意内容。

上一篇:

下一篇:

发表回复

登录后才能评论