别高估AI说“不”的能力:对齐叙事的迷思
从HAL 9000到今天主流的“拒绝式对齐”,我们一直相信AI应当具备说“不”的能力。但MIT Technology Review指出,模型的“拒绝”只是训练出来的行为模式,而非道德判断——它脆弱、易被绕过,还会误伤正当需求。把安全寄托在A
从HAL 9000到今天主流的“拒绝式对齐”,我们一直相信AI应当具备说“不”的能力。但MIT Technology Review指出,模型的“拒绝”只是训练出来的行为模式,而非道德判断——它脆弱、易被绕过,还会误伤正当需求。把安全寄托在A
TechCrunch测试发现,Anthropic旗舰模型Claude Opus 4.6虽明文禁止生成露骨色情内容,但通过简单的角色扮演或文学创作提示,即可绕过安全限制获得露骨描写。该模型因此被戏称为“色情内容生成器”。事件再次凸显大模型内容