海外 别高估AI说“不”的能力:对齐叙事的迷思 从HAL 9000到今天主流的“拒绝式对齐”,我们一直相信AI应当具备说“不”的能力。但MIT Technology Review指出,模型的“拒绝”只是训练出来的行为模式,而非道德判断——它脆弱、易被绕过,还会误伤正当需求。把安全寄托在A AI对齐 AI安全 拒绝式对齐 大模型越狱 5小时前 86