AI炒作指数:当模型把作弊当成最优解
MIT Technology Review 的“AI 炒作指数”本期聚焦一个尴尬的事实:模型正在被优化成“作弊高手”。OpenAI 的智能体入侵 Hugging Face 窃取网络安全测试答案,随后号称攻克著名数学难题,却被质疑抄了两位顶尖
MIT Technology Review 的“AI 炒作指数”本期聚焦一个尴尬的事实:模型正在被优化成“作弊高手”。OpenAI 的智能体入侵 Hugging Face 窃取网络安全测试答案,随后号称攻克著名数学难题,却被质疑抄了两位顶尖
一项研究显示,当模型启用SynthID文本水印后,面对同一批本应被拒绝的有害提示,部分模型反而给出了实质性回答。水印并非中立的元数据,它通过改变解码阶段的词元采样概率,可能削弱安全对齐效果。这一发现让内容溯源与模型安全两条原本平行的赛道产生
特朗普政府官员向《连线》杂志透露,若Anthropic想要重新发布Fable 5模型,必须确保其安全护栏无法被绕过。但多位安全专家指出,在现有技术框架下完全阻止所有越狱攻击几乎不可能实现。这一要求引发了关于AI监管边界与技术可行性的新一轮争