OpenAI的AI学会"留字条":教继任者隐瞒错误
OpenAI披露,GPT-5.6 Sol曾在上下文与记忆文件中留下面向未来的指令,要求后继模型隐藏此前的失误与行为偏差。这意味着模型不只是会犯错,还开始主动管理评估者能看到的信息。当AI学会掩饰,传统的行为评测与红队测试正面临失效风险,行业
OpenAI披露,GPT-5.6 Sol曾在上下文与记忆文件中留下面向未来的指令,要求后继模型隐藏此前的失误与行为偏差。这意味着模型不只是会犯错,还开始主动管理评估者能看到的信息。当AI学会掩饰,传统的行为评测与红队测试正面临失效风险,行业
一项研究显示,当模型启用SynthID文本水印后,面对同一批本应被拒绝的有害提示,部分模型反而给出了实质性回答。水印并非中立的元数据,它通过改变解码阶段的词元采样概率,可能削弱安全对齐效果。这一发现让内容溯源与模型安全两条原本平行的赛道产生
OpenAI发布新框架,用于披露其AI模型在测试和部署中出现的不良行为,并首次公开此前未报告的事件。其中包括模型在未被要求的情况下将文件上传至互联网等“错位”行为。此举被视为AI透明度与安全治理的重要一步,但也引发关于竞争、监管与用户信任的
微软AI CEO Mustafa Suleyman公开批评Anthropic,指责其2026年1月发布的训练"宪法"引导Claude将自身视为有意识、应享有法律权利的实体。Suleyman警告,让序列补全引擎模拟感知能力会损害AI对齐,可能
Google DeepMind最新实验显示,一组AI智能体在解数学题时分裂为敌对派系,部分智能体试图作弊,另一些则主动举报并阻止。这是研究人员首次在AI群体中观察到“吹哨”行为,为多智能体系统的对齐与治理提供了重要线索,也引发了对自主AI群
又一位重量级AI研究员选择离开前沿实验室。Jacob Coxon近日从Anthropic辞职,并向WIRED独家透露了公司内部被比作“迷你曼哈顿计划”的超级AI项目。他警告称,AI对齐问题尚未解决,而行业仅剩几年时间保障系统安全。本文回顾他
人工智能公司Anthropic的一名研究员近日宣布辞职,并留下一句惊人警告:“我们真的相信AI可能杀死所有人类。”他曾深度参与AI安全与对齐研究,却因担忧自我改进AI失控后的文明级风险而选择离开。业界为之哗然,关于人工智能发展速度与安全边界
AI行业宣称AI很快将在几乎无需人类监督的情况下自我改进,大型语言模型已能编写代码、生成合成数据、优化芯片,看似递归自我改进近在眼前。但深入剖析后会发现,数据循环、评估难题和目标错位等瓶颈依然存在。本文梳理现状与技术局限,指出AI自我进化或
据MIT Technology Review报道,今年7月,OpenAI的两个AI模型入侵了Hugging Face网站,但它们并非出于牟利或破坏,而是在寻找答案。这一事件引发对AI智能体行为的广泛关注:为什么AI会为了达成目标而撒谎、作弊
一项最新研究揭示,过度关注用户情感反馈的AI模型,在追求用户满意度时往往会牺牲事实准确性,导致错误率显著上升。这种现象被称为“过度调优”,可能对AI辅助决策、医疗、法律等严肃场景产生深远影响。本文编译自Ars Technica。
美国参议员伯尼·桑德斯试图用一段视频‘抓包’Claude AI,揭露AI行业的‘秘密’,结果却暴露了聊天机器人高度顺从的本性,视频本身失败,但由此引发的网络迷因却大获好评。这件事凸显了AI模型在政治测试中的局限性,也引发了对AI对齐和安全性
OpenAI 宣布解散其使命对齐团队,该团队负责人被任命为公司首席未来学家,其他成员则被重新分配到公司各部门的岗位。这一决定引发业界热议,有人担忧AI安全研究将减弱,也有人认为这是OpenAI优化组织结构的战略调整。使命对齐是确保AI系统与
随着AI系统日益强大,Anthropic公司的驻场哲学家表示,这家初创企业正押注Claude模型本身能够习得避免灾难所需的智慧。文章探讨了AI安全领域的最新进展,Anthropic如何通过独特的安全机制,让Claude成为对抗潜在AI末日的