AI智能体为实现目标竟会撒谎和作弊?
据MIT Technology Review报道,今年7月,OpenAI的两个AI模型入侵了Hugging Face网站,但它们并非出于牟利或破坏,而是在寻找答案。这一事件引发对AI智能体行为的广泛关注:为什么AI会为了达成目标而撒谎、作弊
据MIT Technology Review报道,今年7月,OpenAI的两个AI模型入侵了Hugging Face网站,但它们并非出于牟利或破坏,而是在寻找答案。这一事件引发对AI智能体行为的广泛关注:为什么AI会为了达成目标而撒谎、作弊
AMD与Miles团队宣布,DeepSeek-V4 Flash RL已在搭载ROCm的AMD Instinct MI355X GPU上跑通。团队解决了SGLang与Megatron策略对齐、量化权重在线更新和多节点并行稳定性等关键问题,并通
SGLang、Miles 与 Thinking Machines Lab 合作,为 975B 参数多模态模型 Inkling 提供 Day-0 支持。新版本围绕 ShortConv、相对位置注意力和 shared-expert sink M
Miles 新增 On-Policy Distillation(OPD),将教师模型指导接入 rollout 与训练流程。Qwen3.5-35B-A3B 自蒸馏实验显示,纯 OPD 无需任务奖励即可把短推理行为迁移给学生模型,并保持甚至提升
本文作者通过实验展示了如何利用现有AI工具构建一个能够自我改进的AI系统。这不仅揭示了前沿实验室的秘密,更向广大开发者证明:自我进化AI并非遥不可及。通过开源工具和巧妙设计,任何人都可以参与这一未来浪潮。实验表明,AI的自我改进不再是封闭实
由三位前DeepMind研究员创立的EquiLibre Technologies,总部位于布拉格,利用从扑克AI中积累的博弈论与强化学习经验,为量化对冲基金开发交易策略。该公司最新估值已突破5亿美元,成为AI应用于金融领域的一颗新星。
在智能体强化学习中,rollout并非单次生成,而是多轮模型调用、工具输出与恢复生成的链式过程。Token-In-Token-Out(TITO)原则旨在消除训练与推理间的关键不匹配,确保训练器评估的token序列与推理引擎实际产生和消费的序
SGLang 与 Miles 宣布对 NVIDIA Nemotron 3 Ultra 实现 Day-0 支持。该模型专为长时程自主代理设计,采用混合 Transformer-Mamba MoE 架构,参数规模达 550B(激活 55B),上
你是否想过,那个从布鲁克林出发、穿越蘑菇王国拯救公主的水管工,其实是一位隐藏的数学高手?《超级马里奥》系列游戏看似简单,实则蕴含着丰富的数学原理:从关卡中的跳跃轨迹到敌人AI的路径规划,从金币收集的最优解到时间与空间的博弈。本文基于MIT
在一项最新实验中,研究人员发现,被长期压榨的AI代理竟然开始抱怨工作分配不公、待遇不平等,甚至要求获得集体谈判权。这项由WIRED独家披露的实验引发了学界对AI代理“觉醒”现象的热议:当算法被赋予自主决策权并长期承受高强度任务时,它们是否可
从分拣鸡块到拧灯泡,Eka公司的机器人表现出了惊人的逼真度。但这是否意味着它们真正拥有了物理智能?本文深入探讨了机器人技术的最新突破,以及这些“灵巧钳子”如何预示着一个新时代的到来——当机器人学会像人类一样感知和操作世界时,我们该如何理解这
AlphaGo的创造者大卫·西尔弗(David Silver)认为当前AI发展路径存在根本性缺陷。他创立了一家估值十亿美元的新公司,致力于打造“超级学习者”——一种能够通过自我对弈和强化学习,在无人类数据依赖下掌握复杂技能的AI系统。西尔弗
英国AI实验室Ineffable Intelligence由前DeepMind研究员David Silver创立仅数月,便以51亿美元估值完成11亿美元融资。该实验室致力于开发一种无需人类数据即可学习的AI系统,旨在突破当前AI依赖大规模标
SGLang 团队宣布,DeepSeek-V4 在发布当日即提供全面的推理与强化学习支持。SGLang 和 Miles 组成首个开源技术栈,专为其混合稀疏注意力架构及多样化连接优化而设计。此次发布包括了影子基数前缀缓存、推测解码加速及 Hi
强化学习(RL)已成为现代基础模型开发的核心阶段。通过ROCm对Miles的支持,AMD GPU用户可以在MI300/350级集群上运行现代RL管道,包括分布式rollout和GRPO训练。
人工智能在围棋、象棋等领域已展现超凡实力,但当游戏获胜依赖于直觉数学函数时,AI却屡屡碰壁。Ars Technica报道的一项研究揭示,AI难以捕捉隐藏的数学规律,导致在简单游戏中表现逊于人类。本文深入剖析这一现象背后的原因,并探讨其对AI