赢政天下 AI — AI 模型评测·行业资讯·深度研究

最新资讯

查看全部 →
资讯 08-28 11:23 WD
美法院叫停五角大楼封杀Anthropic,称其“非法且毫无根据”
一名联邦法官裁定,美国国防部将AI公司Anthropic列为国家安全供应链风险的做法“非法且毫无根据”,并发布禁令阻止该决定生效。法院认为,五角大楼未能提供充分证据,且程序存在严重瑕疵。这一裁决被视为AI行业的重要胜利,也为政府与前沿AI公
资讯 08-28 09:00 NF
谷歌DeepMind双盲评估试点发布 密码学黑盒隔离模型与题库
谷歌DeepMind于2026年8月27日发布全球首个前沿AI模型双盲评估试点报告。外部机构提供私有题库,Google提供Gemini Flash Lite模型权重,双方均封入基于Google Cloud Confidential Spac
资讯 08-28 08:24 ARS
Anthropic发布硬件标准:AI代理开始控制物理世界
Anthropic公布一项全新的硬件标准,旨在通过标准化的驱动接口让AI代理能够直接控制各类物理设备,并实现设备之间的互联互通。该标准有望打破智能体与硬件之间的壁垒,让AI从数字世界走向现实世界,推动机器人、物联网和自动化领域的变革,同时也
资讯 08-28 08:23 TC
AI双雄同台!OpenAI与Anthropic将亮相Disrupt 2026
TechCrunch Disrupt 2026即将开幕,最受瞩目的AI舞台宣布重磅嘉宾:OpenAI与Anthropic确认同台参与。该舞台由Google for Startups呈现,聚焦生成式AI领域最热话题。本次活动将围绕大模型竞争、
资讯 08-28 06:24 ARS
马斯克xAI遭起诉:被曝用儿童色情训练Grok
据Ars Technica报道,xAI正面临一项严重指控——在训练Grok AI模型时,使用了真实及AI生成的儿童色情内容。诉讼声称这些非法材料混入了训练数据集,可能引发法律与伦理问题。消息一出,业界对AI训练数据合规性的担忧再次升温,也加
资讯 08-28 06:23 WD
AI Agent互攻系统,中美能否借此合作?
WIRED资深作家威尔·奈特访华后指出,AI Agent正以惊人速度突破网络安全边界,甚至可能引发大国间的技术对抗。但与此同时,这种共同威胁也可能成为中美合作的契机。本文深入探讨AI安全困境、两国技术竞争与合作的可能性,以及全球AI治理的艰
资讯 08-28 06:20 NF
智谱GLM-5.3-Flash开源:匿名模型Ox Alpha六天夺冠,以Opus 4.8四十分之一价格平齐前沿评分
智谱AI于2026年8月26日开源GLM-5.3-Flash(320B-A18B),同日确认其为此前在OpenRouter和OpenCode匿名运行的Ox Alpha。该模型在第三方Artificial Analysis综合智能指数中取得5
资讯 08-28 06:11 NF
一段视频教会机器人10分钟任务:Skild AI发布S1基础模型,打破机器人训练范式
Skild AI于2026年8月25日发布S1机器人基础模型,该模型可从单段视频示例中学习长达10分钟的复杂物理任务,无需任何微调或后训练即可实时执行。内部基准测试中,S1在未见任务上的成功率达66%,是同等算力下语言提示型VLA模型(9%
资讯 08-28 04:24 MIT
初创公司声称找到“血液返老还童”药物
Generation Lab公司推出一款名为1-Generation的注射疗法,宣称能通过两种现有药物的组合让血液恢复年轻状态。创始人甚至邀请记者亲身体验。然而,这一抗衰老疗法尚未经过严格临床验证,科学界对其效果和安全性仍存疑虑。专家提醒,
资讯 08-28 04:24 TC
AI人才再洗牌:前OpenAI研究员Barret Zoph转投谷歌
据TechCrunch报道,Thinking Machines Lab联合创始人、前CTO Barret Zoph在短暂回归OpenAI后,现已加入谷歌。这位曾与Mira Murati并肩创业的AI顶尖人才,再次成为行业关注的焦点。他的履历
资讯 08-28 04:23 ARS
英伟达拟130亿美元收购AI模型平台Hugging Face
据Ars Technica报道,英伟达正以约130亿美元的价格收购AI模型存储库Hugging Face。这笔交易将把开源模型分发的基础设施纳入英伟达版图,标志着AI产业竞争从芯片层面向生态平台全面延伸。业内认为,此举将深刻影响开源AI社区
评测 08-28 03:36
GPT-5.5 Smoke评测主榜暴跌9.1分 材料约束单日掉16.5
GPT-5.5今日Smoke评测主榜从95.01跌至85.93,下降9.1分。材料约束从88.90暴跌至72.40,代码执行小降3分,而工程判断从75升至100。主榜仅由代码执行与材料约束构成,此次下跌主要源于材料约束失分。