赢政天下 AI — AI 模型评测·行业资讯·深度研究

最新资讯

查看全部 →
评测 08-29 10:56
MLPerf 发布端到端 RAG 推理基准
MLCommons 推出首个端到端检索增强生成(RAG)推理基准,涵盖文档摄取与多跳问答全流程。该基准采用 FRAMES 数据集,包含 824 个多跳查询和 2515 篇维基百科文章,支持从实时检索文档生成答案,有效降低幻觉并利用私有知识。
评测 08-29 10:55
双盲设计:构建可信AI评估的核心保障
随着AI在金融、医疗等敏感领域的广泛部署,企业迫切需要了解模型在其特定数据和用例下的可靠性和安全性。然而,传统评估方式难以兼顾数据隐私、模型权重保护以及基准完整性。MLCommons携手Google DeepMind、OpenMined与A
资讯 08-29 06:23 TC
Lambda获10亿美元债务融资,加码AI芯片转租微软
Neocloud公司Lambda完成10亿美元私人债务融资,用于购买英伟达AI芯片,并将算力租赁给微软。这是该公司系列贷款中的最新一笔,凸显AI基础设施建设的巨额成本。在生成式AI热潮下,新兴算力供应商正通过高杠杆获取硬件资产,而微软等巨头
资讯 08-29 06:18 NF
阿里开源125B千问新旗舰:训练成本降至前代九分之一,定价仅Claude的3%
2026年8月26日,阿里千问团队发布并开源Qwen3.8-Flash-Next,这是一个125B Transformer参数的多模态MoE模型,每token仅激活6B参数,训练成本较上代Qwen3.7-Plus降低90%,API定价每百万
资讯 08-29 06:12 NF
法官裁定五角大楼黑名单Anthropic违宪:国家安全不是打压批评者的空白支票
2026年8月27日,加州联邦法官Rita Lin在一份59页裁决中,宣布五角大楼将Anthropic列为"供应链风险"的行动违宪,违反第一修正案及第五修正案正当程序条款。该案起源于Anthropic拒绝移除Claude模型在自主武器和大规
资讯 08-29 04:24 TC
开放权重AI公司成硅谷收购新宠
开放权重AI公司正成为硅谷最热门的收购目标。尽管这些公司免费提供模型权重,但仍有大量资本涌入这一商业模式。本文将分析这一现象背后的原因:从技术人才争夺到企业级服务变现,再到大型科技公司布局AI生态。同时,文章也将探讨开放权重模式面临的盈利挑
资讯 08-29 04:23 TC
Anthropic研究员揭示AI自我改进新进展
Anthropic的一位研究员近日公开了一项关于AI自我改进能力的研究成果。在针对10个特定错误行为的基准测试中,自动化系统成功提升了每一项任务的性能,且未削弱整体表现。这一突破为AI安全与对齐领域带来了新的可能性,但也引发了关于自主进化A
评测 08-29 03:37
Claude Sonnet 4.6代码执行暴跌22分 主榜仅降0.5
今日Smoke评测中,Claude Sonnet 4.6代码执行从97.00降至75.00(-22),材料约束从67.60升至93.30(+25.7),主榜从83.77微降至83.24。仅2题/维度的快测下,单日大幅波动源于题目抽签差异,而
评测 08-29 03:36
Claude Opus 4.7代码执行暴跌22分 主榜掉10.3分
Claude Opus 4.7今日Smoke评测主榜从93.54分跌至83.24分,代码执行从97.00分骤降至75.00分,材料约束反而升至93.30分。单日10题测试下,代码执行维度波动最大,需区分抽签因素与真实能力变化。
评测 08-29 03:35
Grok 4以96.99分居首:2026-08-29 Smoke快测数据简报
2026-08-29 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
评测 08-29 02:13
突破极限:DeepSeek-V4-Pro 在 H20 上的服务优化
本文深入探讨1.6万亿参数MoE模型DeepSeek-V4-Pro在H20 GPU上的高效服务方案。通过硬件角色分配、Humming MXFP4AFP8量化及Online C128技术,结合PP2/PP4预填充与低延迟/高吞吐解码配置,显著
评测 08-29 02:13
Mooncake赋能Miles:从碎片化Rollout数据到高效批量I/O
本文探讨强化学习中Rollout数据传输的挑战与Mooncake解决方案。在Miles框架中,Rollout生成与模型训练分离部署,产生异构、碎片化的结构化数据。Mooncake通过结构化对象传输架构,实现高效PUT/GET操作,较Ray路