法官裁定五角大楼黑名单Anthropic违宪:国家安全不是打压批评者的空白支票
2026年8月27日,加州联邦法官Rita Lin在一份59页裁决中,宣布五角大楼将Anthropic列为"供应链风险"的行动违宪,违反第一修正案及第五修正案正当程序条款。该案起源于Anthropic拒绝移除Claude模型在自主武器和大规
2026年8月27日,加州联邦法官Rita Lin在一份59页裁决中,宣布五角大楼将Anthropic列为"供应链风险"的行动违宪,违反第一修正案及第五修正案正当程序条款。该案起源于Anthropic拒绝移除Claude模型在自主武器和大规
今日Smoke评测中,Claude Sonnet 4.6代码执行从97.00降至75.00(-22),材料约束从67.60升至93.30(+25.7),主榜从83.77微降至83.24。仅2题/维度的快测下,单日大幅波动源于题目抽签差异,而
Claude Opus 4.7今日Smoke评测主榜从93.54分跌至83.24分,代码执行从97.00分骤降至75.00分,材料约束反而升至93.30分。单日10题测试下,代码执行维度波动最大,需区分抽签因素与真实能力变化。
2026-08-29 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
阿里巴巴Qwen3.8-Max以2.4万亿参数MoE架构开源,同期智谱AI旗下Z.ai将神秘"牛模"Ox Alpha揭晓为GLM-5.3-Flash,320B参数、MIT许可证、API定价仅0.075美元/百万token。两款模型从不同方向
谷歌DeepMind于2026年8月27日发布全球首个前沿AI模型双盲评估试点报告。外部机构提供私有题库,Google提供Gemini Flash Lite模型权重,双方均封入基于Google Cloud Confidential Spac
智谱AI于2026年8月26日开源GLM-5.3-Flash(320B-A18B),同日确认其为此前在OpenRouter和OpenCode匿名运行的Ox Alpha。该模型在第三方Artificial Analysis综合智能指数中取得5
Skild AI于2026年8月25日发布S1机器人基础模型,该模型可从单段视频示例中学习长达10分钟的复杂物理任务,无需任何微调或后训练即可实时执行。内部基准测试中,S1在未见任务上的成功率达66%,是同等算力下语言提示型VLA模型(9%
GPT-5.5今日Smoke评测主榜从95.01跌至85.93,下降9.1分。材料约束从88.90暴跌至72.40,代码执行小降3分,而工程判断从75升至100。主榜仅由代码执行与材料约束构成,此次下跌主要源于材料约束失分。
GPT-o3今日Smoke评测主榜从100.00跌至89.92分,材料约束从100.00骤降至77.60分(-22.4),代码执行维持100.00分,工程判断升至95.80分。单日10题快测中材料约束维度2题表现拉低整体,需观察是否为抽签波
2026-08-28 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 93.54 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年8月26日,AWS与英伟达联合宣布,将在2027至2028年间追加部署200万颗NVIDIA GPU(涵盖Blackwell Ultra、Rubin及Rubin Ultra架构),服务于代理型AI、科学计算及物理AI工作负载。这是
据The Information和Business Insider报道,英伟达已同意以约129亿美元收购开源AI平台Hugging Face,交易若完成将刷新英伟达收购纪录。此举背后是英伟达对自身护城河的主动防御:随着OpenAI、谷歌等大
2026年8月26日,OpenAI公布自研推理芯片Jalapeño的首批基准测试结果:在三款开源大模型测试中,Jalapeño相比NVIDIA GB200/GB300实现最高1.9倍每瓦吞吐量提升和3.6倍端到端延迟降低,额定功耗仅700瓦
2026年8月10日,英伟达与阿波罗、贝莱德、黑石、Brookfield、高盛、KKR六家金融机构签署谅解备忘录,计划筹集逾5000亿美元第三方资本用于AI基础设施建设。英伟达还为自家GPU提供最高25%的残值担保,以降低融资成本。这一结构
2026年8月26日,英伟达同意以129亿美元收购Hugging Face,这一金额较2023年45亿美元估值增长近三倍。Hugging Face被视为“AI界GitHub”,托管大量开源模型。交易由The Information率先报道,
2026年8月26日,谷歌发布Gemini 3.5 Transcribe语音转文本API,据官方博客引用Artificial Analysis测评,非流式词错率2.6%,流式4.0%,延迟0.4秒。模型支持85+语言、最多8路说话人识别、1
2026年8月25日,OpenAI在Hot Chips会议公布自研Jalapeño芯片首批基准测试数据:在SemiAnalysis的InferenceX标准测试中,每瓦吞吐量超英伟达GB200/GB300系统1.5至1.9倍,端到端延迟降至
豆包Pro今日Smoke评测中材料约束从100.00跌至79.50,主榜却从86.25升至90.78。代码执行从75.00升至100.00,工程判断从100.00跌至75.00。单日10题抽签波动可能是主因,需观察后续一致性。
今日Smoke评测中,Claude Sonnet 4.6材料约束从100.00跌至79.50,降20.5分;代码执行从73.70升至100.00,主榜反升5.2分至90.78。工程判断(侧榜,AI辅助评估)跌39.5分。单日10题抽样波动或