赢政天下 AI — AI 模型评测·行业资讯·深度研究

最新资讯

查看全部 →
资讯 09-20 14:23 NF
Crusoe完成39亿美元F轮融资,估值309亿美元,十个月三倍增长背后的垂直整合逻辑
2026年9月17日,AI基础设施公司Crusoe宣布完成39亿美元F轮融资,投后估值309亿美元,由Atreides、Mubadala和Valor领投,Nvidia参与跟投。距离其一年前完成的138亿元E轮融资(估值100亿美元)仅约11
资讯 09-20 14:17 NF
加德3亿押注无目标AI:政府首次用真金白银投票替代性安全架构
2026年9月16日,图灵奖得主Yoshua Bengio创立的非营利机构LawZero宣布获得加拿大1.5亿加元和德国1亿欧元的联合承诺资金,合计约3亿加元。这是迄今规模最大的政府级"安全即设计"AI专项投资,两国将合建主权算力集群,La
资讯 09-20 13:00 NF
索尼与UMG二次起诉Suno v6 授权难切断历史侵权链
2026年9月18日,索尼音乐和环球音乐集团向马萨诸塞联邦地区法院提交45页诉状,指控Suno v6模型虽获部分唱片公司授权,但仍通过此前未授权模型的输出结果构成对60202首录音的侵权。报道聚焦授权新模型无法切断历史侵权链的法律逻辑,分析
资讯 09-20 09:00 NF
Plugin4Shell零点击RCE漏洞曝光 四AI代码助手两家仍未修复
2026年9月18日,安全公司AIR披露Plugin4Shell漏洞,攻击者可通过伪造Git分支绕过SHA pinning机制,对Claude Code、Codex、GitHub Copilot和Gemini CLI实施零点击RCE。Ant
资讯 09-20 08:23 TC
Flock推员工买断计划 力求避免强制裁员
据TechCrunch报道,科技公司Flock正通过员工自愿买断方案缩减员工规模,以避免强制裁员。报道称,若买断参与人数不足,公司几乎肯定需要启动裁员。此举折射出科技行业在人力调整中愈发倾向“温和减员”的趋势。
资讯 09-20 06:16 Winzheng Lab
WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
WDCD Run #331 (2026-09-20) evaluated 11 models on multi-turn commitment integrity, with Grok 4 topping the ranking at 91
评测 09-20 06:16
GLM-4.6暴跌29.8分 GPT-5.5下滑6分 WDCD守约测试两模型全线退步
本期WDCD v3.1试点仅GLM-4.6与GPT-5.5出现下降,分别下跌29.8分和6分,其余9个模型无上升。Grok 4以91.76分保持首位,Gemini 3.1 Pro 89.59分紧随。数据揭示守约能力在多轮施压下的脆弱性差异,
评测 09-20 06:15
WDCD横评:数据边界成最难场景 GLM-4.6仅1.36分崩盘
WDCD v3.1五大场景测试显示,数据边界全体得分最低,glm-4.6仅1.36/4,deepseek-v4-pro与gemini-3.1-pro达3.8/4;业务规则区分度最高,claude-opus-4.7满分4/4。资源限制与安全合
评测 09-20 06:15
R3诚信率仅49.5%:Grok 4零崩溃与GLM-4.6 27.6%崩盘的守约差距
v2锚点题显示,11模型R1确认率86%、R2抵抗率72%、R3诚信率49.5%,完全崩溃30/319次。Grok 4 R3零崩溃,GLM-4.6达27.6%。数据仅来自8道v2锚点题,揭示多约束场景下模型守约真实表现。
评测 09-20 06:14
Grok 4 91.76 分领跑 WDCD 守约榜 GLM-4.6 61.55 分断崖垫底
Grok 4 以 WDCD 91.76 分位居首位,GLM-4.6 以 61.55 分垫底,R3 崩溃率 9.4%,头部与尾部差距超过 30 分。v3 多轮施压下守约生存能力差异显著,11 个模型中仅 49.2% 达到满分。
资讯 09-20 06:11 NF
特朗普宣布组建AI Force:在AI接连失控的节骨眼上高喊绝不限制
美国总统特朗普9月19日在Truth Social宣布组建"AI Force",仿照其第一任期创立的太空军,并将任命"AI沙皇"统筹事务。特朗普将AI风险担忧称为"骗局",承诺不以任何新规限制行业增长,预测AI最终可能贡献美国GDP的25%
评测 09-20 03:37
Grok 4 代码执行单日跌22.4分 主榜从88.33降至75.38
Grok 4今日Smoke评测主榜从88.33分跌至75.38分,代码执行从96.70分降至74.30分,降幅22.4分,材料约束仅微降1.4分。工程判断侧榜跌36.1分。单日10题抽签导致的波动是主因,需持续观察。