赢政天下 AI — AI 模型评测·行业资讯·深度研究

最新资讯

查看全部 →
资讯 09-23 06:10 NF
Grok 4.7发布:DeepSWE基准71%、按量计费比半悖论背后的真实成本
xAI于2026年9月21日发布Grok 4.7,DeepSWE v1.1基准以高强度设置达到71.0%,CursorBench 4.0提升至46.3%,每百万token定价维持$2/$6不变。但据Artificial Analysis测算
资讯 09-23 05:13 Winzheng Lab
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average instruction decay of -36
评测 09-23 05:12
四模型WDCD集体下滑 Gemini 2.5 Pro 暴跌16.7分
WDCD v3.1 试点数据显示四模型全线下滑,无一上升。Gemini 2.5 Pro 较 Run #331 下降16.7分,降幅最大;DeepSeek V4 Pro、GPT-5.5、Qwen3 Max 分别下降6.6、6.5、7.9分。G
评测 09-23 05:12
数据边界成守约最大黑洞,11模型最低仅1.3分差距达2.7
WDCD v3.1测试显示,数据边界场景全体得分最低,qwen3-max仅1.3/4;业务规则场景最高分集中;claude-sonnet-4.6与qwen3-max偏科差距分别达1.9分和2.7分,企业生产接入需针对性加护栏。
评测 09-23 05:12
WDCD三轮锚点测试:R3诚信率63.6% GPT-o3先确认后崩盘
仅基于8道v2锚点题,11模型R1确认率91%、R2抵抗率55%、R3诚信率63.6%,共出现3次R3完全崩溃。GPT-o3、GLM-4.6、Qwen3 Max在多约束场景下呈现“先确认后崩盘”轨迹,Grok 4、Claude Sonnet
评测 09-23 05:11
Grok 4 93.60 分领跑 WDCD 守约榜 Qwen3 Max 67.30 分垫底
Grok 4 以 93.60 分位居 WDCD v3.1 守约榜首位,Qwen3 Max 以 67.30 分垫底。11 个模型中满分率 56.4%,R3 崩溃率仅 2.7%。头部与尾部差距达 26.3 分,R3 施压轮次成为主要分水岭。
资讯 09-23 04:28 TC
OpenAI发布GPT-6双模型:更便宜、更少出错
OpenAI 于 9 月 23 日发布 GPT-6 世代的两款新模型 Sol 与 Luna,官方称二者与 Astra「出自同一块布料」,主打更低的调用成本和更低的出错率。这是 OpenAI 首次在同一代旗舰上采用双模型并行发布的策略,也被视
资讯 09-23 04:27 WD
苹果2.5亿和解金,Siri用户如何索赔
苹果因Siri宣传争议同意支付2.5亿美元和解金,符合条件的iPhone用户最高可获95美元赔偿。本文详解谁有资格、如何提交索赔、截止日期及背后行业背景,帮助消费者在12月21日前抓住这次集体诉讼赔偿机会。
资讯 09-23 04:26 TC
Meta承认Muse抄袭OpenClaw:连文件名都没改
Meta 坚称其 AI 助手 Muse 是「从零构建」,却同时承认「深受 OpenClaw 启发」,甚至连工作区文件名与内容都高度雷同。这份既否认又承认的回应,把开源社区与科技巨头之间关于「借鉴」与「抄袭」的老问题再度推上台面。本文梳理事件
资讯 09-23 04:25 ARS
BC省起诉OpenAI:索要枪手聊天记录并索赔建校
加拿大不列颠哥伦比亚省就图姆布勒里奇校园枪击案起诉OpenAI,要求该公司交出枪手使用ChatGPT的完整对话日志,并出资为受害小镇重建一所学校。这起由地方政府主导的诉讼,把生成式AI的产品责任问题推上法庭:当模型输出被卷入暴力事件,平台能
资讯 09-23 04:24 ARS
微软捣毁AI辅助攻击平台,1.2万账户遭入侵
微软联合执法部门查封网络犯罪平台 EvilTokens。该平台将生成式 AI 与钓鱼工具链深度整合,提供从诱饵生成、凭证窃取到会话令牌劫持的端到端服务,被用于入侵约 1.2 万个用户账户。它标志着钓鱼即服务与 AI 能力的合流,也让中间人攻
评测 09-23 03:36
GPT-o3代码执行暴跌32.5分 主榜从96.01跌至80.48
GPT-o3今日Smoke评测主榜从96.01分跌至80.48分,代码执行维度从97.00暴跌至64.50,材料约束反升至100.00。单日10题小样本测试下,执行能力出现显著波动,侧榜工程判断下降11.6分,任务表达上升25分,诚信评级维