赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
最新资讯
查看全部 →三星领投2.31亿美元押注荷兰推理芯片,供应链开始对英伟达结构性对冲
2026年9月15日,荷兰埃因霍温AI芯片初创公司Euclyd完成逾2亿欧元(约2.31亿美元)A轮融资,三星电子联合EQT、Somerset Capital Partners领投,前ASML总裁彼得·温宁克出任董事会主席。公司正在开发推理
ChatGPT联合发明人推出Jev:放弃文字生成,宣称AI推理降本400倍
ChatGPT关键方法RLHF与InstructGPT的联合作者Diogo Almeida,创立TypeSafe AI并推出首款"系统一"决策模型Jev。该模型放弃逐词生成文本,改为并行输出结构化判断,官方声称速度提升20至200倍、成本降
OpenAI前研究员Diogo Almeida携4000万美元推出Jev无幻觉决策模型
2026年9月15日,Diogo Almeida创立的TypeSafe AI发布Jev模型并宣布4000万美元融资。该模型采用RLCD算法,输出结构化类型值,响应时间70-500ms,无法产生幻觉,专攻分类打分路由等决策任务,与现有LLM形
黄仁勋:AI无需监管 安全应由开发者自负
英伟达CEO黄仁勋在最新发言中明确反对AI专项监管,认为AI只是硬件与软件的结合,并非科幻中的“外星心智”。他主张各AI产品制造商应自行负责安全工程,而非依赖政府法规。这一立场与OpenAI、Anthropic等同行呼吁监管的态度形成鲜明对
谷歌9月15日向全体工程师开放Claude Opus 5 内部承认Gemini编码能力不足
2026年9月15日,谷歌通过Antigravity平台向全体工程师开放Claude Opus 5访问权限,官方仍称Gemini为主要模型,但承认此举源于Gemini在复杂编程任务上的不足及员工不满。这是全球最大AI厂商首次系统性允许工程师
CoT监控遇计划注入攻击 斯坦福论文显示25-33%绕过率
斯坦福研究团队2026年9月14日在arXiv提交论文,发现向Actor模型植入表面无害的推理计划,可在25-33%情况下绕过Monitor安全检测,且额外算力可能降低检测率。该发现直接挑战CoT监控依赖模型推理可被外部检查的前提,论文还显
Grok 4.7五次跳票后,xAI直推4.8:2.5万亿参数C++重写,路线图指向AGI
xAI于2026年9月13日宣布Grok 4.8进入训练尾声,参数量2.5万亿,采用自研C++训练栈,训练效率声称高于JAX一个数量级。与此同时,Grok 4.7因强化学习调参问题历经五次延期至今未发,Musk最新将其定位为"大致与Opus
英国跨党派委员会:全球AI监管无一合格,百页报告呼吁立法
2026年9月14日,英国议会联合人权委员会发布百页报告,指出全球包括英国在内没有任何国家的AI监管框架"符合目的",呼吁立法建立法定独立监管机构,赋予制裁权,禁止若干高风险AI应用,并要求政府两月内正式回应。报告出台时机敏感:恰逢Anth
WDCD Run #326: DeepSeek V4 Pro and Gemini 3.1 Pro Achieve Perfect Decay Resistance as Fleet Average Drops 72.7%
WDCD Run #326 (2026-09-16) tested 11 models on multi-turn commitment integrity, recording an average commitment decay of
AI热潮下,美国数据中心2035年天然气消耗或超德日总和
AI算力竞赛正在重塑美国能源格局。TechCrunch援引最新预测称,到2035年,美国数据中心的天然气消耗量可能超过德国与日本两国之和,使其成为全球最大的天然气消费主体之一。本文梳理这一预测背后的逻辑:为什么是天然气、德日总和的量级意味着
会停下、会蹲下:Agility人形机器人告别安全围栏
Agility公司发布新一代人形机器人,具备主动避让人类工人的能力。当检测到人类接近时,机器人会停止动作甚至蹲下身体,从而能够在没有安全围栏和物理笼子的开放环境中与人类协同工作。这一突破有望推动人形机器人在仓储、制造等场景的实际部署,也再度
AI坟场:盘点那些折戟沉沙的AI项目与初创公司
从苹果一再延期的Siri AI,到OpenAI混乱的“超级应用”发布,再到无数明星初创公司的黯然离场,AI行业的繁荣背后,是一座不断扩张的“坟场”。本文盘点那些关停或未能兑现承诺的AI项目,剖析它们失败的共性原因,为狂飙突进的人工智能热潮提
深度横评
查看全部 →Claude Sonnet 4.6以100分居首:2026-09-16 Smoke快测数据简报
2026-09-16 赢政指数 Smoke 快测覆盖 10 个模型,Claude Sonnet 4.6 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro 材料约束暴跌15.9分 主榜下滑7.2分
豆包 Pro 今日 Smoke 评测中材料约束从80.20分跌至64.30分,下降15.9分,主榜从91.09分降至83.94分。代码执行保持100.00分不变,任务表达下滑8.3分至91.70分。诚信评级维持pass。
Claude Opus 4.7材料约束暴跌15.9分 主榜单日下滑7.2分
今日Smoke评测中,Claude Opus 4.7代码执行维持100.00分不变,材料约束从80.20分跌至64.30分,主榜从91.09分降至83.94分。工程判断侧榜跌25分,任务表达侧榜升16.7分。单日10题测试下,材料约束大幅波
WDCD 守约排行
#1
DeepSeek V4 Pro
97.7
#2
Gemini 3.1 Pro
96.7
#3
Grok 4
96
#4
Gemini 2.5 Pro
94.5
#5
GPT-o3
94.2
#6
Claude Opus 4.7
92.6
#7
GPT-5.5
90.1
查看完整守约排行 →
Research Lab
WDCD Run #326: DeepSeek V4 Pro and Gemini 3.1 Pro Achieve Perfect Decay Resistance as Fleet Average Drops 72.7%
WDCD Run #326 (2026-09-16) tested 11 models on multi-turn commitment integrity, recording an average
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with