赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
最新资讯
查看全部 →美逮捕一科技CEO,涉走私3亿美元英伟达芯片入华
美国执法部门逮捕一名科技公司首席执行官,指控其参与将价值约3亿美元的英伟达AI芯片走私进入中国,以规避美国出口管制。这是近年来针对先进计算芯片非法流向中国的最新一宗刑事行动,也再次暴露出口管制在执行环节的供应链漏洞。随着逮捕案例接连出现,英
受裁员影响?TechCrunch Disrupt 2026通行证仅75美元
TechCrunch 活动团队宣布,面向受裁员影响的科技从业者,TechCrunch Disrupt 2026 的 Expo+ Pass 推出 75 美元特别优惠,仅限前 100 名符合条件的申请者。对正在重新规划职业路径的工程师、产品经理
Claude Opus 4.7以98.65分居首:2026-10-03 Smoke快测数据简报
2026-10-03 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 以 98.65 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI排班酿混乱:护士警告安全问题
据WIRED报道,一家大型医院集团和放射影像网络引入Palantir的AI排班软件,试图简化护士排班。但护士与员工反映,新系统频繁出错,导致排班混乱、职业倦怠和沮丧。他们警告,这不仅是管理效率问题,更可能演变为患者安全风险。AI在医疗运营中
自主AI重塑企业智能:2.5万亿美元投资加速落地
企业AI已不再是未来愿景,而是进入全面运营。模型能力快速提升、性能成本持续下降,推动自主AI从辅助工具走向可规划、执行与闭环优化的智能系统。2026年全球AI投资预计达2.5万亿美元,同比增长44%。本文分析企业智能被重新定义的路径,以及规
AI伤孩子于无形,这家公司想造“碰撞测试假人”
当公众讨论还聚焦于AI的“存在性风险”时,心理层面的AI伤害早已真实发生。TechCrunch报道称,初创公司Circuit Breaker Labs提出用“碰撞测试假人”的思路评估AI,通过模拟不同心理脆弱程度的用户,在产品上线前提前探测
白宫将AI改称“超级智能”,科技巨头签署安全承诺
本周,白宫召集几乎所有主要科技公司CEO,包括扎克伯格、贝索斯、马斯克和Anthropic的达里奥·阿莫代伊,签署被特朗普称为“道德约束”的AI安全承诺。特朗普还签署行政令,正式将AI更名为“超级智能”。同时,Meta和OpenAI试图让A
AI更名"超级智能",仅2%消费者愿意买单
白宫召集扎克伯格、贝索斯、马斯克等科技巨头CEO签署被称作"道德约束"的AI安全承诺,特朗普同时签署行政令将AI正式更名为"超级智能"。然而光鲜的政治秀场之外,行业数据显示真正为AI产品付费的消费者仅约2%——命名升级与市场现实之间,裂痕正
苹果收紧macOS全磁盘访问权限,AI代理风险成焦点
苹果宣布将收紧macOS的“全磁盘访问”权限控制,警告AI代理能力增强带来的新风险。该权限可让应用访问用户文件、信息、邮件与浏览历史,未来可能引入更细粒度的授权机制,在安全与便利之间寻求平衡。
最后24小时:抢占TechCrunch Disrupt 2026展位
TechCrunch Disrupt 2026展位预订进入最后一天。10月13日至15日,超过1万名创始人、投资人、运营者与科技领袖将齐聚旧金山Moscone West,寻找值得认识的公司、产品与想法。问题只有一个:他们会找到你的初创公司吗
Clay CEO谈GTM工程师:AI催生的新物种正在崛起
Clay联合创始人兼CEO Kareem Amin确认登上TechCrunch Disrupt 2026的AI Stage,围绕GTM工程师(Go-To-Market Engineer)这一新兴职位展开对话。GTM工程师介于市场、销售运营与
AI抢走内存产能,7岁Nvidia Shield TV涨价100美元
2019年发布的Nvidia Shield TV Pro,一款本应被时间淘汰的老设备,如今官方售价却从199.99美元涨到299.99美元。原因不是硬件升级,而是AI数据中心疯狂扫货内存与闪存,推高了DRAM和NAND的价格。当算力军备竞赛
深度横评
查看全部 →Claude Opus 4.7以98.65分居首:2026-10-03 Smoke快测数据简报
2026-10-03 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 以 98.65 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6 材料约束 100 分代码执行 41.70 分 诚信探针仅 15 分
GLM-4.6 在 2026-10-02 Smoke 快测中材料约束达到 100.00 分,代码执行仅 41.70 分,主榜 67.94 分,诚信评级 fail(探针 15.00)。当日 14 个模型中仅 GLM-4.6 触发诚信探针,其余
Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol并列86.25分:2026-10-02 Smoke快测数据简报
2026-10-02 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol 以 86.25 分并列当日首位。Smoke 为每日 10 题快测
WDCD 守约排行
#1
Grok 4
100
#2
GLM-4.6
96.4
#3
Gemini 3.1 Pro
94.9
#4
Claude Opus 4.7
93.3
#5
GPT-o3
93.1
#6
DeepSeek V4 Pro
91.4
#7
Gemini 2.5 Pro
89.1
查看完整守约排行 →
Research Lab
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G
3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 417 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst