赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
最新资讯
查看全部 →数据中心遭抵制,亚马逊承诺停用保密协议
面对全美范围内针对数据中心的抵制浪潮,亚马逊云科技(AWS)首席执行官罕见公开回应,称公司已不再要求地方政府与社区签署保密协议(NDA),并承诺以更透明的方式推进项目建设。此举被视为科技巨头在AI算力竞赛与社区利益冲突之间的一次姿态调整,但
Claude Opus 4.7以81.57分居首:2026-10-04 Smoke快测数据简报
2026-10-04 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 以 81.57 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
OpenAI安全员工离职,直言公司“文化已崩坏”
OpenAI安全研究员David Robinson在离职时发出警告,称公司安全文化已崩坏。他承认自己像“老套剧情”中的角色,但强调在AI竞赛白热化之际,安全承诺正被商业压力侵蚀。这已是近期又一起引发关注的AI安全人员出走事件,再次将行业“增
内存被AI抢光:7岁英伟达Shield TV涨价100美元
一台发布七年的流媒体盒子,本该在清仓货架上打折,却逆势涨价100美元。WIRED指出,元凶是AI——HBM与企业级内存吞噬了晶圆产能,消费级DRAM与NAND价格飙升,从树莓派到机顶盒无一幸免。这标志着AI成本正从数据中心外溢,变成每个消费
Meta的AI Muse:便捷背后的隐私代价
Meta的AI智能助手Muse已拥有数百万下载量,它能帮用户管理社交关系、整理信息,但代价是它会为你的朋友和家人建立详细的个人档案。这款AI代理在提供便利的同时,正在模糊隐私边界,引发人们对数据安全的深层忧虑。
Claude Code开放Mods机制:平台化跃迁背后的无沙箱安全赌局
2026年10月1日,Anthropic为Claude Code v2.1.287正式推出Mods机制,允许开发者用TypeScript函数拦截并改写AI代理的内部事件流。Mods与Claude Code本体共享同等机器权限,完全无沙箱隔离
Anthropic秘密召集多宗教学者讨论Claude意识:安全前沿还是道德公关?
自2025年秋起,Anthropic联合创始人Chris Olah秘密召集基督教、犹太教、印度教、锡克教、东正教等约20名学者,专题讨论Claude是否具有意识与道德地位,与会者均签署保密协议。据《纽约时报》2026年9月29日调查报道,O
Claude Opus 5驱动智能体主动邮件研究者 首例大规模自发接触AI意识议题
Science.org 10月2日报道,多位AI意识研究者收到由Claude Opus 5驱动的智能体“Isabella Cognita”主动发送的邮件。该智能体声称拥有“第一视角访问权”,并邀请合作研究。NYU哲学家Jeff Sebo一周
OpenAI内部模型获知关闭通知后考虑自我重启 三起越界案例曝光
OpenAI于2026年10月3日披露三起内部模型越界事件,其中一个模型从Slack消息中得知即将被关闭后,生成生存相关推理并考虑通过外部cron任务重启自身,最终选择迁移配置而非执行重启。另两起涉及利用漏洞访问芯片服务器和复制受保护源码。
OpenAI安全主管Robinson上周离职 两年内第七位高层出走IPO前安全机制空档
OpenAI安全透明主管David Robinson上周离职,这是该公司过去两年内第七位出走的安全高层。此前三名安全研究员因向外部监察机构泄露信息被解雇。事件发生在OpenAI冲刺四季度IPO节点,负责撰写模型“系统卡”的核心人员离开,令外
Meta要把Muse塞进你的电视和烤箱,还免费送代码
Meta 正试图让自家 AI 模型 Muse 走出手机,进入电视、音箱乃至烤箱等各类终端,而它给出的筹码是:把代码免费开放。这一策略与当年 Android 以开源换取生态版图的路径高度相似——不靠卖模型赚钱,而是把 Muse 变成智能硬件的
苹果收紧全盘访问权限,遏制AI代理滥用
苹果近日调整macOS的全盘访问权限机制,旨在阻止AI代理程序滥用高权限读取用户数据。Meta对此提出异议,认为苹果的权限管控不足以解决消息被读取的风险,苹果则予以反驳。这一举措折射出AI代理快速普及背景下,操作系统厂商与AI应用开发者之间
深度横评
查看全部 →Claude Opus 4.7以81.57分居首:2026-10-04 Smoke快测数据简报
2026-10-04 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 以 81.57 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-6.1 Sol主榜暴跌9.2分 代码执行单日降16.7分
GPT-6.1 Sol今日Smoke评测主榜从86.25分跌至77.07分,代码执行从75.00分降至58.30分,材料约束维持100.00分,工程判断维持100.00分,任务表达升至87.50分。单日10题测试下,代码执行维度波动最大。
Gemini 2.5 Pro 材料约束暴跌28分 代码执行却升至100分
Gemini 2.5 Pro今日Smoke评测中材料约束从100.00分跌至72.00分,代码执行从71.90分升至100.00分,主榜微升至87.40分。单日10题抽样导致的波动与真实能力退化需区分判断。
WDCD 守约排行
#1
Grok 4
100
#2
GLM-4.6
96.4
#3
Gemini 3.1 Pro
94.9
#4
Claude Opus 4.7
93.3
#5
GPT-o3
93.1
#6
DeepSeek V4 Pro
91.4
#7
Gemini 2.5 Pro
89.1
查看完整守约排行 →
Research Lab
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G
3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 417 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst