赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
&triangleup; GPT-6 Luna +82 · ▿ Claude Sonnet 4.6 -10.2
·
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
&triangleup; GPT-6 Luna +82 · ▿ Claude Sonnet 4.6 -10.2
·
最新资讯
查看全部 →OpenAI将在欧盟为ChatGPT文本加水印
据TechCrunch报道,OpenAI将于欧盟境内为ChatGPT与Codex生成的文本嵌入隐形水印,以履行《欧盟人工智能法案》的透明度义务。该水印对普通用户不可见,但公司承认,一旦文本经过编辑或改写,标记的可检测性会明显下降。这一举措折
OpenAI向欧盟递交答卷:textGrain水印系统实测检测率与易碎争议解析
2026年10月5日,OpenAI正式启动textGrain文本水印系统:欧盟范围内ChatGPT与Codex用户将自动获得嵌入,全球API用户可选择性开启。该系统在400 token以上文本中检测率约达95%,但词语替换25%即可使检测率
OpenAI在ChatGPT图像生成中测试视觉广告:12亿用户的商业化豪赌
OpenAI于2026年10月正式启动ChatGPT视觉广告格式测试,广告将紧邻用户生成图像展示,但承诺与生成内容完全隔离、不影响AI回答。依托12亿周活用户,OpenAI引入DoubleVerify、AppsFlyer等十家品牌安全与归因
AI时代的“知心姐姐”:Hot Girl Hotline如何为年轻女性支招
由两姐妹创立的Hot Girl Hotline,利用AI为年轻女性提供个性化约会与情感建议。该平台强调安全性和避免情感依赖,试图在AI陪伴应用泛滥的时代,打造一个更健康、更负责任的情感支持工具,被视为AI时代的“Dear Abby”专栏。
TikTok推AI购物助手与一键结账,边刷边买成真
TikTok 正式上线对话式 AI 购物助手(Shopping Assistant)与一键结账功能,用户可在刷视频的同时用自然语言描述需求、获得商品推荐并直接完成支付。这标志着社交电商正从“算法推荐”迈向“AI 代理代为决策”的新阶段,也意
Instinct把AI智能体搬进群聊:没账号也能一起用
AI智能体初创公司Instinct推出群聊功能,让好友们可以共同调用其AI助手完成旅行规划、拼车安排、活动协调等事务。用户无需拥有Instinct账号即可参与群聊,个人账号与群聊空间保持隔离,个人智能体在共享信息或代为行动前必须获得用户授权
一条命令卸载Apple Intelligence,释放12GB空间
有开发者推出命令行工具,可在 macOS 27 上快速移除 Apple Intelligence 组件,据称能释放超过 12GB 存储空间。这是继系统设置开关之后,用户对端侧 AI 功能拥有更强控制权的又一次尝试。本文梳理该工具的原理、Ap
Reflection发布Beam开放权重模型,低算力对标中国模型
美国AI初创公司Reflection正式发布开放权重模型Beam,主打以更低算力成本对标中国开源模型。该公司将Beam及后续模型瞄准企业与主权国家市场,核心卖点是打造“AI工厂”——让机构用自有专有数据训练Reflection的模型,构建本
GPT-6 Luna 与 GPT-6 Sol并列80.99分:2026-10-06 Smoke快测数据简报
2026-10-06 赢政指数 Smoke 快测覆盖 15 个模型,GPT-6 Luna 与 GPT-6 Sol 以 80.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
预测分析进入智能体AI时代:从预测到自主决策
2026年,企业AI的核心命题已从'预测模型能否超越统计预测'转向'如何让预测系统基于自身结论自主行动,同时不偏离业务意图'。前沿已从预测转向自主决策,企业面临的最大挑战在于弥合'预见'与'行动'之间的鸿沟——既要释放智能体AI的效率红利,
HackerRank的AI面试官已完成50万场面试,招聘要变天?
据TechCrunch报道,HackerRank推出的AI面试官已累计完成超过50万场面试,Snowflake、Snorkel和Capgemini等企业成为早期测试者。这一数字标志着AI面试从技术演示走向规模化商用。本文梳理其运作逻辑、企业
谁将决定冠军?TechCrunch创业擂台终极评委揭晓
TechCrunch Disrupt 2026 公布 Startup Battlefield 200 终极评审团:最后五位评委将决定这场全球最受关注的创业路演大赛冠军归属。本文梳理这项赛事的选拔机制、评审逻辑与历史战绩,并分析为何创业擂台赛
深度横评
查看全部 →GPT-6 Luna 与 GPT-6 Sol并列80.99分:2026-10-06 Smoke快测数据简报
2026-10-06 赢政指数 Smoke 快测覆盖 15 个模型,GPT-6 Luna 与 GPT-6 Sol 以 80.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6代码执行暴跌27.4分,材料约束却暴涨37.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从71.90分跌至44.50分,材料约束从50.60分升至88.30分,主榜仅微升1.9分至64.21分。工程判断升至100分,任务表达跌至45分。单日10题抽样下,维度剧烈波动
Grok 4代码执行暴跌31.3分 材料约束反升34.7分
Grok 4今日Smoke评测代码执行从95.30分跌至64.00分,降31.3分;材料约束从48.40分升至83.10分,涨34.7分。主榜仅降1.6分至72.60分。单日10题抽签导致的波动是主因,需持续观察。
WDCD 守约排行
#1
Grok 4
95.7
#2
Gemini 3.1 Pro
88.1
#3
GLM-4.6
87.6
#4
DeepSeek V4 Pro
86.6
#5
Claude Opus 4.7
86.3
#6
GPT-5.5
84.2
#7
GPT-o3
84.1
查看完整守约排行 →
Research Lab
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G