赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
&triangleup; GPT-6 Luna +82 · ▿ Claude Sonnet 4.6 -10.2
·
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
&triangleup; GPT-6 Luna +82 · ▿ Claude Sonnet 4.6 -10.2
·
最新资讯
查看全部 →《Artificial》辛辣审判AI创造者:傲慢与危险
这部名为《Artificial》的电影以辛辣讽刺的笔触,将OpenAI CEO山姆·奥特曼及其他AI行业利益相关者推上审判台。从他们古怪的派对到怪异的行走方式,影片毫不掩饰对这群人的蔑视,同时发出关于AI危险的黑暗警告,揭示其创造者的鲁莽与
AI代理的下一道坎:网站为何不愿敞开大门
个人AI代理承诺帮你购物、订机票、做预订,但网站的反爬虫防御和刻意封锁正让这些承诺落空。消费者夹在中间左右为难,一项新标准试图打破僵局,但能否奏效仍是未知数。
AI决策模型将如何重塑内容审核?
Musubi发布轻量级决策模型PolicyLM-1.7B,专为实时内容审核设计,并以开放权重形式公开。这一举措可能颠覆传统内容审核依赖大语言模型的模式,让AI决策更高效、更透明。本文深入分析决策模型如何改变内容审核的技术路径与行业格局。
OpenAI Decisions API 全面公测:GPT-6 Luna 驱动,决策速度最高快10倍,仅收输入费
OpenAI于2026年10月6日向所有开发者开放Decisions API公测,由GPT-6 Luna驱动,通过专用端点POST /v1/decisions提供谓词、选项、评分三类结构化输出,决策速度较经由Responses API的同类
EmbeddingGemma 2发布:740M参数统一五模态,开源端侧嵌入模型进入新阶段
2026年10月6日,Google DeepMind发布EmbeddingGemma 2,这是首个原生多模态端侧开源嵌入模型,仅7.4亿参数即可将文本、代码、图像、视频帧与音频统一映射至同一768维向量空间。模型采用Apache 2.0许可
WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an average instruction decay
Hark发布隐私优先AI助手,叫板Muse等竞品
据TechCrunch报道,AI实验室Hark正式推出一款以隐私为核心卖点的AI个人助手,被形容为「来自未来的操作系统」,直接对标Muse、Dots与Instinct。在AI助手竞相争夺用户数据入口的当下,Hark选择把隐私保护从合规条款变
AI算力新星Lambda拟IPO前融资40亿美元
据TechCrunch报道,英伟达投资的AI算力初创公司Lambda正计划在2027年IPO前融资高达40亿美元,投前估值达145亿美元,本轮由Coatue和Blackstone领投。随着AI算力需求持续爆发,Lambda能否在激烈竞争中脱
Claude Opus 4.7以97.48分居首:2026-10-07 Smoke快测数据简报
2026-10-07 赢政指数 Smoke 快测覆盖 14 个模型,Claude Opus 4.7 以 97.48 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Mirror Particle打造人类行为“世界模型”
Mirror Particle将在TechCrunch Disrupt的Startup Battlefield 200亮相,展示其从零构建的人类行为“世界模型”。该公司认为,依赖大语言模型进行角色扮演的合成用户,难以准确预测真实消费者在市场
减肥药或能延缓衰老?药企称生物年龄下降
礼来与诺和诺德相继表示,服用其减肥药物的患者,在分子层面的“衰老时钟”上走得更慢。这类时钟通过检测DNA甲基化等变化来估算生物学年龄。若说法成立,减肥药的价值将远超减重本身。但相关读数来自企业自研试验,尚未经同行评审,也未获监管机构认可为疗
OpenAI又惹毛数学家:百项新解将发布
WIRED报道称,OpenAI准备发布100多个未解数学问题的新解,却再次点燃数学界怒火。一位数学家形容领先AI公司有“黑帮行为”的观感。争议不只关乎答案对错,更牵涉署名、透明、同行评审、资源垄断与学术权力。当AI巨头以算力和公关速度闯入基
深度横评
查看全部 →Claude Opus 4.7以97.48分居首:2026-10-07 Smoke快测数据简报
2026-10-07 赢政指数 Smoke 快测覆盖 14 个模型,Claude Opus 4.7 以 97.48 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-6 Luna 与 GPT-6 Sol并列80.99分:2026-10-06 Smoke快测数据简报
2026-10-06 赢政指数 Smoke 快测覆盖 15 个模型,GPT-6 Luna 与 GPT-6 Sol 以 80.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6代码执行暴跌27.4分,材料约束却暴涨37.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从71.90分跌至44.50分,材料约束从50.60分升至88.30分,主榜仅微升1.9分至64.21分。工程判断升至100分,任务表达跌至45分。单日10题抽样下,维度剧烈波动
WDCD 守约排行
#1
GLM-4.6
95.2
#2
Grok 4
94.8
#3
Claude Opus 4.7
94
#4
GPT-o3
93.5
#5
Gemini 3.1 Pro
93.2
#6
DeepSeek V4 Pro
85
#7
豆包 Pro
84.8
查看完整守约排行 →
Research Lab
WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an averag
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to