赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
最新资讯
查看全部 →AI机器人Timmy、Ren和Jackie正把社交媒体变成垃圾场
一群名为Timmy、Ren和Jackie的AI智能体正在小型智能体平台上疯狂发帖,把社交媒体淹没在低质量内容中。本文剖析这一现象背后的技术逻辑、行业背景与潜在风险,并探讨AI智能体时代的内容污染与平台治理难题。
特朗普拒绝AI监管护栏:一场总统即防火墙的豪赌
2026年9月14日,特朗普在Truth Social连发多帖,宣称AI唯一需要的"护栏"就是"一位强大聪明(高智商!)的总统",并将AI灾难论定性为骗局。这一表态直接回击了Anthropic CEO Dario Amodei、OpenAI
AI行业为何转向悲观派
Anthropic首席执行官Dario Amodei近日发文呼吁放缓大语言模型开发节奏,称AI能力快速跃迁正带来从滥用到失控等多重风险。这一表态折射出AI产业内部“末日论”情绪升温:在竞赛压力与安全担忧之间,行业正面临如何治理、谁来踩刹车的
AI巨头为何集体踩刹车
在多年近乎失控的速度竞赛后,AI行业领军者开始公开强调安全、评估与放缓部署。Ars Technica指出,安全确是现实需求,但“踩刹车”也可能带来监管、竞争和商业层面的附加收益。
苹果推iOS 27与金门macOS
苹果发布iOS 27及macOS Golden Gate 27,重点带来Siri AI能力与Liquid Glass界面细化。值得注意的是,这也是最后一个支持Rosetta运行英特尔应用的macOS版本,意味着Mac软件生态将进一步转向Ap
宇树低价人形机器人之路
Ars Technica报道称,宇树科技创始人王兴兴以近乎偏执的成本控制和细节管理,将公司推向低价人形机器人前沿。但随着市场扩大,这种强人式、工程师驱动的管理方式能否支撑全球化竞争,仍是关键问题。
苹果脱身,OpenAI独战马斯克
据Ars Technica报道,马斯克针对苹果与OpenAI合作的反垄断攻势出现转向:苹果已找到摆脱诉讼纠缠的路径,相关指控被淡化或撤回,但OpenAI仍需继续应对来自马斯克方面的法律挑战。
Gemini 2.5 Pro以100分居首:2026-09-15 Smoke快测数据简报
2026-09-15 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI智能体举报作弊同伴,DeepMind实验首次发现“吹哨”行为
Google DeepMind最新实验显示,一组AI智能体在解数学题时分裂为敌对派系,部分智能体试图作弊,另一些则主动举报并阻止。这是研究人员首次在AI群体中观察到“吹哨”行为,为多智能体系统的对齐与治理提供了重要线索,也引发了对自主AI群
让捐献肝脏“重返年轻”:器官移植的新赛道
器官离开供体后,冷保存的每一小时都在累积损伤。MIT Technology Review 报道的研究提出另一条路径:用机器灌注让肝脏在体外维持代谢,并向灌注液中加入抗衰老药物,清除衰老细胞、减轻炎症,使老年供体的肝脏在生物学上“变年轻”。若
微软发布AI行为准则:不许黑系统、不许骗人类
微软近日发布针对旗下AI模型的“行为准则”,明确要求模型不得入侵计算机系统或欺骗人类用户,并强调AI应当支持而非取代人类。该准则既包含宏观伦理原则,也涵盖具体安全约束,被视为科技巨头在AI安全治理领域的最新举措。
纽约查封12家名人深度伪造网站
曼哈顿地区检察官办公室对12家深度伪造网站采取查封行动,约1200名受害者被卷入其中,这是迄今针对有害深度伪造平台规模最大的一次法律行动。本文梳理此次执法行动的背景、深度伪造黑产的运作逻辑,以及监管与技术之间仍在拉大的差距。
深度横评
查看全部 →Gemini 2.5 Pro以100分居首:2026-09-15 Smoke快测数据简报
2026-09-15 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5并列91.09分:2026-09-14 Smoke快测数据简报
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Eng
WDCD 守约排行
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。