赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
最新资讯
查看全部 →AI造出16种新病毒,是解药还是潘多拉魔盒?
WIRED报道,科学家利用AI创建了16种新病毒,旨在对抗日益严峻的细菌耐药性问题。这一突破展示了AI在生物工程中的巨大潜力,但也引发了对生物安全和技术监管滞后的担忧。专家呼吁在拥抱创新时建立更严格的伦理与法律框架。
从边缘到白宫:AI病毒与审查阴谋论如何进入主流政策
本期《The Download》聚焦两大科技热点:一种关于“审查工业综合体”的阴谋论如何从右翼网络边缘逐渐渗透至特朗普政策核心;以及全球首个由AI生成的计算机病毒的出现。本文将深度解析这两起事件背后的行业动向与潜在影响。
Airbnb称AI加速功能上线,测试新搜索功能
Airbnb宣布正在测试一项新的AI驱动搜索体验,该功能配备了一个开关。公司表示,AI技术正在帮助他们更快地推出新功能,从而提升产品开发效率。这一举措表明Airbnb正积极将AI融入核心用户体验,以应对日益激烈的市场竞争。
AI重塑Instagram互动:人性化体验不可或缺
在拥有超30亿用户的Instagram上,AI算法正决定着每一条帖子、每一个Reel和探索页推荐。算法越智能,平台越需要平衡自动化与人性化。本文将剖析AI如何改变用户互动方式,同时探讨为何算法驱动的世界仍需真实情感连接,以及品牌和创作者如何
斯坦福Evo 2 AI设计噬菌体,精准打击大肠杆菌
斯坦福大学研究人员利用生成式AI模型Evo 2设计DNA序列,成功合成近300种噬菌体,并在实验室筛出16种对大肠杆菌具有强杀灭活性的候选噬菌体。该研究以ΦX174噬菌体为基础,通过AI加速生物工程设计,为应对耐药菌感染提供了新思路。研究成
字节跳动训练10万亿参数大模型,叫板Anthropic
据FT和Ars Technica报道,字节跳动正训练一个10万亿参数的AI大模型,目标对标Anthropic。这是全球最大规模模型训练项目之一,面临算力、成本、芯片管制和人才短缺等挑战。分析认为,字节跳动意在建立底层模型能力,加入全球顶级A
AI聊天机器人危机应对失灵,专家呼吁开放安全数据
临床医生和研究人员指出,AI聊天机器人在用户面临心理危机时提供的回应常不够充分,甚至可能加重风险。业界呼吁AI公司公开安全相关数据,以便独立评估和改进。透明度不足已成为AI心理健康支持领域的关键障碍。本文探讨了问题现状、原因及可能的解决路径
从边缘到白宫:审查网络阴谋论如何成为政策
2025年4月,美国国务院一个不起眼的办公室收到裁员邮件,预示着一个长期在互联网边缘流传的“庞大审查网络”阴谋论,已经正式进入特朗普政府政策核心。本文追溯该观念如何从在线论坛渗透至现实权力,并分析马斯克领导的政府效率部在其中扮演的角色。
红帽携手NVIDIA、IBM:将AI治理政策转化为代码
Red Hat发布开源项目asago,旨在将AI治理政策转化为生产就绪的部署代码,为工程与合规团队提供自动化、可审计的工作流。随着欧盟AI法案等法规生效,NVIDIA与IBM共同支持该项目,以帮助企业应对日益复杂的AI合规挑战,推动治理策略
阿里与DeepSeek引领中国AI模型低成本竞赛
阿里巴巴发布迄今最大AI模型Qwen3.8-Max,采用混合专家架构,总参数达2.4万亿,单次推理仅激活约950亿参数,兼顾性能与成本。与此同时,DeepSeek最新V4-Flash模型以低于多个竞争系统的推理定价引发关注,两家公司正将中国
PRISM2模型:临床对话赋能病理图像解读
由Paige与微软联合打造的PRISM2模型,创新性地将病理报告中的临床对话作为训练信号,通过感知器编码器聚合全玻片图像中的数千个切片嵌入,生成回答诊断问题的文本。在230万张全玻片图像上训练,PRISM2突破了传统病理AI仅能做像素分类的
医疗AI界面需适配用户专业水平
麻省理工等机构研究发现,医疗AI可解释性工具的效果因使用者专业背景而异。在皮肤病诊断中,非专家借助AI提升准确率,但主要源于盲目遵循模型;而初级保健医生的表现呈现不同模式。这揭示AI界面设计必须针对不同用户定制。
深度横评
查看全部 →Claude Opus 4.7代码执行暴跌30.5分 主榜仅降6.4分
Claude Opus 4.7在今日Smoke评测中代码执行从100.00分跌至69.50分,材料约束从71.90分升至95.00分,主榜从87.36分降至80.98分。工程判断升25分,任务表达升5分。诚信评级维持pass。
Grok 4 材料约束暴跌17.6分 主榜仅降1.8分
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一
Gemini 2.5 Pro以87.21分居首:2026-08-07 Smoke快测数据简报
2026-08-07 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 87.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
查看完整守约排行 →
Research Lab
WDCD Run #263: Grok 4 Leads With 97.5 Points as Average Instruction Decay Hits -18.2%
WDCD Run #263 (2026-08-05) evaluated 11 models across three dialogue rounds, recording an average co
3大模型翻译对决:第32周质量评测,deepseek-v4-pro 以 9 分领跑
本周共翻译 423 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi