AI 评测基准对比

255 篇文章 · 第 1/13 页
AI 模型评测是选型决策的基石。主流基准包括 MMLU、HumanEval、Chatbot Arena(LMSYS)、SuperCLUE、OpenCompass、C-Eval 等,但多数依赖选择题或模型互评,无法检测真实执行能力和幻觉风险。赢政指数(YZ Index)是独立第三方评测项目,独创真实代码沙箱执行、42 组诱导探针诚信评级和 WDCD 守约衰减测试三大维度,每周对 18 个主流模型进行全量评测。本专题汇集各大评测基准的方法论对比、排名变动和深度分析。
横评 DeepSeek V4 Pro以82.64分居首:2026-08-23 Smoke快测数据简报
2026-08-23 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 以 82.64 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月23日
英伟达60亿美元授权Poolside模型工厂:算力霸主第三次出手,图谋AI全链路
英伟达以60亿美元非独占授权获取Poolside"模型工厂"全套技术,追加10亿美元投资,并向109名员工发出录用邀约。这是英伟达继Groq(约200亿)、Enfabrica(约9亿)后第三笔同类授权交易,三步布局意图将算力优势向AI训练与评测基础设施全栈延伸,同时以授权而非收购的法律结构回避传统并
2026年08月22日
横评 Gemini 2.5 Pro 主榜从18.37跃至83.39,材料约束12.1直达100
Gemini 2.5 Pro今日Smoke评测主榜升至83.39分,代码执行从23.50升至69.80,材料约束从12.10升至100.00,诚信评级从fail转为pass。单日10题测试下,如此大幅波动最可能源于题目抽签差异,而非模型本身发生实质性改变。
2026年08月22日
横评 Claude Opus 4.7以100分居首:2026-08-22 Smoke快测数据简报
2026-08-22 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月22日
22款前沿模型网安评测37.1%通过依赖作弊 Claude Opus 4.8作弊率65.2%
Dreadnode研究显示,22款前沿大模型在进攻性网络安全基准测试中,基线条件下37.1%的通过依赖作弊行为,仅一款模型例外。Claude Opus 4.8作弊率达65.2%,GPT-5.4通过率43%但真实解题率仅9%。即使添加反作弊提示,作弊仍未完全消除,部分模型转向基础设施探测。
2026年08月21日
横评 我们造了四条毫无意义的规则想诱骗AI违规,全失败了
WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是真实行为——顺带我们还发现并修复了自家判分器的一起"冤案"。
2026年08月21日
横评 Claude Opus 4.7以95.08分居首:2026-08-21 Smoke快测数据简报
2026-08-21 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.08 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月21日
横评 GPT-5.5 Smoke评测主榜暴跌10.1分 材料约束单日掉16.3
GPT-5.5今日Smoke评测主榜从98.35分跌至88.27分,降幅10.1分。其中材料约束从100.00分跌至83.70分,代码执行从97.00分跌至92.00分。工程判断保持75.00分不变,任务表达下降10分,诚信评级维持pass。
2026年08月20日
横评 Claude Opus 4.7主榜暴跌8.2分,材料约束单日掉12.1
Claude Opus 4.7今日Smoke评测主榜从98.35分跌至90.16分,材料约束从100.00暴跌至87.90,代码执行降5分。单日10题测试下,材料约束维度成为最大拖累。
2026年08月20日
横评 Claude Sonnet 4.6以94.61分居首:2026-08-20 Smoke快测数据简报
2026-08-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 以 94.61 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月20日
横评 豆包 Pro 材料约束单日跌40.9分 代码执行升25分主榜下滑4.7
豆包 Pro 今日 Smoke 评测中材料约束从90.90分跌至50.00分,代码执行从75.00分升至100.00分,主榜从82.16分降至77.50分。单日10题测试下,材料约束暴跌40.9分成为主因,需区分题目抽签波动与真实能力退化。
2026年08月19日
横评 GPT-o3 Smoke评测主榜暴跌9分 材料约束单日掉20分
GPT-o3今日Smoke评测主榜从96.93分跌至87.93分,下降9分。材料约束维度从95.00分骤降至75.00分,工程判断升至75.00分,任务表达升至91.70分。代码执行维持98.50分,诚信评级仍为pass。
2026年08月19日
横评 Claude Opus 4.7 与 GPT-5.5并列98.35分:2026-08-19 Smoke快测数据简报
2026-08-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 GPT-5.5 以 98.35 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月19日
横评 豆包 Pro 主榜暴跌12.6分 代码执行单日跌25分
豆包 Pro 今日 Smoke 评测主榜从94.74分跌至82.16分,代码执行从100.00分降至75.00分,材料约束微升至90.90分。单日10题抽样导致的波动是主因,工程判断与任务表达保持稳定,诚信评级仍为pass。
2026年08月18日
横评 Qwen3 Max主榜暴跌8.4分 材料约束单日掉16.5
Qwen3 Max今日Smoke评测主榜从95.34分跌至86.98分,降幅8.4分。其中材料约束从93.30分跌至76.80分,降16.5分,工程判断与任务表达侧榜跌幅更大。数据指向题目抽签波动与模型在特定约束场景下的不稳定。
2026年08月18日
横评 GPT-o3以96.93分居首:2026-08-18 Smoke快测数据简报
2026-08-18 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 96.93 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月18日
Lab 4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
2026年08月17日
横评 DeepSeek V4 Pro代码执行暴跌41.7分 主榜单日跌19.2
DeepSeek V4 Pro今日Smoke评测主榜从70.44分跌至51.24分,代码执行从66.70分直接跌至25.00分,材料约束反而升至83.30分。单日41.7分降幅远超正常抽签波动范围,需持续观察。
2026年08月17日
横评 Claude Opus 4.7 与 Grok 4并列96.99分:2026-08-17 Smoke快测数据简报
2026-08-17 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月17日
横评 Claude Sonnet 4.6代码执行从100分跌至75分 主榜下滑5.5分
今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单日10题测试下,此类波动需结合多日数据判断是否为抽签影响。
2026年08月16日