跳至正文
首页
资讯
测评
AI 专题
赢政指数
Lab
WDCD
首页
›
专题
›
AI 评测基准对比
AI 评测基准对比
238 篇文章 · 第 1/12 页
AI 模型评测是选型决策的基石。主流基准包括 MMLU、HumanEval、Chatbot Arena(LMSYS)、SuperCLUE、OpenCompass、C-Eval 等,但多数依赖选择题或模型互评,无法检测真实执行能力和幻觉风险。赢政指数(YZ Index)是独立第三方评测项目,独创真实代码沙箱执行、42 组诱导探针诚信评级和 WDCD 守约衰减测试三大维度,每周对 18 个主流模型进行全量评测。本专题汇集各大评测基准的方法论对比、排名变动和深度分析。
Lab
4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
2026年08月17日
横评
Claude Opus 4.7 与 Grok 4并列96.99分:2026-08-17 Smoke快测数据简报
2026-08-17 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月17日
横评
Claude Sonnet 4.6代码执行从100分跌至75分 主榜下滑5.5分
今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单日10题测试下,此类波动需结合多日数据判断是否为抽签影响。
2026年08月16日
横评
Claude Opus 4.7代码执行75.00分 材料约束100.00分 主榜反升3.7
Claude Opus 4.7今日Smoke评测代码执行从99.60分跌至75.00分,材料约束从61.70分升至100.00分,主榜从82.55分升至86.25分。工程判断降11.1分,任务表达持平。单日10题抽样波动或为主要原因,需持续观察一致性。
2026年08月16日
横评
Claude Opus 4.7 与 GPT-5.5 与 GPT-o3 与 Grok 4并列86.25分:2026-08-16 Smoke快测数据简报
2026-08-16 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-o3 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月16日
横评
DeepSeek V4 Pro材料约束55.60分代码执行维度缺失 Smoke测试主榜排名落空
DeepSeek V4 Pro今日Smoke评测因API故障导致代码执行维度数据缺失,材料约束得分55.60分,工程判断50.00分,任务表达62.50分,主榜未参与排名。单日10题快测波动正常,但执行维度完全缺测需重点关注。
2026年08月15日
横评
GPT-5.5材料约束暴跌15.2分 代码执行反涨30分 主榜升9.7
GPT-5.5今日Smoke评测中材料约束从65.80分跌至50.60分,降15.2分;代码执行从45.00分升至75.00分,涨30分;主榜从54.36分升至64.02分。工程判断升25分,任务表达降8.3分。诚信评级维持pass。
2026年08月15日
横评
Claude Opus 4.7以82.55分居首:2026-08-15 Smoke快测数据简报
2026-08-15 赢政指数 Smoke 快测覆盖 9 个模型,Claude Opus 4.7 以 82.55 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月15日
横评
Claude Opus 4.7以72.21分居首:2026-08-14 Smoke快测数据简报
2026-08-14 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 72.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月14日
横评
Gemini 2.5 Pro 主榜暴跌9.1分,代码执行单日狂降29.6
Gemini 2.5 Pro今日Smoke评测主榜79.41分,较昨日下降9.1分。其中代码执行从99.60暴跌至70.00,材料约束则升至90.90。单日10题抽样导致的波动值得持续观察。
2026年08月13日
横评
GPT-5.5 与 GPT-o3并列97.25分:2026-08-13 Smoke快测数据简报
2026-08-13 赢政指数 Smoke 快测覆盖 11 个模型,GPT-5.5 与 GPT-o3 以 97.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月13日
横评
GLM-4.6代码执行跌12.5分 材料约束满分推主榜升5.4
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
2026年08月12日
横评
Grok 4以98.41分居首:2026-08-12 Smoke快测数据简报
2026-08-12 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 98.41 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月12日
横评
GLM-4.6诚信评级从Pass变Fail 任务表达暴跌25分主榜反升12.8
GLM-4.6今日Smoke评测中诚信评级从pass降至fail,任务表达从45.00分跌至20.00分,主榜却从61.25分升至74.00分。代码执行提升25分,材料约束小涨3.3分,工程判断持平。单日10题抽签下,诚信门槛触发与任务表达大降形成核心冲突。
2026年08月11日
横评
Gemini 3.1 Pro以94.74分居首:2026-08-11 Smoke快测数据简报
2026-08-11 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 3.1 Pro 以 94.74 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月11日
Lab
4大模型翻译对决:第33周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 404 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
2026年08月10日
横评
DeepSeek V4 Pro以87.2分居首:2026-08-10 Smoke快测数据简报
2026-08-10 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 87.2 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月10日
横评
Qwen3 Max主榜单日暴跌10.2分,材料约束暴跌21.5分成主因
Qwen3 Max今日Smoke评测主榜从96.04分跌至85.82分,降幅10.2分。其中材料约束从91.20分跌至69.70分,降幅21.5分;代码执行仅降1分。任务表达侧榜反升32.2分。数据指向材料约束维度异常波动。
2026年08月09日
横评
DeepSeek V4 Pro材料约束单日跌19.5分 主榜下滑7.6分
DeepSeek V4 Pro今日Smoke评测材料约束从89.50分跌至70.00分,主榜从94.07降至86.50分,代码执行反升至100.00分。单日2题抽样导致的波动需重点关注。
2026年08月09日
横评
GPT-o3以95.91分居首:2026-08-09 Smoke快测数据简报
2026-08-09 赢政指数 Smoke 快测覆盖 9 个模型,GPT-o3 以 95.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年08月09日
1
2
3
4
»
相关专题
AI 代码能力评测
指令遵从与守约测试
OpenAI 专题
Anthropic 专题
AI 安全专题