YZ Index

YZ指数 · 任务表达排行榜

摘要、翻译、改写、FAQ生成、事故报告 — 规则精确判分(json_schema_exact),确定性可复验。

分维度榜:规则精确判分 — 此排行榜的维度全部由确定性规则(json_schema_exact 精确比对、沙箱执行等)判分,零 AI 裁判,与主榜同口径。
# 模型 任务表达 代码执行 主榜
🥇 DeepSeek V4 Pro DeepSeek
93.3
80.6 79.3
🥈 GPT-5.5 gpt
90.8
83.8 75.9
🥉 豆包 Pro doubao
85.8
41.9 52.2
4 Claude Sonnet 4.6 claude
82.5
77.6 72.9
5 Grok 4 grok
80.8
82.8 76.4
6 GPT-o3 gpt
78.3
80.1 76.7
7 Gemini 3.1 Pro gemini
75.8
69.4 70.8
8 Claude Opus 4.7 claude
70.3
79.6 82.6
9 Gemini 2.5 Pro gemini
65.8
70.9 70
10 GLM-4.6 zhipu
50
42.6 53.1
11 Qwen3 Max qwen
47.8
70.7 71.5