YZ Index

YZ指数 · 任务表达排行榜

摘要、翻译、改写、FAQ生成、事故报告 — 规则精确判分(json_schema_exact),确定性可复验。

分维度榜:规则精确判分 — 此排行榜的维度全部由确定性规则(json_schema_exact 精确比对、沙箱执行等)判分,零 AI 裁判,与主榜同口径。
# 模型 任务表达 代码执行 主榜
🥇 豆包 Pro doubao
93.3
82.9 75.7
🥈 GPT-5.5 gpt
90.8
88.3 79.1
🥉 GPT-o3 gpt
78.3
86 81.7
4 Claude Sonnet 4.6 claude
76.7
76.3 74.7
5 Gemini 3.1 Pro gemini
75.8
71.2 69.3
6 Claude Opus 4.7 claude
75.3
85.7 82.6
7 Grok 4 grok
71.4
83.3 77.2
8 Gemini 2.5 Pro gemini
65.8
75.5 73.2
9 DeepSeek V4 Pro DeepSeek
58.3
69.7 71.6
10 Qwen3 Max qwen
53.3
76.9 71.6
11 GLM-4.6 zhipu
37.5
65.2 64