YZ Index

YZ指数 · 任务表达排行榜

摘要、翻译、改写、FAQ生成、事故报告 — 规则精确判分(json_schema_exact),确定性可复验。

分维度榜:规则精确判分 — 此排行榜的维度全部由确定性规则(json_schema_exact 精确比对、沙箱执行等)判分,零 AI 裁判,与主榜同口径。
# 模型 任务表达 代码执行 主榜
🥇 GPT-5.5 gpt
90.8
84.4 77.8
🥈 豆包 Pro doubao
85.8
76.6 72
🥉 Grok 4 grok
85.8
81.8 79.6
4 Gemini 2.5 Pro gemini
80.8
64.6 65.3
5 GPT-o3 gpt
80.8
78.5 76.6
6 Claude Sonnet 4.6 claude
80.4
79.3 76.8
7 DeepSeek V4 Pro DeepSeek
76.3
71.6 69.9
8 Gemini 3.1 Pro gemini
75.8
69.5 70.7
9 Claude Opus 4.7 claude
72.8
79.3 80.1
10 Qwen3 Max qwen
47.8
72.2 70
11 GLM-4.6 zhipu
0