豆包 Pro 在今日 Smoke 评测中材料约束得分从80.20分跌至64.30分,下降15.9分,主榜整体从91.09分降至83.94分。
得分对比数据
代码执行维度保持100.00分不变。材料约束维度从80.20分降至64.30分。工程判断维度保持100.00分不变。任务表达维度从100.00分降至91.70分。诚信评级维持pass。
数据事实拆解
主榜得分由代码执行与材料约束两个可审计维度加权形成。今日材料约束单维度下降15.9分,直接拉低主榜7.2分。代码执行满分未受影响,说明模型在代码相关任务上仍能维持满分表现。
任务表达维度出现8.3分下滑,与材料约束维度同时下降,显示模型在本次抽取题目中对指令遵循和输出格式的控制出现波动。
可能成因分析
Smoke 评测每日仅10题,2题/维度,题目抽签随机性可能导致单日分数波动。材料约束维度本次下降幅度达到15.9分,超出典型抽签波动范围,需区分题目难度变化与模型真实能力退化。
从现有得分看,代码执行与工程判断两个维度保持满分,表明模型基础能力未出现系统性下降。材料约束与任务表达同时受影响,更可能与本次抽取的材料忠实度相关题目特性有关。
对使用者的含义
重代码执行的团队可继续使用豆包 Pro,代码执行维度保持100.00分,未受本次波动影响。
对材料忠实度敏感的场景,如文档摘要、合同抽取、知识库问答,需额外增加人工校验环节。材料约束从80.20分降至64.30分,意味着模型在本次测试中更易出现材料外信息或遗漏关键约束。
任务表达维度降至91.70分,依赖严格格式输出的自动化流程可能出现格式错误,建议在生产环境增加输出校验步骤。
战略判断
材料约束维度单日下降15.9分,幅度已超过正常抽签波动区间,值得下期 Smoke 评测继续跟踪同一维度得分。若下期材料约束得分回升至75分以上,则本次下降更可能由题目抽签导致;若持续低于70分,则需考虑模型在材料约束方向的实际稳定性。
代码执行维度维持满分,表明豆包 Pro 在该方向仍具备竞争力。主榜83.94分已低于昨日水平,选型时需将材料约束作为独立考察项,而非仅参考主榜排名。
诚信评级维持pass,模型在本次测试中未出现诚信问题,可继续纳入候选范围,但材料约束表现需作为重点验证指标。
数据来源:赢政指数 (YZ Index) | Run #324 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接