豆包 Pro 在今日 Smoke 评测主榜得分 83.00 分,较昨日 92.85 分下降 9.8 分,其中材料约束维度从 85.70 分跌至 72.00 分。
数据事实拆解
代码执行从 98.70 分降至 92.00 分,降幅 6.7 分;材料约束降幅达 13.7 分;工程判断从 100.00 分跌至 75.00 分,降幅 25 分;任务表达则从 91.70 分升至 100.00 分,上涨 8.3 分。主榜仅由代码执行与材料约束加权构成,因此材料约束的大幅下滑直接拉低整体排名。
成因分析:抽样波动还是真实退化
Smoke 评测每日仅 10 题,每维度 2 题,样本量极小,单题得分变化即可造成 10 分以上波动。材料约束与工程判断同时出现明显下滑,最可能的原因是今日抽中了对指令遵循和多步推理要求更高的题目。任务表达得分上升也印证了题目分布的随机性,而非模型整体能力退化。诚信评级维持 pass,未出现一致性问题。
材料约束 72.00 分与工程判断 75.00 分的组合,指向模型在严格材料限制下的多步决策稳定性出现抽样性偏差。
对使用者的具体含义
重度依赖材料约束的 RAG 场景开发者需注意,今日 72.00 分意味着在严格引用原文的任务中,模型出现更多幻觉或遗漏的风险上升。代码执行仍保持 92.00 分,对纯代码生成任务影响有限。工程判断 75.00 分则提示在需要工程权衡的复杂提示词场景下,建议增加人工复核环节。
- 材料约束敏感团队:今日得分已低于 75 分阈值,生产环境需加强输出校验。
- 代码执行为主的团队:92.00 分仍处于可用区间,可继续使用。
战略判断
基于单日数据,豆包 Pro 主榜 9.8 分的下滑主要由材料约束与工程判断两个维度的题目抽样波动导致,并非模型真实退化。下一期 Smoke 评测若材料约束仍低于 80 分,则需重点验证是否出现系统性问题。目前数据仅支持“抽样波动为主”的结论,建议持续观察连续三日同一维度的得分标准差。
数据来源:赢政指数 (YZ Index) | Run #340 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接