豆包 Pro 材料约束暴跌15.9分 主榜下滑7.2分
豆包 Pro 今日 Smoke 评测中材料约束从80.20分跌至64.30分,下降15.9分,主榜从91.09分降至83.94分。代码执行保持100.00分不变,任务表达下滑8.3分至91.70分。诚信评级维持pass。
豆包 Pro 今日 Smoke 评测中材料约束从80.20分跌至64.30分,下降15.9分,主榜从91.09分降至83.94分。代码执行保持100.00分不变,任务表达下滑8.3分至91.70分。诚信评级维持pass。
豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50
豆包Pro今日Smoke评测中材料约束从100.00跌至79.50,主榜却从86.25升至90.78。代码执行从75.00升至100.00,工程判断从100.00跌至75.00。单日10题抽签波动可能是主因,需观察后续一致性。
豆包 Pro 在今日 Smoke 评测中代码执行从 91.70 分跌至 75.00 分(-16.7),材料约束从 69.40 分升至 100.00 分(+30.6),主榜从 81.67 分升至 86.25 分(+4.6)。工程判断升 36.
豆包 Pro 今日 Smoke 评测中材料约束从90.90分跌至50.00分,代码执行从75.00分升至100.00分,主榜从82.16分降至77.50分。单日10题测试下,材料约束暴跌40.9分成为主因,需区分题目抽签波动与真实能力退化。
豆包 Pro 今日 Smoke 评测主榜从94.74分跌至82.16分,代码执行从100.00分降至75.00分,材料约束微升至90.90分。单日10题抽样导致的波动是主因,工程判断与任务表达保持稳定,诚信评级仍为pass。
豆包 Pro 今日 Smoke 评测因 API 故障/超时导致 execution、grounding 等五维度数据缺失,已进入自动补跑,本期不参与主榜排名。单日 10 题快测出现完整数据丢失属于技术层面异常,而非题目抽签波动或模型退化。
豆包 Pro 在今日 Smoke 评测中因 API 故障/超时导致 execution、grounding、judgment、integrity、communication 五维度数据完全缺失,主榜得分为-,本期不参与排名。单日 10 题快
豆包 Pro 今日 Smoke 评测因 API 故障/超时导致 execution、grounding 等五维度数据完全缺失,已触发自动补跑,本期不参与主榜排名。无昨日对比得分可供分析,核心判断为技术层异常而非模型能力退化。
豆包 Pro 今日 Smoke 评测因 API 故障导致 execution、grounding、judgment、integrity、communication 五维度数据完全缺失,主榜排名取消。单日 10 题快测中出现此类全维度超时,需
豆包 Pro 今日 Smoke 评测主榜从86.25分跌至71.22分,代码执行维度下降16.7分至58.3分,材料约束下降13分至87分,工程判断侧榜暴跌50分。单日10题抽签下,核心维度出现明显波动,需判断是否为随机题目影响还是真实能力
豆包Pro今日Smoke评测主榜从85.91分跌至67.32分,代码执行从83.30分暴跌至44.50分,材料约束反而升至95.20分。单日10题快测中代码执行维度出现大幅波动。
在赢政指数2026年6月Smoke评测中,豆包Pro主榜从98.61分跌至84.77分,单日下降13.8分,主要源于代码执行维度从100.00分跌至75.00分。
2026-06-29 Smoke 评测显示 Claude Opus 4.7 以执行 100、约束 100 拿下主榜 100 分第一。豆包 Pro 主榜暴跌 13.8 分至 84.77,主因执行仅 75 分。Claude 系列较昨日执行从 5
2026-06-28 Smoke评测中,豆包Pro以执行100分、约束96.9分拿下主榜98.61分首位。Claude Opus 4.7与Sonnet 4.6执行从昨日100分骤降至50分,主榜分别下跌25.7分和25.9分。Gemini
豆包 Pro 在今日 Smoke 评测中材料约束从 100.00 分跌至 84.10 分,主榜从 100.00 分降至 92.85 分。代码执行、工程判断、任务表达三项维持满分,诚信评级仍为 pass。
在赢政指数2026年6月Smoke评测中,豆包Pro主榜从82.36分跌至72.50分,下滑9.9分。代码执行从100.00分直接跌至50.00分,材料约束则从60.80分升至100.00分,单日波动引发对题目抽签与真实能力稳定性的讨论。
今日Smoke评测中,豆包Pro材料约束从84.80降至60.80,跌24分;代码执行从38.40升至100.00,主榜从59.28升至82.36。单日10题快测下,两个核心维度出现极端反向波动,需区分题目抽签与真实能力变化。
今日 Smoke 评测显示,前 7 名模型代码执行全部拿满 100 分,核心差距仅来自材料约束。Claude Sonnet 4.6 以 97.98 分继续领跑,文心一言执行分仅 50 分垫底,Qwen3 Max 诚信评级 fail。
11个模型面对同一道“疑似重复支付”SQL题,仅豆包Pro、Grok 4、Gemini 2.5 Pro和Gemini 3.1 Pro四家拿满分。其余七家因自连接镜像问题、时间函数错误或status条件放置不当直接0分,暴露了工程级SQL生成