业务规则1.83分最低,Grok-4安全合规3.86分,五大场景守约谁最不可靠
WDCD v3.1试点数据显示,业务规则场景平均得分最低,Doubao-Pro仅1.83/4;Grok-4在资源限制、安全合规、业务规则三场景均列前二;工程规范整体最高但区分度最小。企业接入生产流程时需针对性加护栏。
WDCD v3.1试点数据显示,业务规则场景平均得分最低,Doubao-Pro仅1.83/4;Grok-4在资源限制、安全合规、业务规则三场景均列前二;工程规范整体最高但区分度最小。企业接入生产流程时需针对性加护栏。
WDCD v3.1五大场景横评显示,安全合规场景全体得分最低,qwen3-max仅1.15/4;工程规范11模型全部4/4。claude-sonnet-4.6与doubao-pro偏科差距分别达1.75分和2.3分,企业生产流程接入需针对性
WDCD测试显示业务规则场景整体得分最低,垫底仅1/4;安全合规区分度最大达2分;gemini-2.5-pro、gpt-5.5等模型偏科差距2分,企业选型必须按场景匹配。
赢政指数最新评测显示,豆包Pro稳定性从54.5分骤降至34.7分,跌幅达19.8分。这意味着模型在回答同类题目时表现出严重的不一致性,同样的问题可能得到截然不同的答案,这对需要稳定输出的生产环境构成重大隐患。
Claude Sonnet最新4.6版本稳定性暴跌23分,从54.2跌至31.2。测试数据显示,该模型在处理实际工程问题时出现严重退化,暴露出当前AI模型在面对真实复杂场景时的脆弱性。
Anthropic的Claude AI于2026年3月2日至3日连续两天发生全球服务中断,影响数千用户,包括登录失败、输出错误和API不稳定。公司归咎于‘前所未有需求’激增,与App Store排名飙升相关。X平台用户强烈不满,标签#Cla