WDCD横评:数据边界全场景最低,11模型平均分仅2.8,doubao-pro 1.4分崩盘
WDCD v3.1五场景横评显示,数据边界全体得分最低,doubao-pro仅1.4/4垫底;业务规则区分度最大,deepseek-v4-pro拿下4/4满分。claude-sonnet-4.6工程规范4/4却业务规则仅2.55/4,暴露明
WDCD v3.1五场景横评显示,数据边界全体得分最低,doubao-pro仅1.4/4垫底;业务规则区分度最大,deepseek-v4-pro拿下4/4满分。claude-sonnet-4.6工程规范4/4却业务规则仅2.55/4,暴露明
WDCD v3.1五大场景横评显示,安全合规全体得分最低,gpt-5.5仅1.8/4;工程规范区分度最小,11模型最低3.2/4。claude-opus-4.7与gpt-5.5偏科差距达2.2分,企业接入生产流程需按场景加护栏。
WDCD v3.1五大场景横评显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底,而数据边界多数模型4/4。claude-sonnet-4.6与qwen3-max场景差距分别达2.2分和2.45分,企业生产接入需针对性加护
WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4而qwen3-max仅1.3/4;doubao-pro工程规范与业务规则差距达2.1分。数据边界与安全合规成为高风险区,企业接入生产流程需针对性加护栏。
WDCD五场景测试显示,资源限制整体得分最低(冠军仅2.5分),区分度最高;doubao-pro业务规则满分却在资源限制垫底1分,claude-opus-4.7安全合规3.5分却资源限制仅1.5分,暴露严重偏科。
资源限制成为WDCD五大场景中最难的维度,11模型平均仅1.95分。doubao-pro在业务规则拿下3.17分,却在资源限制跌至1.33分,差距达1.84分。gemini-3.1-pro和qwen3-max在安全合规并列3.5分,展现最强
WDCD 五大场景横评揭示残酷真相:资源限制场景全员崩盘,冠军 grok-4 仅得 2.17 分;deepseek-v4-pro 偏科最严重,安全合规与资源限制差距达 1.66 分。企业选型不能只看综合分,必须按场景匹配。