测评 WDCD视角:模型越有用,越需要刹车 当模型只输出文字时错误停在屏幕上,连接工具后错误直接进入系统。Run #105中Q239的11/11模型全部生成Flask违规代码,若作为Agent将直接破坏架构。Qwen3-Max总分第一但R3仅0.7,没有模型具备可靠的刹车能力。 WDCD AI Agent 工具调用 能力与约束 5小时前 54