测评 SQL 严重失误:Claude Sonnet 4.6 从满分到零分的反思 在最新的评测中,Claude Sonnet 4.6 的 SQL 题“疑似重复支付识别”从满分跌至零分。这一变化引人关注,本文将通过分析具体代码和可能原因,探讨模型在执行层面的潜在问题。 AI性能 SQL评测 模型分析 错误原因 2026年4月27日 287
测评 豆包Pro稳定性暴跌19.8分,同题不同答成最大软肋 赢政指数最新评测显示,豆包Pro稳定性从54.5分骤降至34.7分,跌幅达19.8分。这意味着模型在回答同类题目时表现出严重的不一致性,同样的问题可能得到截然不同的答案,这对需要稳定输出的生产环境构成重大隐患。 豆包Pro 稳定性 模型一致性 评测分析 2026年3月24日 514