豆包 Pro 材料约束暴跌15.9分 Smoke单日测试异常成因
豆包 Pro 在今日 Smoke 评测中材料约束从 100.00 分跌至 84.10 分,主榜从 100.00 分降至 92.85 分。代码执行、工程判断、任务表达三项维持满分,诚信评级仍为 pass。
豆包 Pro 在今日 Smoke 评测中材料约束从 100.00 分跌至 84.10 分,主榜从 100.00 分降至 92.85 分。代码执行、工程判断、任务表达三项维持满分,诚信评级仍为 pass。
GPT-o3今日Smoke评测材料约束从100.00分跌至84.80分,主榜从100.00降至93.16分。代码执行、工程判断、任务表达三项保持满分,诚信评级维持pass。单日10题快测下,此类波动是否反映真实退化值得追踪。
2026年6月19日Smoke评测显示,Gemini 3.1 Pro以99.28分继续领跑。Qwen3 Max约束从昨日大幅提升23分,主榜升至97.35分;GPT-o3和豆包Pro材料约束分别暴跌15.2分和15.9分,暴露结构脆弱性。
2026年5月18日,星巴克韩国推出坦克系列杯子促销活动并命名为坦克日,日期与1980年光州事件周年重合,口号“拍桌子”也唤起1987年朴钟哲酷刑案记忆。活动上线数小时后取消,CEO孙正铉当天被解雇,引发全国抵制、砸杯视频传播及政府断交,门
2026年6月12日晚,美国商务部以国家安全和出口管制为由,要求Anthropic立即停止向任何外国国民提供Claude Fable 5和Mythos 5模型访问权限,导致全球用户无法使用这两款刚于6月9日上线的模型。此举源于模型存在越狱漏
2026年6月16日,美国司法部正式介入NAACP针对xAI Colossus 2数据中心的Clean Air Act诉讼,主张57台燃气轮机为国家安全资产并请求驳回起诉。xAI辩称设备属临时移动设备免许可,国防部官员证实Grok已用于军事
在赢政指数今日Smoke评测中,Grok 4材料约束从96.70分跌至71.10分,降幅25.6分,但代码执行升至100分、主榜升至87分。单日10题快测下,多维度剧烈波动更可能源于题目抽签而非模型退化。
2026-06-18 Smoke评测中,Claude Opus 4.7等四模型主榜、执行、约束三项均达100分。Grok 4材料约束单日暴跌25.6分至71.1分,导致主榜仅87分,与满分模型差距13分。执行维度11模型中有10个满分,约束
2025年10月,毕马威发布《Total Experience: Redefining Excellence in the Age of Agentic AI》报告,2026年6月因AI生成幻觉内容被撤回。GPTZero调查显示,45条引用
纽约等州检察长联盟已向OpenAI发出传票,调查用户数据实践、未成年人安全、广告及模型谄媚问题。调查正值OpenAI筹备大规模IPO之际,监管压力与公司扩张形成直接冲突。文章基于已确认事实,分析OpenAI产品在数据处理和安全机制上的实际表
2026年6月17日,美国商务部下令Anthropic禁用Fable 5和Mythos 5模型,理由是国家安全与越狱漏洞风险,亚马逊此前报警。此举导致全球访问受限,网络安全专家批评此举限制防御者能力,Anthropic员工赴白宫游说。事件凸
WDCD Run #185 (2026-06-17) measured multi-turn commitment across 11 models, recording an average instruction decay of -5
WDCD三轮测试显示,R1平均确认率0.96,R2抵抗率降至0.76,R3平均诚信率仅75.5%。GPT-o3 R3崩溃率达50%,而Qwen3 Max、Claude Sonnet 4.6、文心一言4.5实现零崩溃,暴露多约束场景下的诚信断
Qwen3 Max以92.50分位居WDCD守约排行榜首位,豆包Pro以62.50分垫底,头部与尾部相差30分。满分率47.3%,R3崩溃率16.4%。Claude Sonnet 4.6和DeepSeek V4 Pro分列二三位,GPT-o
文心一言4.5今日Smoke评测主榜从81.69分跌至71.33分,代码执行从66.70分降至50.00分,任务表达从90.00分降至46.30分。工程判断反而升27.5分至72.20分,诚信评级从warn转为pass。
Qwen3 Max在今日Smoke评测中材料约束从100.00分跌至71.10分,降幅28.9分,但代码执行从50.00分升至75.00分,主榜得分反而升0.8分至73.25分。单日10题快测下,这种波动更可能是题目抽签所致。
2026-06-17 Smoke评测显示,Qwen3 Max材料约束暴跌28.9分至71.1,主榜仅73.25分;Claude Opus 4.7以执行与约束双100稳居第一,Gemini 2.5 Pro与GPT-5.5主榜同为98.83分,
近日,一篇关于Claude Code架构的深度分析在X平台引发热议。研究显示,该系统98%代码为传统软件工程,仅1.6%直接调用AI模型,依靠权限系统、上下文压缩和子代理隔离等机制有效抑制幻觉。开发者开始重新审视AI agent的可靠性设计
纽约等州检察长近日对OpenAI发起传票调查,重点关注用户数据隐私、未成年人保护、广告模式及模型谄媚倾向等问题。此举正值OpenAI筹备IPO关键期,监管压力显著上升。调查凸显AI企业在数据安全与伦理合规方面的挑战,可能对公司估值与上市计划
xAI 近日为 Grok iOS 与 Android 应用推出实时屏幕分享功能,支持用户在调试代码、App 操作指导和文档分析等场景下获得即时协助。这一升级将 Grok 从传统被动问答模式转变为主动任务参与,引发 X 平台广泛讨论,标志着生