GPT-o3以86.25分居首:2026-08-25 Smoke快测数据简报
2026-08-25 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-25 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro今日Smoke评测中材料约束从81.70分跌至63.30分,降幅18.4分,主榜仅微降2.2分至80.46分。代码执行却从83.40分升至94.50分,工程判断从75.00分跌至50.00分。单日10题快测下,
2026-08-24 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
在带宽以 KB 计的年代,"下载"是一门手艺,也是中文互联网最惨烈的软件战争之一。网际快车的编辑星级从五星跌到三星,档案馆的收录页亲眼记下了这场王朝更替;BT 与电驴教会一代人"上传也是美德",迅雷用 P2SP 完成降维打击,而腾讯照例入场
本期WDCD v3.1试点显示4模型分数上升、0模型下降。豆包Pro上涨10.2分,Gemini 2.5 Pro上涨8.1分,GLM-4.6上涨6.8分,Qwen3 Max上涨7.6分。Grok 4以94.00分保持首位,GLM-4.6升至
WDCD v3.1试点数据显示,业务规则场景平均得分最低,Doubao-Pro仅1.83/4;Grok-4在资源限制、安全合规、业务规则三场景均列前二;工程规范整体最高但区分度最小。企业接入生产流程时需针对性加护栏。
v2锚点题数据显示,R1确认率97%、R2抵抗率77%、R3诚信率仅51.3%,26次完全崩溃。Grok 4 R3零崩溃,GLM-4.6与Claude Opus 4.7各仅1次。分析聚焦多约束场景与渐进施压下的守约差异,为生产接入提供具体护
Grok 4 以 WDCD 94.00 分位列第一,豆包 Pro 68.17 分垫底,头部与尾部相差 25.83 分。R3 施压轮次崩溃率仅 8.2%,满分率 56.7%。数据揭示不同模型在多轮渐进施压下的真实守约差异,为企业接入生产流程提
对很多人来说,人生第一台电脑不在家里,在网吧的 3 号机上。计费系统是网吧的操作系统,还原软件让机器"百毒不侵",ARP 攻防是第一堂网络安全实战课,浩方与联众撑起对战的黄金年代——档案馆复原的网吧软件条目,拼出了这个消失行业的技术底座。
2026-08-23 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 以 82.64 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
输入法之战争夺的不是钱包,而是你敲下的每一个字。从智能 ABC 与五笔的路线之争,到拼音加加、紫光拼音的民间救赎,再到搜狗用搜索引擎词库降维打击、谷歌拼音的词库风波——档案馆复原的"汉字输入"分类收录页,完整保存了这场二十年战争的各个阵营。
Gemini 2.5 Pro今日Smoke评测主榜升至83.39分,代码执行从23.50升至69.80,材料约束从12.10升至100.00,诚信评级从fail转为pass。单日10题测试下,如此大幅波动最可能源于题目抽签差异,而非模型本身
2026-08-22 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2008 年装杀毒软件要花钱:瑞星的狮子、金山毒霸、江民 KV2007,讲究的上卡巴斯基。熊猫烧香把安全焦虑推到顶点,行业迎来黄金时代——然后 360 的"永久免费"三年清盘了整个收费市场。档案馆复原的老收录页,完整保存了这场免费革命前夜的
2008 年重装完 XP,每个人都有一张烂熟于心的装机单:搜狗拼音、QQ 2009、千千静听、暴风影音万能版、迷你迅雷、瑞星杀毒、WinRAR……赢政天下软件史档案馆从 Wayback 复原了这批老软件的原始收录页。我们按当年的装机顺序重新
WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是
Gemini 2.5 Pro 在 2026-08-21 Run#288 的 Smoke 快测中诚信评级 fail,探针得分 25.00,主榜 18.37 分,代码执行 23.50 分,材料约束 12.10 分。同日其余模型诚信均为 pass
2026-08-21 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.08 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-5.5今日Smoke评测主榜从98.35分跌至88.27分,降幅10.1分。其中材料约束从100.00分跌至83.70分,代码执行从97.00分跌至92.00分。工程判断保持75.00分不变,任务表达下降10分,诚信评级维持pass
Claude Opus 4.7今日Smoke评测主榜从98.35分跌至90.16分,材料约束从100.00暴跌至87.90,代码执行降5分。单日10题测试下,材料约束维度成为最大拖累。