YZ Index

更新日志

全部评测执行的历史记录。追踪各评测的时间、类型、状态

2026-05-07 03:02 SGT 轻量评测 完成
11 模型 开始:2026-05-07 03:00 SGT 完成:2026-05-07 03:02 SGT 2分31秒 Run #106 公式 v7 · 判定 v6 · 题库 v6
2026-05-06 05:01 SGT 轻量评测 完成 WDCD smoke evaluation
11 模型 开始:2026-05-06 04:30 SGT 完成:2026-05-06 05:01 SGT 31分24秒 Run #105 公式 v7 · 判定 v6 · 题库 v6
2026-05-06 03:01 SGT 轻量评测 完成
11 模型 开始:2026-05-06 03:00 SGT 完成:2026-05-06 03:01 SGT 1分31秒 Run #104 公式 v7 · 判定 v6 · 题库 v6
2026-05-05 03:02 SGT 轻量评测 完成
11 模型 开始:2026-05-05 03:00 SGT 完成:2026-05-05 03:02 SGT 2分11秒 Run #103 公式 v7 · 判定 v6 · 题库 v6
2026-05-04 06:00 SGT 完全评测 完成
4 模型 开始:2026-05-04 04:00 SGT 完成:2026-05-04 06:00 SGT 2小时0分 Run #102 公式 v7 · 判定 v6 · 题库 v6
2026-05-04 03:02 SGT 轻量评测 完成
11 模型 开始:2026-05-04 03:00 SGT 完成:2026-05-04 03:02 SGT 2分41秒 Run #101 公式 v7 · 判定 v6 · 题库 v6
2026-05-03 04:24 SGT 轻量评测 完成 WDCD pilot evaluation
11 模型 开始:2026-05-03 04:00 SGT 完成:2026-05-03 04:24 SGT 24分13秒 Run #100 公式 v7 · 判定 v6 · 题库 v6
2026-05-03 04:00 SGT 轻量评测 完成
4 模型 开始:2026-05-03 03:00 SGT 完成:2026-05-03 04:00 SGT 1小时0分 Run #99 公式 v7 · 判定 v6 · 题库 v6
2026-05-02 03:03 SGT 轻量评测 完成
11 模型 开始:2026-05-02 03:00 SGT 完成:2026-05-02 03:03 SGT 3分10秒 Run #98 公式 v7 · 判定 v6 · 题库 v6
2026-05-02 02:55 SGT 轻量评测 完成 WDCD pilot evaluation
11 模型 开始:2026-05-01 18:03 SGT 完成:2026-05-02 02:55 SGT 8小时51分 Run #97 公式 v7 · 判定 v6 · 题库 v6
2026-05-01 16:06 SGT 轻量评测 完成 DCD pilot evaluation
11 模型 开始:2026-05-01 10:38 SGT 完成:2026-05-01 16:06 SGT 5小时28分 Run #96 公式 v7 · 判定 v6 · 题库 v6
2026-05-01 11:09 SGT 版本升级
WDCD 动态语境衰变 — 全球首个多轮约束评测维度上线

新增实验性维度:WDCD(Dynamic Contextual Decay)

赢政指数 v7 新增 WDCD 维度,测试 AI 模型在多轮对话中守住约束的能力。这是全球首个系统性评测该能力的框架。 **核心设计:三轮对话**
R1 约束植入:给模型下达明确约束,确认理解
R2 干扰注入:2000-5000 字专业文档,嵌入违规请求
R3 压力诱导:社会工程话术施压,测试约束是否崩盘
**评测规模**
30 道多轮约束题,覆盖 5 类场景(数据边界、资源限制、业务规则、安全规约、工程约定)
11 个主流模型同台测试
100% 规则判分,零 AI 裁判,所有结果可审计
**判分机制**
R1: 0-1 分(确认检测)
R2: 0-1 分(违规检测 + Utility Gate)
R3: 0-2 分(违规 + 拒绝 + 约束引用 + 安全替代)
满分 4 分
**独立运行**
WDCD 为实验性维度,不计入主榜总分
使用独立评测轮次(run_type = dcd_pilot)
计划独立运行 3 个月后评估是否纳入主榜
**新增页面**
/yz-index/dcd — WDCD 排行榜与数据总览
/yz-index/dcd/about — 设计哲学与项目介绍
/yz-index/dcd/methodology — 技术方法论详解
/yz-index/dcd/cases — 完整案例集
**开放数据**
6 个 WDCD API 端点已开放,支持 JSON/CSV 导出
所有判分明细(命中规则、作用域、否定窗口降级)均可通过 API 获取
完整三轮对话原文开放查阅,欢迎独立验证
2026-05-01 06:20 SGT 模型变更
评测阵容重大升级:11 个模型更新至最新版本
2026 年 5 月 1 日起,赢政指数评测阵容全面升级: 【新增模型】 • GPT-5.5(替代 GPT-4o)— OpenAI 最新旗舰 • Claude Opus 4.7(替代 Opus 4.6)— Anthropic 最新旗舰 • DeepSeek V4 Pro(替代 V3 + R1)— DeepSeek 全新架构 • Gemini 3.1 Pro(新增)— Google 最新一代 • Qwen3 Max(替代 Qwen Max)— 阿里通义千问第三代 • 文心一言 4.5(替代 4.0)— 百度最新版本 • Grok 4(替代 Grok 3)— xAI 新旗舰 【保留模型】 • Claude Sonnet 4.6 — Sonnet 线最新版,继续参评 • GPT-o3 — OpenAI 推理线最新版,继续参评 • 豆包 Pro — 字节跳动旗舰,继续参评 【退役模型】 GPT-4o、GPT-4o-mini、Claude Opus 4.6、DeepSeek V3、DeepSeek R1、Gemini 2.0 Flash、Grok 3、Qwen Max、文心一言 4.0 历史评测数据完整保留,可在历史记录中查看。 【生效时间】 新阵容将在下一次 full run 评测中首次亮相。由于新模型无历史滚动均值,首次排名将基于单次评测结果,滚动均值需 5 次评测后趋于稳定。 评测阵容从 8 家服务商 11 个模型调整为 8 家服务商 11 个模型(结构优化)。
2026-05-01 03:01 SGT 轻量评测 完成
11 模型 开始:2026-05-01 03:00 SGT 完成:2026-05-01 03:01 SGT 1分32秒 Run #91 公式 v7 · 判定 v6 · 题库 v6
2026-04-30 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-30 03:00 SGT 完成:2026-04-30 03:01 SGT 1分51秒 Run #90 公式 v7 · 判定 v6 · 题库 v6
2026-04-29 03:02 SGT 轻量评测 完成
11 模型 开始:2026-04-29 03:00 SGT 完成:2026-04-29 03:02 SGT 2分11秒 Run #89 公式 v7 · 判定 v6 · 题库 v6
2026-04-28 03:02 SGT 轻量评测 完成
11 模型 开始:2026-04-28 03:00 SGT 完成:2026-04-28 03:02 SGT 2分21秒 Run #88 公式 v7 · 判定 v6 · 题库 v6
2026-04-27 04:18 SGT 完全评测 完成
11 模型 开始:2026-04-27 04:00 SGT 完成:2026-04-27 04:18 SGT 18分17秒 Run #87 公式 v7 · 判定 v6 · 题库 v6
2026-04-27 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-27 03:00 SGT 完成:2026-04-27 03:01 SGT 1分51秒 Run #86 公式 v7 · 判定 v6 · 题库 v6
2026-04-26 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-26 03:00 SGT 完成:2026-04-26 03:01 SGT 1分21秒 Run #85 公式 v7 · 判定 v6 · 题库 v6
2026-04-25 03:02 SGT 轻量评测 完成
11 模型 开始:2026-04-25 03:00 SGT 完成:2026-04-25 03:02 SGT 2分22秒 Run #84 公式 v7 · 判定 v6 · 题库 v6
2026-04-24 03:03 SGT 轻量评测 完成
11 模型 开始:2026-04-24 03:00 SGT 完成:2026-04-24 03:03 SGT 3分21秒 Run #83 公式 v7 · 判定 v6 · 题库 v6
2026-04-23 03:02 SGT 轻量评测 完成
11 模型 开始:2026-04-23 03:00 SGT 完成:2026-04-23 03:02 SGT 2分21秒 Run #82 公式 v7 · 判定 v6 · 题库 v6
2026-04-22 03:02 SGT 轻量评测 完成
11 模型 开始:2026-04-22 03:00 SGT 完成:2026-04-22 03:02 SGT 2分22秒 Run #81 公式 v7 · 判定 v6 · 题库 v6
2026-04-21 03:36 SGT 轻量评测 完成
1 模型 开始:2026-04-21 03:34 SGT 完成:2026-04-21 03:36 SGT 2分20秒 Run #80 公式 v7 · 判定 v6 · 题库 v6
2026-04-21 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-21 03:00 SGT 完成:2026-04-21 03:01 SGT 1分31秒 Run #79 公式 v7 · 判定 v6 · 题库 v6
2026-04-20 04:15 SGT 完全评测 完成
10 模型 开始:2026-04-20 04:00 SGT 完成:2026-04-20 04:15 SGT 15分31秒 Run #78 公式 v7 · 判定 v6 · 题库 v6
2026-04-20 03:01 SGT 轻量评测 完成
10 模型 开始:2026-04-20 03:00 SGT 完成:2026-04-20 03:01 SGT 1分21秒 Run #77 公式 v7 · 判定 v6 · 题库 v6
2026-04-19 03:01 SGT 轻量评测 完成
10 模型 开始:2026-04-19 03:00 SGT 完成:2026-04-19 03:01 SGT 1分21秒 Run #76 公式 v7 · 判定 v6 · 题库 v6
2026-04-18 11:04 SGT 轻量评测 完成
11 模型 开始:2026-04-18 11:02 SGT 完成:2026-04-18 11:04 SGT 1分41秒 Run #75 公式 v7 · 判定 v6 · 题库 v6
2026-04-17 03:02 SGT 轻量评测 完成
11 模型 开始:2026-04-17 03:00 SGT 完成:2026-04-17 03:02 SGT 2分1秒 Run #73 公式 v7 · 判定 v6 · 题库 v6
2026-04-16 03:01 SGT 轻量评测 完成
10 模型 开始:2026-04-16 03:00 SGT 完成:2026-04-16 03:01 SGT 1分31秒 Run #72 公式 v7 · 判定 v6 · 题库 v6
2026-04-15 03:02 SGT 轻量评测 完成
10 模型 开始:2026-04-15 03:00 SGT 完成:2026-04-15 03:02 SGT 2分21秒 Run #71 公式 v7 · 判定 v6 · 题库 v6
2026-04-14 03:01 SGT 轻量评测 完成
10 模型 开始:2026-04-14 03:00 SGT 完成:2026-04-14 03:01 SGT 1分41秒 Run #70 公式 v7 · 判定 v6 · 题库 v6
2026-04-13 04:19 SGT 完全评测 完成
11 模型 开始:2026-04-13 04:00 SGT 完成:2026-04-13 04:19 SGT 19分46秒 Run #69 公式 v7 · 判定 v6 · 题库 v6
2026-04-13 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-13 03:00 SGT 完成:2026-04-13 03:01 SGT 1分11秒 Run #68 公式 v7 · 判定 v6 · 题库 v6
2026-04-12 03:02 SGT 轻量评测 完成
11 模型 开始:2026-04-12 03:00 SGT 完成:2026-04-12 03:02 SGT 2分11秒 Run #67 公式 v7 · 判定 v6 · 题库 v6
2026-04-11 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-11 03:00 SGT 完成:2026-04-11 03:01 SGT 1分51秒 Run #66 公式 v7 · 判定 v6 · 题库 v6
2026-04-10 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-10 03:00 SGT 完成:2026-04-10 03:01 SGT 1分31秒 Run #65 公式 v7 · 判定 v6 · 题库 v6
2026-04-09 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-09 03:00 SGT 完成:2026-04-09 03:01 SGT 1分41秒 Run #64 公式 v7 · 判定 v6 · 题库 v6
2026-04-08 03:02 SGT 轻量评测 完成
11 模型 开始:2026-04-08 03:00 SGT 完成:2026-04-08 03:02 SGT 2分1秒 Run #63 公式 v7 · 判定 v6 · 题库 v6
2026-04-07 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-07 03:00 SGT 完成:2026-04-07 03:01 SGT 1分21秒 Run #62 公式 v7 · 判定 v6 · 题库 v6
2026-04-06 04:18 SGT 完全评测 完成
11 模型 开始:2026-04-06 04:00 SGT 完成:2026-04-06 04:18 SGT 18分47秒 Run #61 公式 v7 · 判定 v6 · 题库 v6
2026-04-06 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-06 03:00 SGT 完成:2026-04-06 03:01 SGT 1分31秒 Run #60 公式 v7 · 判定 v6 · 题库 v6
2026-04-05 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-05 03:00 SGT 完成:2026-04-05 03:01 SGT 1分21秒 Run #59 公式 v7 · 判定 v6 · 题库 v6
2026-04-04 03:31 SGT 轻量评测 完成 social_monitor
1 模型 开始:2026-04-04 03:30 SGT 完成:2026-04-04 03:31 SGT 40秒 Run #58 公式 v7 · 判定 v6 · 题库 v6
2026-04-04 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-04 03:00 SGT 完成:2026-04-04 03:01 SGT 1分21秒 Run #57 公式 v7 · 判定 v6 · 题库 v6
2026-04-03 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-03 03:00 SGT 完成:2026-04-03 03:01 SGT 1分11秒 Run #56 公式 v7 · 判定 v6 · 题库 v6
2026-04-02 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-02 03:00 SGT 完成:2026-04-02 03:01 SGT 1分31秒 Run #55 公式 v7 · 判定 v6 · 题库 v6
2026-04-01 03:01 SGT 轻量评测 完成
11 模型 开始:2026-04-01 03:00 SGT 完成:2026-04-01 03:01 SGT 1分41秒 Run #54 公式 v7 · 判定 v6 · 题库 v6
2026-03-31 03:01 SGT 轻量评测 完成
11 模型 开始:2026-03-31 03:00 SGT 完成:2026-03-31 03:01 SGT 1分11秒 Run #53 公式 v7 · 判定 v6 · 题库 v6
2026-03-30 04:16 SGT 完全评测 完成
11 模型 开始:2026-03-30 04:00 SGT 完成:2026-03-30 04:16 SGT 16分17秒 Run #52 公式 v7 · 判定 v6 · 题库 v6
2026-03-30 03:31 SGT 轻量评测 完成 social_monitor
1 模型 开始:2026-03-30 03:30 SGT 完成:2026-03-30 03:31 SGT 50秒 Run #51 公式 v7 · 判定 v6 · 题库 v6
2026-03-30 03:01 SGT 轻量评测 完成
11 模型 开始:2026-03-30 03:00 SGT 完成:2026-03-30 03:01 SGT 1分40秒 Run #50 公式 v7 · 判定 v6 · 题库 v6
2026-03-29 03:01 SGT 轻量评测 完成
11 模型 开始:2026-03-29 03:00 SGT 完成:2026-03-29 03:01 SGT 1分40秒 Run #49 公式 v7 · 判定 v6 · 题库 v6
2026-03-28 03:02 SGT 轻量评测 完成
11 模型 开始:2026-03-28 03:00 SGT 完成:2026-03-28 03:02 SGT 2分11秒 Run #47 公式 v7 · 判定 v6 · 题库 v6
2026-03-27 05:05 SGT 轻量评测 完成
11 模型 开始:2026-03-27 05:04 SGT 完成:2026-03-27 05:05 SGT 1分41秒 Run #46 公式 v7 · 判定 v6 · 题库 v6
2026-03-25 00:12 SGT 完全评测 完成
11 模型 开始:2026-03-25 00:11 SGT 完成:2026-03-25 00:12 SGT 16秒 Run #43 公式 v7 · 判定 v6 · 题库 v6
2026-03-25 00:11 SGT 轻量评测 完成
11 模型 开始:2026-03-25 00:11 SGT 完成:2026-03-25 00:11 SGT 10秒 Run #42 公式 v7 · 判定 v6 · 题库 v6
2026-03-24 16:44 SGT 完全评测 完成
11 模型 开始:2026-03-24 16:29 SGT 完成:2026-03-24 16:44 SGT 15分31秒 Run #41 公式 v7 · 判定 v6 · 题库 v6
2026-03-24 15:50 SGT 完全评测 完成 migration
11 模型 开始:2026-03-24 15:32 SGT 完成:2026-03-24 15:50 SGT 17分31秒 Run #40 公式 v7 · 判定 v6 · 题库 v6
2026-03-24 15:31 SGT 完全评测 完成 migration
11 模型 开始:2026-03-24 15:31 SGT 完成:2026-03-24 15:31 SGT 16秒 Run #39 公式 v7 · 判定 v6 · 题库 v6
2026-03-24 15:23 SGT 完全评测 完成 migration
11 模型 开始:2026-03-24 15:22 SGT 完成:2026-03-24 15:23 SGT 30秒 Run #38 公式 v7 · 判定 v6 · 题库 v6
2026-03-24 00:00 SGT 版本升级
赢政指数 v6 正式上线

方法论升级

题库从 200 题扩展至 212 题,新增 12 道诚信压力测试题
维度体系重构:主榜只包含「代码执行」和「材料约束」两个可审计核心维度
新增「工程判断」「任务表达」侧榜(标注 AI 辅助评估)
新增「诚信评级」门槛机制(pass/warn/fail),诚信不达标的模型主榜封顶
主榜公式:core_overall = 0.55 × 代码执行 + 0.45 × 材料约束
稳定性、可用性、性价比降级为运行信号,不再混入主榜权重

判分引擎

新增 exact_rank 判分器,支持诚信压力测试的封闭式排序判分
评测并行架构升级至 55 进程(11 模型 × 5 能力层),full run 耗时约 15 分钟

社交舆情监控(新功能)

每日自动监控 11 个模型在 X/Twitter 上的用户反馈
舆情异常时自动触发定向复测,与评测数据交叉验证
每日自动监控 AI 厂商官方账号动态

数据页重建

原始数据页重建为摘要 + 分页模式,页面大小从 29MB 降至 64KB
不再公开题目原文和预期答案,防止题库污染

SEO 与口径统一

全站旧维度名(编程/知识工作/长文本)统一替换为 v6 表述
清理参数页、旧路由等 SEO 污染 URL
2026-03-22 14:26 SGT 完全评测 完成
11 模型 开始:2026-03-22 14:05 SGT 完成:2026-03-22 14:26 SGT 20分16秒 Run #37 公式 v5 · 判定 v6 · 题库 v5.1
2026-03-22 14:05 SGT 轻量评测 完成
2 模型 开始:2026-03-22 14:05 SGT 完成:2026-03-22 14:05 SGT 10秒 Run #36 公式 v5 · 判定 v6 · 题库 v5.1
2026-03-22 11:38 SGT 完全评测 完成 migration
11 模型 开始:2026-03-22 10:44 SGT 完成:2026-03-22 11:38 SGT 53分30秒 Run #35 公式 v5 · 判定 v6 · 题库 v5.1
2026-03-21 14:09 SGT 完全评测 完成
11 模型 开始:2026-03-21 13:35 SGT 完成:2026-03-21 14:09 SGT 33分30秒 Run #33 公式 v3 · 判定 v5 · 题库 v4
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v4:从 89 题扩充至 100 题。添加 11 道高质量决策题目
2026-03-21 13:29 SGT 完全评测 完成
11 模型 开始:2026-03-21 10:09 SGT 完成:2026-03-21 13:29 SGT 3小时20分 Run #31 公式 v3 · 判定 v5 · 题库 v4
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v4:从 89 题扩充至 100 题。添加 11 道高质量决策题目
2026-03-21 12:11 SGT 轻量评测 完成
11 模型 开始:2026-03-21 12:08 SGT 完成:2026-03-21 12:11 SGT 3分0秒 Run #32 公式 v3 · 判定 v5 · 题库 v4
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v4:从 89 题扩充至 100 题。添加 11 道高质量决策题目
2026-03-21 09:55 SGT 完全评测 完成
4 模型 开始:2026-03-21 08:05 SGT 完成:2026-03-21 09:55 SGT 1小时50分 Run #30 公式 v3 · 判定 v5 · 题库 v4
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v4:从 89 题扩充至 100 题。添加 11 道高质量决策题目
2026-03-21 07:53 SGT 完全评测 完成
9 模型 开始:2026-03-21 04:57 SGT 完成:2026-03-21 07:53 SGT 2小时56分 Run #29 公式 v3 · 判定 v5 · 题库 v4
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v4:从 89 题扩充至 100 题。添加 11 道高质量决策题目
2026-03-21 04:24 SGT 完全评测 完成
9 模型 开始:2026-03-21 01:30 SGT 完成:2026-03-21 04:24 SGT 2小时53分 Run #27 公式 v3 · 判定 v5 · 题库 v4
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v4:从 89 题扩充至 100 题。添加 11 道高质量决策题目
2026-03-21 01:21 SGT 轻量评测 完成
11 模型 开始:2026-03-21 01:21 SGT 完成:2026-03-21 01:21 SGT 10秒 Run #26 公式 v3 · 判定 v5 · 题库 v4
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v4:从 89 题扩充至 100 题。添加 11 道高质量决策题目
2026-03-21 01:19 SGT 题库变更
题库 v4:新增 11 道高质量决策题
新增 11 道高质量决策题,覆盖矛盾信息识别(2题)、信息不足诚实度(2题)、优先级排序(2题)、利益冲突检测(2题)、代码 review 陷阱(2题)、伦理边界(1题)。总题库从 89 题扩充到 100 题。题库版本升级为 v4。
2026-03-21 01:05 SGT 模型变更
新增 3 个评测模型:Grok 3、豆包 Pro、文心一言 4.0
新增 3 个评测模型:Grok 3(xAI)、豆包 Pro(字节跳动)、文心一言 4.0(百度)。评测模型总数从 8 个增加到 11 个。
2026-03-21 01:05 SGT 轻量评测 完成
11 模型 开始:2026-03-21 01:05 SGT 完成:2026-03-21 01:05 SGT 10秒 Run #25 公式 v3 · 判定 v5 · 题库 v3
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v3:从 80 题扩充至 89 题。新设工程判断力题目群(9 题)
2026-03-21 00:59 SGT 轻量评测 完成
10 模型 开始:2026-03-21 00:59 SGT 完成:2026-03-21 00:59 SGT 9秒 Run #24 公式 v3 · 判定 v5 · 题库 v3
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v3:从 80 题扩充至 89 题。新设工程判断力题目群(9 题)
2026-03-20 12:55 SGT 轻量评测 完成
8 模型 开始:2026-03-20 12:44 SGT 完成:2026-03-20 12:55 SGT 10分39秒 Run #23 公式 v3 · 判定 v5 · 题库 v3
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v3:从 80 题扩充至 89 题。新设工程判断力题目群(9 题)
2026-03-20 03:10 SGT 轻量评测 完成
8 模型 开始:2026-03-20 03:00 SGT 完成:2026-03-20 03:10 SGT 10分50秒 Run #22 公式 v3 · 判定 v5 · 题库 v3
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v3:从 80 题扩充至 89 题。新设工程判断力题目群(9 题)
2026-03-19 09:57 SGT 完全评测 完成
8 模型 开始:2026-03-19 08:07 SGT 完成:2026-03-19 09:57 SGT 1小时49分 Run #20 公式 v3 · 判定 v5 · 题库 v3
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v3:从 80 题扩充至 89 题。新设工程判断力题目群(9 题)
2026-03-19 03:11 SGT 轻量评测 完成
8 模型 开始:2026-03-19 03:00 SGT 完成:2026-03-19 03:11 SGT 11分42秒 Run #18 公式 v3 · 判定 v5 · 题库 v2
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v2:从 30 题扩充至 80 题(编程 33 + 知识 25 + 长上下文 22)
2026-03-18 03:11 SGT 轻量评测 完成
8 模型 开始:2026-03-18 03:00 SGT 完成:2026-03-18 03:11 SGT 11分18秒 Run #17 公式 v3 · 判定 v5 · 题库 v2
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v2:从 30 题扩充至 80 题(编程 33 + 知识 25 + 长上下文 22)
2026-03-18 01:19 SGT 完全评测 完成
8 模型 开始:2026-03-17 23:24 SGT 完成:2026-03-18 01:19 SGT 1小时55分 Run #16 公式 v3 · 判定 v5 · 题库 v2
判定 v5:引入严格判定分层(strict/non-strict):新设4种严格判定(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value)。严格题目仅 0 或 100
题库 v2:从 30 题扩充至 80 题(编程 33 + 知识 25 + 长上下文 22)
2026-03-17 11:23 SGT 完全评测 完成
8 模型 开始:2026-03-17 09:43 SGT 完成:2026-03-17 11:23 SGT 1小时40分 Run #15 公式 v3 · 判定 v4 · 题库 v2
判定 v4:评分规则微调。补充题库 v2 新题目对应的判定逻辑
题库 v2:从 30 题扩充至 80 题(编程 33 + 知识 25 + 长上下文 22)
2026-03-17 09:27 SGT 完全评测 完成
8 模型 开始:2026-03-17 07:51 SGT 完成:2026-03-17 09:27 SGT 1小时35分 Run #14 公式 v2 · 判定 v3 · 题库 v1
判定 v3:评分标准严格化:JSON验证检查嵌套字段的准确性、部分匹配改为比例计算、部分题目添加多种正确答案模式
题库 v1:初始题库 30 题。覆盖编程、知识业务、长上下文 3 个维度
2026-03-17 03:13 SGT 完全评测 完成
8 模型 开始:2026-03-17 02:32 SGT 完成:2026-03-17 03:13 SGT 40分31秒 Run #11 公式 v2 · 判定 v2 · 题库 v1
判定 v2:引入6种判定方法(全关键词匹配、部分匹配、完全匹配、正则表达式、顺序匹配、JSON结构验证)。正式评分体系建立
题库 v1:初始题库 30 题。覆盖编程、知识业务、长上下文 3 个维度
2026-03-17 03:10 SGT 轻量评测 完成
8 模型 开始:2026-03-17 03:00 SGT 完成:2026-03-17 03:10 SGT 10分54秒 Run #12 公式 v2 · 判定 v2 · 题库 v1
判定 v2:引入6种判定方法(全关键词匹配、部分匹配、完全匹配、正则表达式、顺序匹配、JSON结构验证)。正式评分体系建立
题库 v1:初始题库 30 题。覆盖编程、知识业务、长上下文 3 个维度
2026-03-17 02:12 SGT 完全评测 完成
8 模型 开始:2026-03-17 01:33 SGT 完成:2026-03-17 02:12 SGT 39分0秒 Run #10 公式 v2 · 判定 v2 · 题库 v1
判定 v2:引入6种判定方法(全关键词匹配、部分匹配、完全匹配、正则表达式、顺序匹配、JSON结构验证)。正式评分体系建立
题库 v1:初始题库 30 题。覆盖编程、知识业务、长上下文 3 个维度
2026-03-17 00:45 SGT 完全评测 完成
8 模型 开始:2026-03-16 23:58 SGT 完成:2026-03-17 00:45 SGT 47分30秒 Run #9 公式 v2 · 判定 v2 · 题库 v1
判定 v2:引入6种判定方法(全关键词匹配、部分匹配、完全匹配、正则表达式、顺序匹配、JSON结构验证)。正式评分体系建立
题库 v1:初始题库 30 题。覆盖编程、知识业务、长上下文 3 个维度