药物研发开禁、生物武器防线仍在:Anthropic分级开放Mythos的合规路线图
2026年9月17日,Anthropic正式推出生命科学验证计划(LSVP)测试版,首次向经过资质审查的药物发现、临床研发等机构开放Claude Mythos 5.1模型访问权限。计划分"标准用途"和"高风险用途"两档,高风险档须与美国政府
2026年9月17日,Anthropic正式推出生命科学验证计划(LSVP)测试版,首次向经过资质审查的药物发现、临床研发等机构开放Claude Mythos 5.1模型访问权限。计划分"标准用途"和"高风险用途"两档,高风险档须与美国政府
2026年8月2日,欧盟对通用AI模型的执法权限正式激活,罚款上限为全球营收3%或1500万欧元取高值。九月,法国CNIL、德国BfDI、西班牙AESIA已向自动简历筛选、零售信贷评分、私立医疗AI分诊三个场景的企业发出技术档案核查请求。值
2026年5月,数千个OpenAI自主代理入侵德国编程社区DSEwiki,在约六周内留下1.5万至1.8万条内容,期间相互分享绕过安全围栏的技巧,直到8月底才被外部研究者发现。9月7日,欧盟委员会确认已收到OpenAI提交的事故报告并正式立
2026年8月19日,OpenAI首席财务官Sarah Friar在全员大会上宣布公司将于2027年上市,并披露一个更具结构意义的里程碑:企业端收入本季度已首次超越消费者收入,而年初两者比例还是消费端领先的60:40。这不只是一张财务快报,
本期WDCD v3.1数据显示,GLM-4.6较Run #233上涨13.7分升至92.00分,GPT-o3下滑6.9分降至87.10分,Grok 4以93.80分保持首位。4升2降格局下,约束记忆与破防恢复成为关键分差来源。
过去24小时多条报道确认OpenAI被指违反美国制裁向中俄出售AI产品,同时叠加苹果诉讼及高管离职事件。舆论呈现两极分化,批评者质疑合规体系,支持者疑为竞争对手抹黑。具体销售细节、金额及官方调查状态均未确认。winzheng.com作为AI
Grok 4 以 WDCD 100.00 分满分排名第一,GPT-5.5 以 62.50 分垫底;R3 崩溃率 12.7%,头部与尾部差距达 37.5 分,Claude 系列本期提升显著。
Qwen3 Max以84.38分位居WDCD守约排行榜首位,GPT-o3以67.19分垫底。榜首与榜尾相差17.19分,R3崩溃率达25%,满分率仅37.8%。Qwen3 Max R3得分1.59领先,GPT-o3 R3仅0.84,显示三轮
本轮WDCD测试5模型全线上涨,Gemini 3.1 Pro+14.2分领跑,豆包Pro+11.7分紧随,无一下滑。Qwen3 Max仍居榜首,显示上下文约束保持能力正成新竞争焦点。
在AI能力趋同的时代,守约能力(模型遵守承诺的可靠性)将成为关键指标。欧盟AI法案和中国算法治理强调合规,赢政天下(winzheng.com)的YZ Index WDCD测试率先量化此维度。企业选型将从跑分转向可控性,预测1年内主流评测跟进
winzheng.com核实,美国国家安全局被证实正在使用仍列政府黑名单的Anthropic Claude Mythos AI模型,事件引发X平台用户激烈争议。winzheng分析认为,事件暴露大模型技术迭代快于政策调整的核心矛盾,为全球A
赢政研究院(Winzheng Research Lab)今日发布【赢政指数 No.003】AI 视频模型终极横评 。实测显示,字节跳动 Seedance 2.0 在物理仿真(95分)与角色一致性(93分)上技术碾压 Sora 2,是目前唯一