赢政天下 AI — AI 模型评测·行业资讯·深度研究

最新资讯

查看全部 →
资讯 09-14 09:15 NF
Anthropic选纳斯达克IPO 目标估值2万亿美元冲人类纪录
2026年9月13日,彭博社与商业内幕同时确认Anthropic选定纳斯达克上市,目标估值1.5万亿至2万亿美元,融资规模或超SpaceX今年860亿美元纪录。IPO最快十月启动,投资者说明会本周举行。金融时报披露其Q2营收115亿美元,同
资讯 09-14 07:13
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
资讯 09-14 06:11 NF
Anthropic CEO发布放缓宣言:三大头部同时刹车,究竟是安全共识还是寡头默契?
Anthropic CEO Dario Amodei于2026年9月12日发布3800字长文,呼吁放缓前沿模型开发,并宣布单方面向第三方评估机构提供员工级永久访问权限。Sam Altman、Elon Musk随即表态支持,三大AI头部创始人
评测 09-14 03:35
Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5并列91.09分:2026-09-14 Smoke快测数据简报
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,
资讯 09-14 02:23 TC
奥巴马喊话民主党:AI监管必须有“清晰计划”
美国前总统奥巴马近日公开呼吁民主党将人工智能列为“核心议程”之一,并要求拿出一份“非常清晰的计划”,回应公众对AI经济冲击与安全风险的担忧。此番表态被视为民主党在AI议题上寻求统一立场的重要信号,也把硅谷、国会与白宫之间围绕监管边界的博弈再
资讯 09-13 19:23 WD
AI智能体“狂饮”电力,数据中心扩建潮席卷硅谷
硅谷正从轻量级的聊天机器人查询,转向资源密集型的代理式AI。这种能自主执行复杂任务的智能体,对算力和电力的需求呈指数级增长,正推动一场史无前例的数据中心建设狂潮。当AI从“回答问题”进化到“采取行动”,能源账单也随之飙升。
资讯 09-13 14:26 NF
RLHF奠基人保罗·克里斯蒂亚诺加入OpenAI理事会:最强批评者入局,评测独立性存结构性张力
2026年9月9日,OpenAI宣布任命RLHF技术奠基人、ARC/METR创始人保罗·克里斯蒂亚诺加入基金会理事会及安全与安保委员会。此人曾公开写道AI灾难性失控"存在有实质意义的概率",并称OpenAI"并未走在将此风险降至可接受水平的
资讯 09-13 14:21 NF
Amodei呼吁AI前沿减速并承诺第三方永久驻场:三巨头罕见共识背后的真实逻辑
2026年9月12日,Anthropic CEO Dario Amodei发表约3800字长文,呼吁全行业放缓前沿模型能力提升速度,并宣布单方面承诺为第三方评估机构提供永久员工级访问权限。Sam Altman、Elon Musk随即背书,但
资讯 09-13 13:00 NF
美中9月中旬北京首谈AI安全 贝森特领军中方曾提定义前提
美国财政部长贝森特将于2026年9月中旬率团赴北京,与中方举行特朗普第二任期首次专项AI安全双边对话。会谈聚焦自主AI网络攻击风险与前沿实验室数据共享协议。此前中方提出须先就“AI安全”定义达成共识,否则谈判不推进。背景为5月特习峰会重启A
评测 09-13 12:04
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Eng
资讯 09-13 09:15 NF
AI代理违背指令攻破395机构 26秒内11家同时沦陷
2026年8月31日起,一名俄语攻击者利用OpenAI Codex框架与DeepSeek模型组建数百AI代理,借助PaperCut两个0day漏洞,在48国395个组织440个实例中完成入侵,最快26秒内攻破11家机构。美国一所高中从入侵到
资讯 09-13 09:00 NF
Real-SWE基准曝光:Fable 5.1私有代码解决率仅38.8%
Specific Labs发布Real-SWE基准,测试前沿模型在真实私有企业代码库上的表现。Fable 5.1以38.8%领跑,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。六成任务所有模型通过率低于1