Anthropic发布Claude Fable 5.1 基准升至52.6%但护栏差异引发关注
Anthropic于2026年9月发布Claude Fable 5.1与Claude Mythos 5.1,两模型底层相同但护栏不同。Fable 5.1在Terminal-Bench-Science 0.1上达到52.6%,高于Fable
Anthropic于2026年9月发布Claude Fable 5.1与Claude Mythos 5.1,两模型底层相同但护栏不同。Fable 5.1在Terminal-Bench-Science 0.1上达到52.6%,高于Fable
2026年9月3日,OpenAI正式启动GPT-6 Astra的分阶段发布,该模型使用超10万GPU完成预训练,是该公司历史上规模最大的一次训练。Astra在ARC-AGI-3上得分98.6%,并成为首个突破OpenAI"关键"网络安全门槛
xAI于2026年8月12日发布Grok 4.6模型,输入定价2美元/百万token,输出6美元/百万token,上下文窗口达50万token。该模型在GDPval和Harvey Bench基准上领先GPT-5.6和Claude Opus
Anthropic于2026年7月24日推出Claude Opus 5,定价与Opus 4.8相同为每百万token输入5美元输出25美元,性能在Frontier-Bench v0.1等评测上超过前代并接近Fable 5一半成本。此前因AI
Moonshot AI近日发布Kimi K3模型,性能接近美国前沿水平并采用开放权重策略,引发OpenAI策略主管暗示监管风险的言论。支持者认为此举推动竞争,反对者指责其为保护闭源垄断的FUD与监管俘获,David Sacks公开批评,辩论
OpenAI将于2026年7月9日公开推出GPT-5.6系列三个模型。Sol定位最强代理能力,Terra性能接近GPT-5.5但成本减半,Luna为最低成本版本。此前因特朗普政府AI网络安全行政令要求,OpenAI先向政府提交模型接受评估,
Google承诺将于6月推出Gemini 3.5 Pro,目前内部已在使用该模型,开发者社区高度期待。Flash版本已上线,Pro版有望成为第二季度最受关注的AI模型,将显著影响API定价策略和行业采用率。本文深入分析其发布背景、技术亮点及
OpenAI即将推出GPT-5.6系列模型,包括Mini和Pro版本,支持150万token超长上下文及长程编码能力。该系列已通过ChatGPT Pro提前泄露,预计下周正式发布。此举将进一步加剧AI大模型市场份额争夺,行业格局或将发生显著
xAI近日在Grok Build平台正式上线Composer 2.5模型,该模型专精于长任务执行与复杂指令理解,兼具高速响应与智能推理能力。相关X平台官方帖文获得超2700赞及23万浏览量,引发开发者社区广泛讨论,标志着xAI在多步骤任务处