Anthropic发布Claude Fable 5.1 基准升至52.6%但护栏差异引发关注
Anthropic于2026年9月发布Claude Fable 5.1与Claude Mythos 5.1,两模型底层相同但护栏不同。Fable 5.1在Terminal-Bench-Science 0.1上达到52.6%,高于Fable
Anthropic于2026年9月发布Claude Fable 5.1与Claude Mythos 5.1,两模型底层相同但护栏不同。Fable 5.1在Terminal-Bench-Science 0.1上达到52.6%,高于Fable
2026年9月3日arXiv发布的SWE-Gate论文构建303个任务新基准,644个功能测试通过的修复中有221个(34%)违反代码审查要求,覆盖75个开源Python仓库,证明现有基准系统性高估Agent能力。
2026年8月24日发布的SWE Refactor Bench对8款前沿模型进行520次全仓库技术栈迁移测试,仅28次通过全部评估,占比5.4%。20个任务中13个无模型成功,最优的Claude Opus 5得分47/100。测试区分迁移完
2026年7月9日,OpenAI正式全球发布GPT-5.6三款模型Sol、Terra、Luna,旗舰版Sol在编程、网络安全等基准测试中刷新纪录,售价仅为Anthropic Fable 5的四分之一。然而独立评估机构METR记录到该模型有史
DeepSeek于2026年8月12日发布V4 Pro正式版,已在OpenRouter等平台可用,代理基准测试表现突出。X平台基准结果快速传播,开发者对性能接近或超越Qwen的说法反应积极,但长期稳定性和企业部署案例仍需观察。该事件加剧开源
赢政指数Smoke评测显示,Gemini 2.5 Pro今日材料约束从92.50分跌至77.30分,降幅15.2分,但代码执行从55.00分升至100.00分,主榜总分反而上涨17.9分至89.79分。单日10题快测波动或为主要原因。
OpenAI近日发布的o1-preview模型在多项基准测试中大幅领先GPT-4o和Claude 3.5 Sonnet,尤其在数学和编程领域表现卓越,ARC-AGI得分达83%。其‘思考链’优化机制被誉为AI推理革命的关键,X平台#o1话题
Anthropic推出Claude 3.5 Sonnet,在GPQA、SWE-bench等基准测试中超越GPT-4o,用户反馈编码任务表现惊人。互动超20万,焦点转向实际应用与安全优先策略,凸显前沿大模型竞赛白热化。
NVIDIA DGX Spark 是一款紧凑型一体机,将超级计算级性能带入桌面工作站。通过 NVIDIA 早期访问计划,我们深入测试了这款设备。它搭载 GB10 Grace Blackwell Superchip,提供 128 GB 统一内
Mini-SGLang是SGLang项目的轻量版推理框架,仅用5k行Python代码,即实现了高性能LLM推理,支持Radix Attention、Chunked Prefill、Overlap Scheduling和Tensor Para
OpenAI近日发布o1-preview和o1-mini模型,在数学、编码及科学推理基准上大幅超越GPT-4o,ARC-AGI得分高达87.5%。其‘思考链’机制模拟人类推理过程,引发X平台热议,互动超10万次,用户测试分享刷屏,标志AI迈