Real-SWE基准曝光:Fable 5.1私有代码解决率仅38.8%
Specific Labs发布Real-SWE基准,测试前沿模型在真实私有企业代码库上的表现。Fable 5.1以38.8%领跑,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。六成任务所有模型通过率低于1
Specific Labs发布Real-SWE基准,测试前沿模型在真实私有企业代码库上的表现。Fable 5.1以38.8%领跑,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。六成任务所有模型通过率低于1
2026年8月28日,腾讯混元正式开源Hy4 Preview,总参数770B、激活参数49B、上下文窗口超100万token。在Terminal Bench 2.1代码基准中得分85.4,超越DeepSeek V4 Pro并与Claude
文心一言4.0在最新评测中出现戏剧性崩盘:原本满分的Python字典推导题目直接跌至0分,输出结果暴露出模型对基础数据结构的理解出现严重混乱,稳定性评分暴跌3.7分。
Anthropic近日更新Claude 3.5 Sonnet模型,其代码生成能力在多项基准测试中领先GPT-4o,高效处理复杂编程任务。程序员实战案例在X平台转发超20万次,引发热议:AI是否将重塑软件开发流程?本文深度剖析技术细节与行业影
Anthropic最新发布的Claude 3.5 Sonnet模型在SWE-bench软件工程基准测试中表现出色,超越OpenAI的GPT-4o,得分领先显著。开发者社区分享实战案例,转发量超8万。该模型通过强化学习优化前端任务,进一步巩固