跳至正文
首页
资讯
测评
AI 专题
赢政指数
Lab
WDCD
首页
›
专题
›
AI 代码能力评测
AI 代码能力评测
149 篇文章 · 第 1/8 页
哪个 AI 模型写代码最强?HumanEval 和 MBPP 是常用基准,但它们只测函数级补全,与真实开发场景差距大。赢政指数的代码执行维度(Execution)在隔离沙箱中运行模型生成的完整程序,验证编译通过率、运行时正确性和边界处理能力,是目前少数采用真实代码执行验证的独立评测。本专题追踪各模型的代码能力排名、编程工具动态和 AI 辅助编程的行业实践。
Cursor推代码托管平台,正面挑战GitHub
AI代码编辑器开发商Cursor宣布推出全新的代码托管平台,意图挑战开发者长期依赖的GitHub。该公司抓住部分开发者对GitHub的不满情绪,将AI能力融入代码托管流程,提供更智能的协作体验。此举有望重塑代码托管市场格局。
2026年08月19日
横评
DeepSeek V4 Pro代码执行暴跌41.7分 主榜单日跌19.2
DeepSeek V4 Pro今日Smoke评测主榜从70.44分跌至51.24分,代码执行从66.70分直接跌至25.00分,材料约束反而升至83.30分。单日41.7分降幅远超正常抽签波动范围,需持续观察。
2026年08月17日
横评
Claude Sonnet 4.6代码执行从100分跌至75分 主榜下滑5.5分
今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单日10题测试下,此类波动需结合多日数据判断是否为抽签影响。
2026年08月16日
横评
Claude Opus 4.7代码执行75.00分 材料约束100.00分 主榜反升3.7
Claude Opus 4.7今日Smoke评测代码执行从99.60分跌至75.00分,材料约束从61.70分升至100.00分,主榜从82.55分升至86.25分。工程判断降11.1分,任务表达持平。单日10题抽样波动或为主要原因,需持续观察一致性。
2026年08月16日
SpaceX正式完成对AI编程工具Cursor的收购
SpaceX官方宣布已完成对AI编程初创公司Cursor的收购,这意味着备受欢迎的AI代码编辑器正式纳入这家航天巨头麾下。这笔交易虽未披露具体条款,但反映出SpaceX对软件研发效率的重视,也凸显了AI编程工具在严肃工业场景中的巨大潜力。有分析认为,Cursor的加入将帮助SpaceX的工程师更快地
2026年08月16日
AI编程新贵Cognition再融资,估值飙至400亿美元
据TechCrunch报道,AI编程初创公司Cognition在完成10亿美元融资、估值达260亿美元仅数月后,又被曝出正洽谈新一轮巨额融资,估值可能高达400亿美元。这家凭借AI编程工具Devin声名鹊起的公司,正以惊人速度刷新行业纪录,也折射出AI编程赛道的持续火爆。
2026年08月13日
横评
Gemini 2.5 Pro 主榜暴跌9.1分,代码执行单日狂降29.6
Gemini 2.5 Pro今日Smoke评测主榜79.41分,较昨日下降9.1分。其中代码执行从99.60暴跌至70.00,材料约束则升至90.90。单日10题抽样导致的波动值得持续观察。
2026年08月13日
Lovable确认133亿美元新估值,再融4亿美元
AI应用构建平台Lovable确认完成新一轮4亿美元融资,估值达到133亿美元,较上一轮大幅提升。公司透露,其年化经常性收入在6月已突破5亿美元,本轮融资进一步验证了生成式AI编程赛道的商业潜力。
2026年08月13日
横评
GLM-4.6代码执行跌12.5分 材料约束满分推主榜升5.4
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
2026年08月12日
Anthropic默认开启Claude Code自动模式,AI编程再少人工干预
Anthropic宣布将Claude Code的自动模式设为默认选项,这意味着开发者无需频繁确认即可让AI自主完成多步骤编程任务。此举旨在提升编码效率,但也引发关于代码质量与安全风险的讨论。本文详解Claude Code自动模式的变化、行业影响及潜在挑战,并编译自TechCrunch报道。
2026年08月10日
横评
Claude Sonnet 4.6代码执行暴跌19.5分 主榜却逆势上涨13.8分
今日Smoke评测中,Claude Sonnet 4.6代码执行从94.50分跌至75.00分,材料约束从43.30分升至97.80分,主榜从71.46分升至85.26分。仅2题抽样导致的波动是主因,整体能力未见系统性退化。
2026年08月08日
横评
Claude Opus 4.7代码执行暴跌30.5分 主榜仅降6.4分
Claude Opus 4.7在今日Smoke评测中代码执行从100.00分跌至69.50分,材料约束从71.90分升至95.00分,主榜从87.36分降至80.98分。工程判断升25分,任务表达升5分。诚信评级维持pass。
2026年08月07日
横评
Grok 4 材料约束暴跌17.6分 主榜仅降1.8分
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一材料约束异常值得重点追踪。
2026年08月07日
Cloudflare开源‘氛围编程’平台,为非程序员打造
Cloudflare近日宣布,将内部使用的AI代理工作区全面开源。该平台专为‘氛围编程’(vibe-coding)设计,允许用户以自然语言与AI代理交互,自动完成代码编写、调试和部署等任务。这一举措不仅能让非程序员轻松构建应用,也可能重塑软件开发流程。本文梳理了平台的核心功能、Cloudflare开
2026年08月07日
横评
GLM-4.6 Smoke评测主榜74分 代码执行82.3材料约束95 API故障缺维度
GLM-4.6今日Smoke评测因API故障/超时导致integrity与communication维度缺失,主榜得分74.00,代码执行82.30,材料约束95.00,工程判断70.80,任务表达无数据,已进入自动补跑且不参与本期排名。
2026年08月02日
横评
GPT-o3今日主榜暴跌13.9分,代码执行与材料约束双双失守
GPT-o3在今日Smoke评测中主榜从93.16分跌至79.28分,暴跌13.9分。代码执行从95.00降至81.80,材料约束从90.90降至76.20,工程判断侧榜更跌30.6分至63.90。任务表达侧榜升至100.00。诚信评级维持pass。需判断是否为抽签波动还是真实退化。
2026年08月01日
横评
Qwen3 Max材料约束暴跌20分至47.70,代码执行却暴涨37.8分,主榜反升11.8
今日Smoke评测中,Qwen3 Max材料约束从67.70跌至47.70,降幅20分;代码执行从54.70升至92.50,升37.8分。主榜从60.55升至72.34。工程判断降16.6分,任务表达升35分。诚信评级维持pass。单日10题抽签下,材料约束大幅波动值得追踪。
2026年07月31日
横评
Grok 4 代码执行暴跌19.5分 材料约束反升23.2分 主榜仅降0.3
Grok 4今日Smoke评测代码执行从92.00分跌至72.50分,降19.5分;材料约束从60.90分升至84.10分,增23.2分;主榜从78.01分微降至77.72分。工程判断同步跌19.5分,任务表达升10分。单日10题快测下,需判断波动属性。
2026年07月31日
横评
DeepSeek V4 Pro代码执行暴跌25分 主榜下滑6.7分
今日Smoke评测中,DeepSeek V4 Pro代码执行从100.00跌至75.00,主榜从83.53降至76.85。材料约束升至79.10,工程判断升至100.00,任务表达降至74.20,诚信评级从warn转为pass。单日10题快测下,此类波动需区分抽签与真实退化。
2026年07月30日
Cursor印度大举出击:本地定价抢占市场
Cursor宣布印度已成为其全球第三大市场,将通过本地化定价、扩大本地招聘和企业销售团队深耕印度市场。这是它在即将被SpaceX收购前的关键布局,意在巩固并扩大其在高速增长的印度开发者生态中的份额。
2026年07月28日
1
2
3
4
»
相关专题
AI 评测基准对比
指令遵从与守约测试
OpenAI 专题
Anthropic 专题
AI 安全专题