Grok 4.7发布:DeepSWE基准71%、按量计费比半悖论背后的真实成本

xAI于2026年9月21日正式推出Grok 4.7。官方发布页披露,该模型在DeepSWE v1.1基准的高强度(xHigh)设置下达到71.0%,较上一代Grok 4.6的65.2%提升约6个百分点;CursorBench 4.0得分从40.4%升至46.3%;每百万token定价维持$2输入/$6输出不变。这是xAI发布Grok 4以来连续第二个子版本迭代,训练方向已从通用对话能力明显转向多小时工程任务。

强化学习的赌注:把难题喂给模型

据xAI官方博客介绍,Grok 4.7采用“更长的强化学习训练轮次,在加权向多小时任务的更难题库上进行”。这句话的工程含义是:xAI刻意让模型在训练阶段见到那些需要长时间推理、多步验证的真实工程场景,而不是一问一答的短程任务。这与当前主流大型实验室的趋势一致——OpenAI、Anthropic同期也在将RL算力重心从RLHF偏好对齐迁移到可验证任务的过程奖励。

DeepSWE v1.1基准专门测量模型在软件工程全流程中的自主完成能力,包括理解代码库、定位bug、生成修复补丁并通过测试套件验证。71.0%意味着Grok 4.7在10个此类任务中约有7个能够独立完工。作为对照,同期Claude Fable 5.1在该基准上报告的高强度成绩约为70.0%,另一家GPT-5.6 Sol约为72.7%,三者处于同一梯队。

“价格是竞品一半”——数字没有撒谎,但结论撒了

发布舆论中传播最广的说法是Grok 4.7定价约为同类模型的一半。从每百万token的列表价来看,这个对比基本成立:$2/$6对标市场上部分旗舰模型$6-$15的区间。但据AI分析机构Artificial Analysis的实测数据,Grok 4.7在其“智力指数”任务中平均消耗约81,000个输出token,而Grok 4.6为36,000个——单任务token消耗增加了125%。

这意味着:在同等工程任务上,你支付的不是0.5倍的价格,而是接近1.0倍,有时甚至更高。Artificial Analysis的测算显示,Grok 4.7 xHigh完成CursorBench任务的单次成本约为$6.01,而Claude Fable 5.1 Medium的同等完成成本约为$7.05——差距缩减至约15%,远不是宣传中的“减半”。

这个悖论并非xAI独有,但在Grok 4.7上体现得格外典型:强化学习让模型更倾向于“慢思考”路径,大量中间推理步骤被展开成可见token,基准分数上去了,账单也悄悄涨上去了。对于每月处理数十亿token的生产团队,这个差异足以影响迁移决策。

两个基准,两副面孔

开发者社区中出现了对立鲜明的两种声音,根源在于Grok 4.7在不同基准上的表现差异极为显著。

CursorBench 4.0测量的是AI辅助编码助手在代码补全、重构、debug等有人参与的交互场景中的完成质量——Grok 4.7在这里得到46.3%,与Fable 5.1处于同一量级。

Terminal-Bench 4.0测量的则是模型在纯命令行环境下的自主执行能力——Grok 4.7拿到37.6%,而Claude Fable 5.1的同期成绩约为57.9%,差距超过20个百分点。有开发者直接用“horrendous”(糟透了)来形容这一结果。

两组数据读出的是同一个模式:Grok 4.7在有反馈回路、有人工确认的长程协作任务上表现合格;在需要模型自行决策、执行、验证的无人值守场景中,目前还不到位。这对于正在评估是否将Grok 4.7接入CI/CD流水线或夜间自动化任务的团队,是一个不可忽略的实际约束。

Harvey法律基准:一个被低调处理的强项

官方公告中另有一项数据被主流报道忽略:Grok 4.7在Harvey法律代理人基准上得分19.6%,据报道超出同期对比旗舰模型数倍。Harvey基准专门测量AI在法律文件分析、合同审查、多步法律推理任务中的表现,属于高专业门槛的知识工作场景。

这与DeepSWE的强项构成了一个清晰的轮廓:Grok 4.7的RL训练所侧重的“多小时任务”,本质上是那些有明确正确答案、可以程序化验证的专业问题——无论是软件测试通过与否,还是法律条款是否被正确援引。这类任务的共同特征是有强奖励信号,适合RL打磨。

竞争格局中的位置

从当前可比基准来看,Grok 4.7与Fable 5.1、GPT-5.6 Sol三者在DeepSWE上的差距在2个百分点以内,已经进入统计噪声区间。但在CursorBench和Terminal-Bench上,三者的分化更为明显,反映出各自RL训练数据配比的侧重差异。

在定价维度,xAI的$2/$6仍低于Anthropic和OpenAI同等能力段模型的公开价格,即便计入token消耗增加后的实际成本,Grok 4.7在长程编码任务上仍具备约10%-20%的成本优势。这个优势不足以形成压倒性的选择理由,但对于成本敏感的中型团队,已经够用了。

结论

Grok 4.7是一款在特定场景下完成度较高的工程工具,但它的营销叙事和实际表现之间存在几处明显的错位。DeepSWE 71%是真实成绩,但它依赖高强度推理模式;“价格是竞品一半”从列表价看合理,但高token消耗在实际任务上把这一优势吞噬了相当一部分;Terminal-Bench上的短板意味着全自动代理场景目前并非其主战场。

对于有长程代码协作需求、愿意在工程任务中接受较高推理延迟的团队,Grok 4.7提供了一个测试选项。对于需要高速无人值守自动化的团队,现有数据尚不支持迁移决策。xAI把赌注押在了“把难题做对”而非“把简单任务做快”这条路上,这个方向本身是清醒的——只是距离全面可用,还差几个Terminal-Bench的版本迭代。