a16z 押注 Vals:谁来定义 AI 评测的黄金标准

a16z 押注 Vals:谁来定义 AI 评测的黄金标准

编者按:当大模型的发布会越来越像一场营销秀,「跑分」也就越来越像一门玄学。谁来给 AI 打分、按什么标准打分、打分的人是否与厂商存在利益关系——这些问题正成为行业最敏感的公共议题。TechCrunch 报道的这家名为 Vals 的初创公司,正试图把「中立评测」做成一桩正经生意。

据 TechCrunch 记者 Lucas Ropek 于 2026 年 9 月 19 日报道,获得安德森·霍洛维茨(Andreessen Horowitz,下称 a16z)投资的初创公司 Vals AI,正试图在 AI 模型数量爆炸式增长的时代,成为 AI 基准测试领域的「黄金标准」。其核心主张简单而明确:评测必须中立、可复现、可信任。

评测已成大模型竞赛的「第二战场」

过去两年,基准测试从技术圈的小众工具,变成了决定融资节奏、企业采购与舆论走向的关键变量。厂商在发布新模型时总会列出一长串成绩单:数学推理、代码生成、多模态理解、长上下文……每一项后面都跟着一个漂亮的百分比。

但问题也随之而来。基准一旦公开,就可能被「针对性优化」,即业界常说的数据污染与刷榜;部分榜单背后有厂商资助,立场难以完全独立;不同实验室的评测环境、提示词模板、判定方式各不相同,导致同一模型在不同榜单上的排名可以相差十几个位次。对普通用户和企业采购方而言,这些数字的参考价值正在被迅速稀释。

「当所有人都能挑一个对自己有利的榜单时,榜单就不再是标准,而只是广告。」

Vals 的思路:把跑分变成公共基础设施

Vals AI 的做法,是把评测从「一次性跑分」变成「持续运营的公共基础设施」。综合公开信息,其路径大致包含几个层面:一是建立统一、透明的评测流程,公开提示词、评分规则与运行环境,让第三方能够复现结果;二是针对法律、金融、医疗等垂直领域构建贴近真实工作流的任务集,而非单纯考察考试题式的知识问答;三是持续追踪模型版本迭代,输出可横向、纵向对比的时间序列,而不是一个孤立的分数。

换言之,Vals 想卖的不是「谁更聪明」的结论,而是「结论如何得出」的可信度。这一取向与当下主流榜单形成明显区隔:后者往往追求传播效率,前者则押注长期信任。

a16z 为什么愿意下注

a16z 对 AI 基础设施的兴趣由来已久。在其投资逻辑中,评测处于一个颇为特殊的位置:它既是模型公司必须关注的门槛,也是企业客户采购时的决策依据,同时还具备成为行业标准后自然形成的网络效应。

更现实的一层是,随着企业从「试用大模型」进入「规模化部署」阶段,选型风险被显著放大。一旦模型在真实业务中出现幻觉、合规或成本失控问题,损失由采购方承担。此时,一份足够中立、可追溯的评测报告,其价值并不亚于模型本身的能力提升。评测由此从成本项变成了保险项,也就有了付费空间。

信任,是这门生意最贵的成本

然而,评测机构天然面临一个悖论:它必须同时取悦模型厂商与终端客户,又必须对双方都保持距离。一旦某家厂商的模型在榜单上长期领先,质疑其是否存在利益输送的声音就会出现;反之,若榜单刻意「打压」头部模型,又会面临商业压力与公信力反噬。

历史上,类似的角色并不缺乏先例。从学术界的标准数据集,到第三方跑分平台,再到各类行业认证机构,几乎都经历过「被质疑—调整方法—再被质疑」的循环。能否熬过这一循环,往往取决于两个变量:方法论是否足够透明,以及收入来源是否足够多元、与单一厂商脱钩。

挑战与不确定性

摆在 Vals 面前的难题至少有四重。第一是技术层面的持续追赶:模型能力迭代以周为单位,评测集若更新滞后,很快就会失效。第二是成本:高质量的专家标注与人工复核极其昂贵,而垂直领域评测恰恰最依赖专业人力。第三是标准之争:评测市场极可能不会只剩一家玩家,谁能成为事实标准,取决于生态结盟而非单纯技术优劣。第四则是中立性与商业化的平衡——这几乎是所有「裁判型」公司的宿命考题。

可以确定的是,随着 AI 深入关键行业,「谁来给 AI 打分」将不再是技术细节,而会成为一个涉及合规、采购与公共信任的基础性问题。Vals 能否成为那个标准尚未可知,但它所代表的诉求——中立、透明、可复现的评测——正在被越来越多的人认真对待。

本文编译自 TechCrunch