编者按:AI智能体的叙事在过去两年经历了从「无所不能」到「难以交付」的快速切换。德勤与Teradata的最新数据给出了一个冷峻的坐标:绝大多数企业已经入场,真正跑完全程的却寥寥无几。这不是模型能力的失败,而是工程与组织能力的考验。
两组数据,一个断层
德勤在其2026年技术趋势研究中给出了一个令人不安的数字:企业AI智能体从试点(pilot)走向生产(production)的失败率高达89%。换句话说,每十个被寄予厚望的智能体项目,最终大约只有一个真正进入了业务系统。
Teradata的一项调查描绘出这个断层的具体形状:78%的企业至少有一个智能体试点在运行,但只有14%的企业将其扩展到全组织范围的应用。采用率接近普及,部署率却依然稀有。这两个数字之间的落差,正是当下企业AI最真实的困境。
值得注意的是,这个失败率并不等同于项目被正式取消。更多时候,试点既没有被宣布成功,也没有被明确叫停——它们停在演示阶段,慢慢失去预算和关注,最终无声消失。这种「僵尸试点」现象,比一次干脆的失败更消耗组织的信心,也让后来者更难争取资源。
差距不在模型,而在模型之外
原文明确指出,问题的关键差别并不在模型本身。今天的模型能力足以支撑大量有价值的业务场景,真正让项目停在原地的,是模型周围的一切。
第一是数据与系统的接入。智能体要真正干活,必须读取企业内部系统的数据、调用接口、写入记录。但多数企业的核心系统分散在ERP、CRM、工单系统与自建数据库之间,权限模型各不相同,数据质量参差不齐。试点阶段往往使用清洗过的样本数据,一旦接入生产环境,脏数据、字段缺失、接口限流会立刻暴露。
第二是可靠性与非确定性。传统软件的行为可预测,同样的输入给出同样的输出;智能体则是概率性的,同一个问题可能得到不同答案。对于财务对账、订单处理、合规审查这类要求精确的业务,哪怕98%的正确率也意味着每天数以千计的人工兜底。企业需要的不只是更聪明的模型,而是重试机制、校验层、人工确认节点与降级策略。
第三是权限、安全与合规。一个能自主调用工具的智能体,本质上是一个持有系统凭证的自动化执行者。它能做什么、不能做什么,需要细粒度的权限边界;它的每一次调用都需要可审计的日志。多数企业在试点阶段尚未建立针对智能体的身份管理与审计框架,这使得安全团队很难为规模化开绿灯。
第四是评估与价值度量。「帮同事省了写邮件的时间」很难写进季度财报。企业需要把智能体的收益转换为可度量的业务指标:工单处理时长、单次交互成本、人均产出、错误率下降幅度。缺少这套度量体系,试点就无法在预算争夺中证明自己的价值。
第五是成本结构。试点阶段的推理成本通常由少数用户分摊,一旦扩展到全组织,Token消耗、工具调用、检索与日志存储会形成持续支出。若单位经济学不成立,规模越大亏损越多,项目自然会被叫停。
为什么「能演示」总是骗过所有人
演示场景与生产环境之间的鸿沟,是89%这个数字的核心成因。演示只需要在受控条件下完成一条完美路径;生产则要求系统在异常、并发、脏数据和突发流量中保持可用。
试点验证的是「技术是否可行」,生产验证的是「业务是否可持续」。前者是实验室问题,后者是运营问题。
这也解释了为什么许多项目在概念验证阶段评价极高,进入集成阶段却迅速失速。团队往往低估了集成、测试、监控与变更管理的工作量,而恰恰是这些不性感的部分,决定了项目能否跨越那条线。
从14%走向多数:几条可行路径
观察那些真正完成规模化的少数企业,可以看到一些共同做法。
其一,从流程而非技术出发选场景。成功的项目通常锁定高频、规则相对清晰、人工成本显著、容错空间可接受的工作流,而不是追求最具想象力的用例。
其二,把智能体当作需要运维的软件系统,而非一次性实验。这包括版本管理、回归测试集、线上监控、告警与回滚机制。
其三,设计人机协作的边界。在关键节点保留人工确认,既是为了风控,也是为了在早期积累信任与反馈数据。
其四,让治理先行。权限模型、审计日志、数据分类分级应当在试点阶段就建立,而不是等到规模化时再补课——那时的改造成本往往高得令人放弃。
其五,明确一位对业务结果负责的负责人。由IT部门主导的试点容易停留在技术验证,只有业务负责人真正在意指标,项目才有动力走向生产。
结语:分水岭已经出现
78%与14%之间,藏着企业AI未来几年的真正竞争。当所有人都能拿到同样的模型能力时,差距将由数据基础设施、工程纪律和组织流程决定。89%的失败率并不是说智能体没有价值,而是在提醒:价值不在演示里,而在那些枯燥的、必须被完成的工程细节里。
对于已经启动试点的企业,现在最值得问的问题或许不是「我们该换哪个更好的模型」,而是「我们有没有能力把一个试点运营成一项生产服务」。
本文编译自AI News
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接