在AI基础设施领域,GPU的稀缺性和高成本一直是行业痛点。随着智能体(agentic)AI工作流的兴起,一种普遍观点认为,GPU这种为大规模并行计算设计的硬件,并不适合需要频繁交互、分支处理和动态决策的智能体场景。然而,法国初创公司Kog对此提出了不同看法:这或许是一个长期存在的误解。
被低估的GPU推理潜力
Kog的核心主张是,GPU在智能体工作流中的表现不佳,并非硬件本身的先天缺陷,而是现有软件栈和优化策略未能充分释放其潜力。传统的深度学习推理优化通常聚焦于高吞吐、低延迟的批处理场景,但智能体工作流具有截然不同的特征——它涉及大量小规模请求、多步推理、上下文切换以及实时性要求。Kog正在针对这些特征,从底层重新设计推理引擎和调度机制,使GPU能够在这些碎片化、动态化的计算模式中同样高效运转。
“GPU不是不适合智能体,而是我们还没有真正为智能体重新定义GPU的使用方式。”——Kog团队相关表述(据TechCrunch报道)
为什么智能体工作流让GPU“头疼”?
要理解Kog的突破点,需要先看清当前智能体AI的算力需求结构。与传统的单次推理请求不同,一个智能体任务通常需要模型反复调用工具、读取上下文、规划下一步动作,每一次调用都可能是一个独立的推理请求。这种模式导致GPU的空闲率极高——每一次请求之间的切换、KV缓存的重新加载、以及动态分支带来的不规则内存访问,都会让GPU的效率大打折扣。
而业界目前的应对方式,要么是增加更多GPU以提供足够的并行容量,要么是依赖CPU来处理这类交互密集型任务。前者成本高昂,后者则牺牲了模型性能和推理速度。Kog的策略则是从GPU自身出发,通过更细粒度的任务切分、智能缓存复用和显存管理,让GPU在这种“小步快跑”的工作负载中也能保持高利用率。
行业背景:推理优化正成为新战场
Kog并非孤例。进入2026年,随着大语言模型从训练主导转向推理主导,AI行业的算力瓶颈已从“训练不够快”转向“推理不够省”。OpenAI、Anthropic等头部实验室不断推出更复杂的智能体产品,而企业对GPU投资回报率的焦虑也与日俱增。在这个背景下,诸如vLLM、TensorRT-LLM等推理优化框架快速发展,但大多数方案仍以传统吞吐量优化为目标。
Kog的独到之处在于,它把“智能体工作负载”作为第一公民来设计系统。这意味着,它不仅要优化单次推理,还要优化整个推理链——包括如何在不同步骤间共享中间状态、如何预判未来的计算分支、如何将多轮对话的KV缓存持久化并在最合适的时刻复用。这种系统级的优化,有望在不增加硬件成本的前提下,将GPU在智能体场景下的实际利用率提升一个数量级。
编者按:重新审视“硬件不匹配”论
长期以来,行业对“GPU vs 智能体”的讨论往往陷入非此即彼的二元对立。Kog的尝试提醒我们,硬件能力与软件意图之间的鸿沟,往往不是靠更换芯片就能填平的。正如早年间CPU被预测将“终结”于GPU时代,结果却是二者的协同进化一样,智能体工作流也可能在更聪明的软件系统中与GPU形成新的和谐。
当然,Kog目前的技术细节尚未完全公开,其宣称的“深度优化”究竟能带来多大的实际收益,还需经过真实生产环境的检验。但至少,这家法国初创公司为我们提供了一个重要的思维转向:与其一味追逐新一代芯片,不如先榨干手中GPU的每一分推理潜能。
本文编译自TechCrunch
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接