1. 引言
推理优化看似是代码层面的局部修改,但其有效性却是全局性的。一个内核、通信路径或调度变更,只有在由模型、工作负载、SLO、服务拓扑、运行时版本和加速器平台共同定义的特定部署点上才有意义。同一补丁可能在一个部署点带来提升,却在另一个点导致回退。
因此首要需求是可靠执行。重现部署点不仅需要模型能力,还需工具、环境、上下文、内存、验证和安全边界保持稳定。Harness Engineering 将这些周边条件转化为可复现、可检查的执行系统,形成抽象 Agent = Model + Harness 的基础。
2. 推理即部署空间
图1 将部署点转化为具体的约束链。模型决定支持的模态和执行路径,服务场景将模态和流量形状转化为 SLO,进而约束服务拓扑,最终通过版本化运行时配置文件在加速器平台上实现。
3. MonoRepo
Infer-forge 通过 Git 子模块将相关仓库置于同一根目录,保留各自历史的同时提供跨仓库工程的稳定入口。
4. Task Loop
任务循环从任务定义进入主循环,通过“任务目标是否达成”判断是否退出,同时保留任务记忆。
5. 实施现状
Infer-forge 已在内部持续使用,四个月内并发任务峰值从 2 升至 9,一个项目中协调了 38 个可验证任务节点。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接