MLCommons MLPerf Inference 工作组推出首个端到端检索增强生成(RAG)推理基准。通过在查询时从检索文档而非仅模型权重中生成答案,RAG 显著降低幻觉,同时利用最新私有知识,已成为语言模型最常见的部署方式之一。
RAG 生产系统通常由多个模型组成,形成检索文档并推理生成答案的完整管道。该基准完整测量这一流程,包含两个工作负载。
端到端 RAG 的意义
RAG 因能从查询时检索的文档中获取答案而日益流行。它减少幻觉、保持答案时效性,并让通用模型利用训练时未见过的专有知识。
由于 RAG 是多组件系统,其性能源于各组件的协同而非单一模型。单模型 LLM 基准无法捕捉管道级行为,也无法暴露多模型联合优化的机会。
该基准还为智能体 AI 基准铺路,其多模型服务挑战正是未来基准的起点。
优化空间包括:
- 模型放置:将不同规模模型映射到不同加速器
- 共驻:通过内存分区共享设备
- 多阶段调度:跨异构加速器实现宏微批处理
- 前缀缓存:复用多跳共享前缀以降低计算
数据集与任务
基准基于 FRAMES 多跳查询数据集,包含 824 个查询、2515 篇维基百科文章和约 107000 个 768 字符段落。
示例多跳查询需要跨三篇文章链式推理才能得出答案。

图 1:多跳 E2E RAG 示例
摄取与问答管道
基准包含两个独立管道:摄取管道(e2e-rag-db)一次性构建向量数据库,问答管道(e2e-rag-qna)执行端到端评分。

图 2:E2E RAG 摄取与问答管道
摄取流程包括解析、切分、嵌入与 FAISS HNSW 索引。问答流程则通过查询重写器、嵌入器、检索器、重排序器、文档评分器与充分性检查器迭代完成多跳推理。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接