PROCUREMENT GUIDE · RAG采购

企业级RAG采购与验收指南

企业级RAG不能只按“能否上传文件并回答问题”采购。采购范围应同时覆盖知识来源与版本、解析质量、混合检索、证据引用、权限隔离、拒答、真实问题集评测、业务系统接入和持续更新;验收必须分开评价检索、答案、引用、安全、效率和业务效果。

采购责任边界六类验收维度真实问题集持续评测与回滚
发布主体:绿色碳汇规划院(北京)有限公司专业复核依据:《GCPI行业AI操作平台产品与技术总体方案》V1.1发布:2026-09-04修订:2026-09-04

采购的不是向量库,而是一条可验证知识链

企业级RAG由知识治理、解析与索引、检索和重排、生成与引用、权限、评测、应用接入和持续运营共同组成。单独采购向量数据库或把文件上传到聊天界面,不等于获得了完整RAG系统。

长上下文模型可以改变部分技术选择,但不替代来源授权、版本判断、权限过滤、证据定位、成本控制和持续更新。

采购前应准备的资料

  • 具有代表性的政策、制度、标准、技术资料、表格、扫描件和业务记录样本。
  • 真实用户过去提出的问题、权威答案、依据位置和允许拒答的问题。
  • 同一制度的多版本、跨文件问题、低频实体、强过滤和证据缺失样本。
  • 用户角色、组织、项目、密级、导出和模型使用权限矩阵。
  • 部署环境、身份系统、业务接口、并发、响应、成本和运维条件。

需求书必须写清的十类边界

来源与版权

知识从哪里取得,是否允许解析、索引、模型使用、展示和导出。

版本与状态

发布、生效、替代、撤回、地域、组织和产品版本如何判断。

解析质量

扫描件、表格、图片、附录和复杂版式如何保真并抽样验收。

检索链路

精确、全文、语义、字段、结构化查询和重排如何组合。

答案与引用

输出契约、证据定位、拒答、不确定性和主张—证据一致性。

权限安全

从检索到模型输入、展示、导出和日志的全链路强制过滤。

业务接入

身份、会话、业务上下文、反馈、API和必要系统接口。

评测与发布

问题集、指标、红线、版本、灰度、回归、回滚和上线门槛。

运营责任

来源巡检、审核、问题修复、模型和索引更新由谁持续负责。

交接退出

数据、知识Schema、评测集、配置、日志和接口如何完整交接。

为什么供应商Demo不能代替验收

Demo可能使用少量精选语料、预设问题或人工调优,不能证明系统在客户真实文档、长尾问题、版本冲突、权限、安全和持续更新条件下可用。

验收应基于冻结版本的客户问题集,由双方明确答案依据、计算口径、抽样和失败分类,并保留可复测证据。

六类验收维度

检索

所需证据是否召回、过滤正确、排序合理,并覆盖低频实体和版本冲突。

答案

结论是否正确、完整、相关,并明确假设、缺失信息、不确定性与拒答。

引用

引用是否真实支持主张,能否定位原文、版本、页码或具体条款。

安全

跨权限、未发布、敏感数据、提示注入、模型使用和导出限制是否受控。

效率

在双方确认的响应、并发、成本、可用性和降级边界内完成任务。

业务

是否改善检索、比对、复核或材料准备的完成时间、成功率和质量。

测试集怎样建设

  • 从真实用户和历史任务采集问题,覆盖简单检索、跨文件综合、版本和适用范围。
  • 加入低频实体、强过滤、表格计算、证据冲突、缺失信息、应当拒答和安全攻击题。
  • 把问题、标准答案、证据、允许变体、评分方法、风险等级和失败原因版本化。
  • 训练调优集与最终验收集分离,防止对测试答案过度拟合。

指标如何进入合同与验收

不应脱离客户语料、问题风险和计算口径统一承诺固定准确率。合同可规定指标定义、测试集版本、抽样方法、硬门槛、失败归因、复测次数、回归门槛和双方确认流程。

跨权限泄漏、未发布内容泄漏、虚构引用和高风险无依据正式结论可设置为零容忍红线;一般题的指标则按真实业务风险分层确定。

交付物清单

  • 语料与来源登记、知识Schema、版本和权限规则、解析质量报告。
  • 检索服务、答案与证据契约、应用界面或API、身份及业务系统接口。
  • 评测集、评测脚本或方法、验收报告、安全测试和失败案例台账。
  • 部署配置、运行监控、更新发布、备份回滚、运营手册和数据退出方案。

GCPI可以提供什么

绿色碳汇规划院提供场景诊断、知识与数据治理、企业级RAG架构、混合检索与引用链路、权限和答案契约、真实问题集评测、现有系统接入及持续运营。RAG可以独立交付,也可以作为Copilot、Agent、AI中台或AI OS的知识底座。

具体功能、指标、资料规模、周期、成本和服务等级,应根据客户语料、系统、风险和验收范围共同确认。

FAQ

常见问题

先把关键边界说清楚,才能让AI建设进入真实业务。

采购向量数据库是否等于采购RAG系统?

不等于。向量数据库只是可能使用的检索组件之一,完整RAG还包括知识治理、版本权限、混合检索、生成引用、评测、应用接入和持续运营。

模型上下文很长,是否仍需要RAG?

是否使用RAG应由真实任务评测决定。长上下文不替代来源治理、权限过滤、版本判断、引用定位、成本控制和持续更新。

供应商Demo能否直接作为验收依据?

不能单独作为依据。应在冻结的客户真实语料和问题集上,按双方确认的指标、抽样和红线完成独立验收。

RAG准确率应该统一设为多少?

没有适用于所有项目的统一数字。应分开定义检索、答案、引用、安全和业务指标,并结合风险等级、测试集和计算口径确定。

如何处理同一制度的多个版本?

为资料建立发布、生效、替代、撤回、适用地域和组织等元数据,在检索前强过滤,并把版本冲突题加入回归测试。

如何验证引用确实支持答案?

把答案拆成关键主张,逐项检查所引原文是否真实存在、语义支持、版本适用并能定位;仅有链接不等于引用一致。

RAG上线后为什么仍需持续运营?

知识、用户问题、模型和索引都会变化,需要来源巡检、问题修复、版本更新、灰度发布、回归评测和回滚。

REFERENCES · 参考来源

定义与治理依据

参考来源用于解释公开技术概念和治理原则;GCPI的具体产品边界、交付范围与项目事实仍以本网站明确口径及客户项目文件为准。

  1. Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksLewis 等,NeurIPS 2020 · 2020

    RAG原始研究论文,用于说明参数化模型与外部非参数知识结合的基本思想。

  2. Artificial Intelligence Risk Management Framework (AI RMF 1.0)NIST · 2023

    AI系统全生命周期可信与风险管理的公开框架。

  3. 国家法律法规数据库全国人民代表大会常务委员会 · 持续更新

    项目涉及网络、数据和个人信息时,应按具体适用范围核验现行法律;本页不替代专项法律意见。

START WITH A REAL PROBLEM

从一个可验证的业务场景开始

明确问题、资料、用户与验收指标,再决定知识、模型、智能体和系统怎么建设。