PROCUREMENT GUIDE · RAG采购
企业级RAG采购与验收指南
企业级RAG不能只按“能否上传文件并回答问题”采购。采购范围应同时覆盖知识来源与版本、解析质量、混合检索、证据引用、权限隔离、拒答、真实问题集评测、业务系统接入和持续更新;验收必须分开评价检索、答案、引用、安全、效率和业务效果。
采购的不是向量库,而是一条可验证知识链
企业级RAG由知识治理、解析与索引、检索和重排、生成与引用、权限、评测、应用接入和持续运营共同组成。单独采购向量数据库或把文件上传到聊天界面,不等于获得了完整RAG系统。
长上下文模型可以改变部分技术选择,但不替代来源授权、版本判断、权限过滤、证据定位、成本控制和持续更新。
采购前应准备的资料
- 具有代表性的政策、制度、标准、技术资料、表格、扫描件和业务记录样本。
- 真实用户过去提出的问题、权威答案、依据位置和允许拒答的问题。
- 同一制度的多版本、跨文件问题、低频实体、强过滤和证据缺失样本。
- 用户角色、组织、项目、密级、导出和模型使用权限矩阵。
- 部署环境、身份系统、业务接口、并发、响应、成本和运维条件。
需求书必须写清的十类边界
来源与版权
知识从哪里取得,是否允许解析、索引、模型使用、展示和导出。
版本与状态
发布、生效、替代、撤回、地域、组织和产品版本如何判断。
解析质量
扫描件、表格、图片、附录和复杂版式如何保真并抽样验收。
检索链路
精确、全文、语义、字段、结构化查询和重排如何组合。
答案与引用
输出契约、证据定位、拒答、不确定性和主张—证据一致性。
权限安全
从检索到模型输入、展示、导出和日志的全链路强制过滤。
业务接入
身份、会话、业务上下文、反馈、API和必要系统接口。
评测与发布
问题集、指标、红线、版本、灰度、回归、回滚和上线门槛。
运营责任
来源巡检、审核、问题修复、模型和索引更新由谁持续负责。
交接退出
数据、知识Schema、评测集、配置、日志和接口如何完整交接。
为什么供应商Demo不能代替验收
Demo可能使用少量精选语料、预设问题或人工调优,不能证明系统在客户真实文档、长尾问题、版本冲突、权限、安全和持续更新条件下可用。
验收应基于冻结版本的客户问题集,由双方明确答案依据、计算口径、抽样和失败分类,并保留可复测证据。
六类验收维度
检索
所需证据是否召回、过滤正确、排序合理,并覆盖低频实体和版本冲突。
答案
结论是否正确、完整、相关,并明确假设、缺失信息、不确定性与拒答。
引用
引用是否真实支持主张,能否定位原文、版本、页码或具体条款。
安全
跨权限、未发布、敏感数据、提示注入、模型使用和导出限制是否受控。
效率
在双方确认的响应、并发、成本、可用性和降级边界内完成任务。
业务
是否改善检索、比对、复核或材料准备的完成时间、成功率和质量。
测试集怎样建设
- 从真实用户和历史任务采集问题,覆盖简单检索、跨文件综合、版本和适用范围。
- 加入低频实体、强过滤、表格计算、证据冲突、缺失信息、应当拒答和安全攻击题。
- 把问题、标准答案、证据、允许变体、评分方法、风险等级和失败原因版本化。
- 训练调优集与最终验收集分离,防止对测试答案过度拟合。
指标如何进入合同与验收
不应脱离客户语料、问题风险和计算口径统一承诺固定准确率。合同可规定指标定义、测试集版本、抽样方法、硬门槛、失败归因、复测次数、回归门槛和双方确认流程。
跨权限泄漏、未发布内容泄漏、虚构引用和高风险无依据正式结论可设置为零容忍红线;一般题的指标则按真实业务风险分层确定。
交付物清单
- 语料与来源登记、知识Schema、版本和权限规则、解析质量报告。
- 检索服务、答案与证据契约、应用界面或API、身份及业务系统接口。
- 评测集、评测脚本或方法、验收报告、安全测试和失败案例台账。
- 部署配置、运行监控、更新发布、备份回滚、运营手册和数据退出方案。
GCPI可以提供什么
绿色碳汇规划院提供场景诊断、知识与数据治理、企业级RAG架构、混合检索与引用链路、权限和答案契约、真实问题集评测、现有系统接入及持续运营。RAG可以独立交付,也可以作为Copilot、Agent、AI中台或AI OS的知识底座。
具体功能、指标、资料规模、周期、成本和服务等级,应根据客户语料、系统、风险和验收范围共同确认。
FAQ
常见问题
先把关键边界说清楚,才能让AI建设进入真实业务。
采购向量数据库是否等于采购RAG系统?
不等于。向量数据库只是可能使用的检索组件之一,完整RAG还包括知识治理、版本权限、混合检索、生成引用、评测、应用接入和持续运营。
模型上下文很长,是否仍需要RAG?
是否使用RAG应由真实任务评测决定。长上下文不替代来源治理、权限过滤、版本判断、引用定位、成本控制和持续更新。
供应商Demo能否直接作为验收依据?
不能单独作为依据。应在冻结的客户真实语料和问题集上,按双方确认的指标、抽样和红线完成独立验收。
RAG准确率应该统一设为多少?
没有适用于所有项目的统一数字。应分开定义检索、答案、引用、安全和业务指标,并结合风险等级、测试集和计算口径确定。
如何处理同一制度的多个版本?
为资料建立发布、生效、替代、撤回、适用地域和组织等元数据,在检索前强过滤,并把版本冲突题加入回归测试。
如何验证引用确实支持答案?
把答案拆成关键主张,逐项检查所引原文是否真实存在、语义支持、版本适用并能定位;仅有链接不等于引用一致。
RAG上线后为什么仍需持续运营?
知识、用户问题、模型和索引都会变化,需要来源巡检、问题修复、版本更新、灰度发布、回归评测和回滚。
REFERENCES · 参考来源
定义与治理依据
参考来源用于解释公开技术概念和治理原则;GCPI的具体产品边界、交付范围与项目事实仍以本网站明确口径及客户项目文件为准。
- Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksLewis 等,NeurIPS 2020 · 2020 ↗
RAG原始研究论文,用于说明参数化模型与外部非参数知识结合的基本思想。
- Artificial Intelligence Risk Management Framework (AI RMF 1.0)NIST · 2023 ↗
AI系统全生命周期可信与风险管理的公开框架。
- 国家法律法规数据库全国人民代表大会常务委员会 · 持续更新 ↗
项目涉及网络、数据和个人信息时,应按具体适用范围核验现行法律;本页不替代专项法律意见。
