什么是RAG检索增强生成?

RAG,即“检索增强生成”(Retrieval-Augmented Generation),是一种让生成模型先查找外部知识,再依据检索结果生成回答的技术范式。它的核心不是重新训练模型,而是在回答问题时,把企业文档、FAQ、工单等资料中的相关片段作为上下文提供给模型,使回答尽量建立在可追溯的证据之上。

一个典型的 RAG 流程包括知识入库、检索和生成三个环节。系统首先对文档进行清洗、分类和切分,再将文本转换为向量并建立索引;用户提问后,系统根据语义相似度或关键词匹配召回候选内容,必要时通过重排筛选出更相关的片段;最后,生成模型结合这些片段组织自然语言答案。

RAG的关键不只是“接入向量库”

RAG 效果不佳,往往不是模型本身的问题,而是检索阶段没有找到正确证据。数据源质量决定知识上限:图片、PDF 等内容如果没有经过 OCR 或结构化处理,可能难以形成有效文本。文档切分也需要遵循语义边界。片段过短,容易丢失上下文;片段过长,则会引入无关信息。实际系统通常需要通过 A/B 测试选择更适合业务的切分方式。

向量表示同样影响召回结果。嵌入模型需要适配使用语言、企业术语和成本要求。对于专业词汇密集的场景,可以考虑术语优化或文本扩展。检索策略则不应局限于单一方式:关键词过滤与向量检索结合,能够同时利用精确匹配和语义相似性;在候选结果产生后,再进行重排,通常更有利于提升相关性。

可靠性来自证据链

RAG 并不会自动消除模型幻觉。系统应把来源片段、文档 ID、段落位置和时间戳一并保留,并在生成要求中明确回答只能依据提供的证据。当检索结果不足或置信度较低时,比起强行生成,更合理的做法是返回不确定标记,或触发人工复核。

因此,RAG 的本质是“检索系统与生成模型的协作”,而不是简单地把文档丢进向量库。企业落地时,应先选择客服或销售知识库等明确场景,持续收集错误样本,再围绕数据质量、嵌入表示、检索与重排逐步迭代。只有证据找得准,模型才有可能答得稳。

参与讨论

0 条评论

延伸阅读