RAG 的答案质量,往往不是由生成模型单独决定的,而是由“问题是否被正确理解、知识是否被有效找出、上下文是否能被准确使用”共同决定。检索结果一旦偏离问题,后续模型即使表达流畅,也只能在错误材料上生成看似合理的答案。
首先是知识库本身。文档存在过期、重复、表述矛盾或内容缺失时,检索系统很难得到可靠依据。企业资料还常包含权限边界:能否被检索、能否进入模型上下文,不能只靠生成阶段补救。因此,知识更新、版本管理、文档清洗和访问控制,都是检索质量的一部分。
其次是文档切分。切得过大,多个主题混在同一片段里,相关性会被稀释;切得过小,定义、条件和例外条款可能被拆散,召回的片段缺少完整语义。合理切分的标准不是固定字数,而是尽量保持一个知识单元的完整性,例如让规则、适用范围和限制条件能够共同出现。
再次是召回与排序。单一召回方式可能遗漏同义表达、专业术语或隐含关系,因此需要根据问题特点组合检索策略。初步召回后,还要通过相关性重排序,把真正回答问题所需的片段置于前面。召回数量并非越多越好,混入大量边缘内容会增加噪声,反而干扰模型判断。
查询改写同样重要。用户的问题可能过于简短、口语化,甚至缺少关键条件。系统若不能识别实体、时间范围、限定条件和真实意图,检索对象就会从一开始发生偏移。对于复杂问题,还应先拆分子问题,再分别检索,避免用一个模糊查询覆盖多个知识点。
最后是上下文压缩与生成约束。检索到的内容需要保留结论、依据和例外,而不是简单截断。模型还应被要求优先依据检索材料作答;当资料不足或相互冲突时,明确说明不确定性,而不是自行补全。评估时不能只看最终答案,应分别检查召回是否命中、排序是否合理、证据是否充分,并用业务难题和边界案例持续回归测试。只有把问题分析、数据治理、检索链路和生成环节拆开评估,RAG 才能从“接入知识库”变成可控的知识问答系统。
参与讨论
暂无评论,快来发表你的观点吧!