Agent 推送的 Confidence Score 包含哪些维度

Agent 的 Confidence Score 不应被理解为“这份资料与当前内容有多像”,而应回答两个问题:知识是否真正适用,以及此刻是否值得打扰用户。主动推送的判断对象不是单纯的检索结果,而是“候选知识—当前任务—用户状态”三者之间的匹配关系。

1787310776-aiimg6a8832b8bfa816.74537529.webp

Confidence Score 的核心维度

语义相关性判断候选知识与当前文档、会议议题或业务动作是否涉及同一主题。这是基础信号,但不能单独决定推送,因为“主题相同”不代表“当前有用”。

任务匹配度关注知识能否帮助用户完成当前阶段的任务。例如,用户处于方案决策、规范确认或问题排查阶段时,适用的资料不同。只有与当前任务目标相匹配,相关性才具有实际价值。

时效性与权威性用于评估内容是否仍在维护、是否存在过期风险,以及来源是否足够可信。知识库中的历史方案、旧规范或多个版本,不能因为文本相似就获得高置信度。

用户适配度需要结合用户角色、所属团队、权限和内容适用范围判断。同一份资料对不同用户可能价值不同;权限信息也不应只在生成回答后补充校验,而应贯穿候选生成与最终展示。

意图明确度衡量用户是否表现出真实的知识需求,例如反复修改内容、进入待决策节点、提出待确认事项,或在相关信息上持续停留。单次打开页面、标题变化或普通输入,不足以证明用户需要帮助。

打扰风险则是主动 Agent 与传统 RAG 的关键区别。近期推送频率、用户是否忽略过同类内容、当前是否处于连续编辑或不适合打断的状态,都应降低立即推送的可能性。

因此,相关性和打扰风险最好分别计算,再由策略层决定行动:高相关且意图明确时主动展示;相关但意图不明时延迟或放入摘要;来源冲突、权限不明或重复推荐时保持沉默。高分不必然等于立即弹窗,真正成熟的 Confidence Score,应同时体现“内容值得看”和“现在适合看”。

参与讨论

0 条评论

延伸阅读