跳到主要内容
企业官网模板预览 客户、案例、覆盖与指标均为演示信息
淘金出海

GEOFlow 混合召回如何提升相关性?关键词、章节与向量检索协同

在 GEOFlow 的知识库链路中, GEOFlow 混合召回 通过同时运行关键词匹配、标题章节路径匹配和语义向量检索三条路径,互补各自检索盲区,直接提升知识库证据的命中率和相关性。它重点在于把精确词命中、结构定位和语义理解结合在一起,让召回结果既有精确术语,也能覆盖相近语义,避免漏掉关键资料。

在 GEOFlow 的知识库链路中,GEOFlow 混合召回通过同时运行关键词匹配、标题章节路径匹配和语义向量检索三条路径,互补各自检索盲区,直接提升知识库证据的命中率和相关性。它重点在于把精确词命中、结构定位和语义理解结合在一起,让召回结果既有精确术语,也能覆盖相近语义,避免漏掉关键资料。

一、混合召回解决什么问题

纯向量召回依赖 embedding 模型计算语义相似度,容易漏掉文档中出现的精确术语;纯关键词召回虽然能匹配到精确词汇,却无法处理同义表达或上下文语义接近的内容。标题章节路径匹配则能利用文档的结构信息,把召回范围限定在正确章节,避免跨主题噪声。GEOFlow 混合召回将这三种检索信号同时纳入评分,取长补短。

二、三路检索如何协同提升相关性

  • 关键词匹配:包含中文 n-gram,对业务术语、产品名、配置项等精确词命中率高,确保不遗漏直接出现在文档中的关键信息。
  • 标题章节路径匹配:根据切片所在标题和章节层级打分,当查询标题与知识条目章节路径相近时,能优先召回同一章节下的证据,提升结构相关性。 三路协同让召回不再依赖单一信号:关键词保证精确术语命中,向量拓展语义覆盖,标题章节约束有效范围。

三、混合打分的权重与性能控制

当前混合召回分数以向量相似度和关键词匹配为主权重,同时给标题章节路径和元数据质量一定加权,避免任何一路信号被忽略。对于大知识库,系统不会全量逐条打分,而是先用 pgvector 取向量相似候选;若 pgvector 不可用,则回退到用标题、章节和正文关键词预筛,再进入混合打分,控制召回成本。

四、元数据治理对相关性再增强

召回算法还提取知识库元数据的治理信息:业务线、资料时间、风险等级和审核状态等。高风险且未审核的资料会被直接排除,已审核和低风险资料获得更高权重;当同主题出现新旧版本冲突时,优先选择已审核、更新、更低风险的证据。这层治理让注入生成上下文的证据不仅“相关”,而且可信,从而间接提升最终内容的相关性与可靠性。

五、常见问题

生成时没有明显引用证据怎么办? 检查是否在任务中选择了知识库、查询标题与知识库主题是否匹配,以及默认 embedding 模型是否已正确配置并可用。如果资料本身缺少可引用事实,也会导致引用缺失。 向量数量很少或为 0? 确认“AI 模型”中已设置默认 embedding 模型,且模型 Provider URL 和 API Key 有效。

GEOFlow 混合召回 GEOFlow 知识库 RAG Embedding 向量检索 文档切片 知识召回