跳到主要内容
企业官网模板预览 客户、案例、覆盖与指标均为演示信息
淘金出海

GEOFlow RAG 如何工作?知识上传、切片、向量化与召回流程

GEOFlow RAG 是将资料转化为可检索、可引用知识的完整流程。它重点在于把上传的文档经过清洗、切片、向量化后,在生成任务时混合召回关键证据,并将证据编号注入提示词,让输出尽量贴近真实资料。 知识上传与最小配置要求 在 GEOFlow 中,知识库是 RAG 的事实基础。上传资料后,系统会清洗正文,统一编码与结构。

GEOFlow RAG 是将资料转化为可检索、可引用知识的完整流程。它重点在于把上传的文档经过清洗、切片、向量化后,在生成任务时混合召回关键证据,并将证据编号注入提示词,让输出尽量贴近真实资料。

知识上传与最小配置要求

在 GEOFlow 中,知识库是 RAG 的事实基础。上传资料后,系统会清洗正文,统一编码与结构。如果只想预览切片结果,可以不配置 embedding 模型;但如果要让文章生成环节真正使用 RAG 召回,必须满足以下条件:

  1. 在“AI 配置器”中至少准备一个可用的 chat 模型。
  2. 配置可用的 embedding 模型并设为默认。
  3. 确认 PostgreSQL 的 pgvector 扩展已启用。

切片策略:从原文到可检索片段

GEOFlow 提供三种切片策略,可以在后台 AI 模型页面中配置:

策略 说明
结构化规则切片 系统按标题、段落、长度和重叠窗口自动切割,稳定且成本低,是默认推荐方式。
自动策略 由系统根据配置选择合适的策略,适合希望简化配置的场景。
LLM 语义规划 Chat 模型只规划边界,系统仍从原文截取片段;规划失败时回退到规则切片。

向量化:将切片转为可计算向量

切片完成后,系统调用默认 embedding 模型,将每个切片的文本转换成高维向量,并写入 pgvector 存储。向量化是召回相似内容的前提,如果此步骤未完成,知识片段就无法参与语义搜索。上传资料后需确认向量化状态已就绪。

混合召回与证据注入

任务生成时,GEOFlow 不会只依赖一种搜索方式。它会同时使用关键词匹配、标题章节路径以及向量相似度检索,将多种方式命中的证据片段混合排序,形成候选集。随后,系统将证据片段注入提示词,并要求生成内容引用对应的证据编号,从而降低模型凭空发挥的概率。

质量边界与自检清单

GEOFlow RAG 能提升证据召回和引用质量,但最终事实准确性仍取决于资料质量、审核流程和人工判断。使用前建议按以下清单逐项确认:

  • chat 模型与 embedding 模型均已配置并可用。
  • embedding 模型已设为默认。
  • pgvector 扩展已启用,且向量化状态为已完成。
  • 知识库已完成一次重新保存或刷新。
  • 上传资料经过必要清洗,带有来源、时间等治理信息。
GEOFlow RAG GEOFlow 知识库 RAG Embedding 向量检索 文档切片 知识召回