Skip to content

请用 30 秒介绍文档知识化流水线

题型:30 秒基础题 · 讲清阶段、存储分工和任务状态。

30 秒回答

文档上传后先做格式识别、解析和清洗,保留标题、页码、表格等结构信息;再按语义和文档结构切分成 chunk,批量生成 Embedding。PostgreSQL 管理知识库、文档、chunk 元数据和全文索引,Milvus 保存向量及检索所需的过滤字段。整个过程按任务状态执行,记录文档版本、模型版本和失败阶段,支持重试、增量更新和索引重建。

面试官关注点

  • 在线检索依赖的是可追踪、可版本化的知识数据。
  • 元数据与向量之间需要稳定 ID 关联。
  • 文档解析、Embedding 和写库都可能失败,不能只设计成功路径。

易错点

  • 不能只说解析、切分、入向量库,遗漏元数据、权限和版本。
  • 不要把文件上传成功等同于知识已经可检索。

知识关系

从当前问题继续深入,或者回到提出这个问题的知识入口。