主题
请用 30 秒介绍文档知识化流水线
题型:30 秒基础题 · 讲清阶段、存储分工和任务状态。
30 秒回答
文档上传后先做格式识别、解析和清洗,保留标题、页码、表格等结构信息;再按语义和文档结构切分成 chunk,批量生成 Embedding。PostgreSQL 管理知识库、文档、chunk 元数据和全文索引,Milvus 保存向量及检索所需的过滤字段。整个过程按任务状态执行,记录文档版本、模型版本和失败阶段,支持重试、增量更新和索引重建。
面试官关注点
- 在线检索依赖的是可追踪、可版本化的知识数据。
- 元数据与向量之间需要稳定 ID 关联。
- 文档解析、Embedding 和写库都可能失败,不能只设计成功路径。
易错点
- 不能只说解析、切分、入向量库,遗漏元数据、权限和版本。
- 不要把文件上传成功等同于知识已经可检索。