主题
请用 30 秒介绍你的混合 RAG 检索链路
题型:30 秒基础题 · 按改写、召回、融合、回填、生成五步回答。
30 秒回答
用户问题先结合多轮上下文做查询改写,然后并行走两路召回:Milvus 负责语义向量检索,PostgreSQL tsvector 负责关键词全文检索。两路结果经过权限和元数据过滤后,用 RRF 按名次融合、去重并选出 TopK,再回填文档、段落和页码等引用信息交给模型生成。检索能力同时封装成 Tool,让 Agent 能根据任务上下文决定何时检索。
面试官关注点
- 向量检索补语义,关键词检索保专有名词、编号和精确匹配。
- 融合前要保证租户、知识库与文档权限一致。
- 引用来自检索元数据,不应让模型自行编造。
易错点
- PostgreSQL 内置 ts_rank 或 ts_rank_cd 不是严格意义上的标准 BM25;如果简历写 BM25,需要能说明是自定义计算、扩展实现,还是应更准确地表述为全文关键词召回。
- 混合检索并不保证一定优于单路,必须用评估集验证。