主题
混合 RAG 的召回、排序和生成效果怎样调优?
题型:调优 · 必须把检索质量与生成质量分开评估。
建议回答
先建立带标准相关文档和答案的业务评估集,按知识库、文档类型、短查询、长查询、编号查询和多轮省略等场景分层。召回阶段看 Recall@K、MRR、NDCG 和权限过滤正确率;生成阶段看忠实性、答案相关性、引用正确率、无答案识别率,同时观察 P95 延迟和单请求成本。
调优顺序通常是数据质量、切分与元数据,再到查询改写、向量和关键词各自 TopK、RRF 参数、Reranker 和上下文压缩。每次只改变一组变量,通过离线回放和小流量 A/B 比较,避免只凭几个示例判断。
常见策略
- 专有名词和编号差:加强关键词召回、词典和分词配置。
- 语义问题召回差:调整 Embedding、切分和查询改写。
- 召回正确但答案差:检查上下文顺序、Prompt、引用约束与模型能力。
- 延迟高:并行召回、减少初召回数量、按场景决定是否启用重排。
易错点
- RAGAS 或 LLM-as-Judge 不能完全代替人工标注和抽检。
- 只看 Top1 会掩盖排序和生成阶段的问题。