Skip to content

混合 RAG 的召回、排序和生成效果怎样调优?

题型:调优 · 必须把检索质量与生成质量分开评估。

建议回答

先建立带标准相关文档和答案的业务评估集,按知识库、文档类型、短查询、长查询、编号查询和多轮省略等场景分层。召回阶段看 Recall@K、MRR、NDCG 和权限过滤正确率;生成阶段看忠实性、答案相关性、引用正确率、无答案识别率,同时观察 P95 延迟和单请求成本。

调优顺序通常是数据质量、切分与元数据,再到查询改写、向量和关键词各自 TopK、RRF 参数、Reranker 和上下文压缩。每次只改变一组变量,通过离线回放和小流量 A/B 比较,避免只凭几个示例判断。

常见策略

  • 专有名词和编号差:加强关键词召回、词典和分词配置。
  • 语义问题召回差:调整 Embedding、切分和查询改写。
  • 召回正确但答案差:检查上下文顺序、Prompt、引用约束与模型能力。
  • 延迟高:并行召回、减少初召回数量、按场景决定是否启用重排。

易错点

  • RAGAS 或 LLM-as-Judge 不能完全代替人工标注和抽检。
  • 只看 Top1 会掩盖排序和生成阶段的问题。

知识关系

从当前问题继续深入,或者回到提出这个问题的知识入口。