Skip to content

Generate → Verify → Repair 的通过率、误判率、延迟和成本怎样调优?

题型:调优 · 用人工标定衡量 Judge,而不是只追求自动通过率。

建议回答

我会先建立分层评估:确定性规则统计硬约束错误,Verifier 统计语义问题,人工抽样集用来估算误放、误杀和严重度加权一致率。调优先提升首轮生成质量与 rubric 清晰度,再减少不必要校验:低风险节点只做规则校验,中风险节点用轻量 Verifier,高风险的全剧设定或关键分镜使用更强模型、双重校验或人工抽检。

Repair 采用定向问题清单和最小上下文,避免每轮重复发送全部历史;相同输入、候选摘要、rubric 和版本可复用校验结果。对多个独立字段可以批量校验,但要防止过长候选降低 Judge 注意力。上线新 Prompt 或模型时先离线回放,再灰度比较质量提升、额外时延和每个最终 accepted 结果的总成本。

关键指标

  • 首轮通过率、Repair 后净提升、平均轮数和人工介入率。
  • 相对人工标注的误放率、误杀率、严重问题召回率和 Judge 一致率。
  • Verify/Repair P50/P95、Token、模型调用次数和每个 accepted 结果成本。
  • 问题振荡率、回归问题数、缓存命中率和超预算终止率。

关键权衡

  • 更强 Judge 可能降低误判,但成本和延迟是否值得要看错误下游损失。
  • 提高通过率不一定是好事,可能只是 rubric 变宽导致更多错误被放行。
  • 双模型一致投票提高置信度,却可能共享训练偏差,仍需人工标定。

易错点

  • 不要只看自动通过率,必须同时观察误放和误杀。
  • 不要用 Judge 自己生成的标签评估 Judge 自己,会形成循环论证。

知识关系

从当前问题继续深入,或者回到提出这个问题的知识入口。