主题
Verifier 误判、反复打回或 Repair 越修越差时怎么排查?
题型:问题排查 · 用候选差异、校验证据和人工基准拆分责任。
排查顺序
- 按 runId 还原每轮 candidate、verification report、repair patch、Prompt、模型和成本,确认问题是 Judge 结论波动、同一问题反复出现,还是状态机重复处理旧报告。
- 把失败项与人工标注或确定性规则对比,区分生成错误、rubric 歧义、Verifier 误放/误杀、结构化输出解析错误和 Repair 引入回归。
- 检查 Verifier 是否缺少原剧本证据或使用了错误 Memory revision,是否受到候选措辞、位置、长度和自身输出顺序偏差影响。
- Repair 越修越差时比较字段级差异,确认修复 Prompt 是否允许重写过大范围、是否只复查旧问题而没有全量回归,以及多轮上下文是否累积矛盾指令。
- 区分可重试的临时模型错误、不可重试的 rubric 或数据契约错误、结果未知的外部产物,以及已经发布到下游的有副作用结果。
止损与永久修复
先触发轮数和预算熔断,保留最佳已知候选,停止错误结果继续生成关键帧或视频,并将高影响样本转人工。永久修复可以是重写可判定 rubric、补正反例、增加确定性前置校验、限制 Patch 范围、采用独立模型复核高风险结论,或修复状态机版本与幂等问题。
验证与复盘
用人工标注的正常、边界和对抗样本离线回放,比较误放、误杀、问题召回和 Repair 净提升;灰度后监控轮数分布、问题振荡、回归问题、人工推翻 Judge 比例和每个 accepted 结果成本。
易错点
- 不要对 Judge 不一致只做“再投票一次”,先确认 rubric 和输入证据是否可判定。
- 不要把最后一轮输出默认视为最好,应按完整校验和人工基准选择候选。