主题
为什么使用独立 LLM 校验,Verifier 的输入、规则和输出怎样设计?
题型:追问 · 重点说明独立性、评分标准和标定方式。
建议回答
生成模型自检容易沿用同一错误假设,独立 Verifier 通过隔离 Prompt、上下文和职责,要求模型只判断候选是否满足明确规则,并为每个问题给出证据、严重级别、置信度和可修复建议。输入应包含原始剧本证据、已发布设定、候选输出、Schema 与分项 rubric,但不应把生成模型的自我解释当成事实。输出使用结构化 issue 列表,而不是只有一个总分。
独立不一定要求永远使用不同供应商,但高风险节点可以采用不同模型或不同提示视角降低相关性偏差。能用代码判断的 ID 引用、枚举、长度和状态转换先做确定性校验,LLM 主要评估忠实性、完整性、连贯性和视觉可执行性。Verifier 上线前要用人工标注样本校准误放与误杀,线上持续抽检,并记录 rubric、模型和 Prompt 版本。
进一步追问
- Verifier 和生成模型意见冲突时,谁拥有最终决定权?
- 没有标准答案的分镜质量怎样建立可重复评估集?
易错点
- 不要把 Judge 分数直接当业务真值,必须关注与人工判断的一致性。
- 不要要求或存储模型的隐藏推理过程,结构化证据和结论已经足够审计。