主题
长剧生成中的上下文一致性、延迟和 Token 成本怎样调优?
题型:调优 · 先评估约束是否被覆盖,再减少无效上下文。
建议回答
我会把质量问题拆成 Context 选择错误、Context 内部冲突、模型未遵守和下游改写四类,分别统计,而不是只看最终视频主观效果。优化顺序是先建立结构化全剧事实与阶段必需字段,再按 Episode 和 Shot 的实体引用选择相关 Context;对长文本使用带 provenance 的摘要,对静态规则与稳定设定使用可缓存前缀,对动态状态保留最新已发布 revision。
当上下文接近窗口上限时,不应简单截断尾部,而要按“硬约束、当前剧情、相关历史、补充风格”分级预算。低风险阶段可使用摘要或较小模型,高影响的全局设定和一致性校验保留更完整证据。调优后通过固定样本和跨集组合样本比较质量、延迟与成本,避免某一集效果提升但长期一致性下降。
关键指标
- 人物属性、场景规则、时间线和道具状态的约束覆盖率与冲突率。
- 跨集一致性通过率、人工返工类型和模型忽略硬约束比例。
- 每节点输入 Token、Context 利用率、截断率、摘要命中率与缓存命中率。
- 端到端 P95、每个有效 Shot 成本和因 Context 错误触发的重跑放大。
关键权衡
- 更多上下文可能提高召回,却也增加注意力稀释、延迟和成本。
- 摘要能压缩 Token,但会丢细节,必须保留来源并允许回查原文。
- 更严格一致性会限制创作空间,应区分不可违反事实和可变化的风格偏好。
易错点
- 不要用上下文长度衡量 Context 质量,相关性和冲突消解更重要。
- 不要编造“Token 减少百分比”,未提供数据时说明应观测哪些指标。