主题
“剧本到视频”长链路的延迟、吞吐和成本怎样调优?
题型:调优 · 先量化关键路径和重跑放大,再决定优化顺序。
建议回答
我会先按 Workflow、节点类型和模型拆出排队时间、执行时间、提交时间与重试时间,找到端到端关键路径,同时统计每个成功 Job 实际触发的 LLM、图片和视频调用次数。第一优先级是消除无效工作,例如复用已验证的设定与中间产物、用输入版本和内容摘要命中结果、只失效真正受影响的下游节点,并避免超时层层叠加导致同一次请求被多处重试。
第二步才是并行和资源调度:无依赖的分集或 Shot 可以并行,但要受模型配额、项目预算、下游承载和公平性限制;轻量解析、校验和高质量生成可选择不同模型档位;长视频等昂贵节点应设置更严格的准入、超时和人工干预策略。对 Prompt 和 Context 做阶段化裁剪,也能同时降低延迟、Token 成本和语义噪声。
关键指标
- 端到端 P50/P95、各节点排队与执行 P95、关键路径占比。
- Job 吞吐、活跃 Worker 或模型并发、限流等待和队列积压年龄。
- 每个成功 Episode/Shot 的模型调用次数、Token、图片或视频生成次数与成本。
- 首次通过率、重试率、重跑放大系数和产物复用命中率。
关键权衡
- 提高并发会缩短墙钟时间,但可能触发供应商限流、推高成本并放大失败风暴。
- 更激进的缓存和复用能省成本,但必须把 Prompt、模型、输入和设定版本纳入键中。
- 小模型适合低风险节点,不应只看单次价格,还要计算返工后的每个成功任务成本。
易错点
- 不要把“增加机器”作为第一答案,外部模型配额和无效重跑往往才是瓶颈。
- 不要只看平均耗时,长尾、排队和失败重试更容易决定用户体验。