Skip to content

企业 AI 中台规模扩大后,你会怎样优化架构?

题型:调优 · 先用指标定位瓶颈,再决定拆分、缓存或异步化。

建议回答

我会先按端到端链路拆出首 Token 延迟、模型耗时、检索耗时、工具耗时、排队时间、Token 成本和错误率,避免只凭感觉拆服务。在线链路优先做并行检索、连接复用、流式透传、超时预算和背压;离线 Ingestion 做任务队列、批处理、限速与可恢复执行。模型、向量库和外部工具通过隔离舱、熔断与并发配额避免相互拖垮。

当团队规模或部署形态确实需要时,再把变化频率高、资源模型不同的模块独立部署,例如 Ingestion、模型网关和 MCP Gateway;核心编排可继续保持清晰的模块化单体,减少分布式复杂度。

衡量指标

  • P50、P95、P99 首 Token 与总响应时间。
  • Agent 平均步数、工具成功率、循环终止率。
  • RAG Recall@K、引用正确率与无答案率。
  • 单次请求 Token、模型成本与 GPU 利用率。

易错点

  • 不能把增加机器当作唯一调优方案。
  • 缓存必须考虑租户、权限、模型版本和知识库版本。

知识关系

从当前问题继续深入,或者回到提出这个问题的知识入口。