主题
企业 AI 中台规模扩大后,你会怎样优化架构?
题型:调优 · 先用指标定位瓶颈,再决定拆分、缓存或异步化。
建议回答
我会先按端到端链路拆出首 Token 延迟、模型耗时、检索耗时、工具耗时、排队时间、Token 成本和错误率,避免只凭感觉拆服务。在线链路优先做并行检索、连接复用、流式透传、超时预算和背压;离线 Ingestion 做任务队列、批处理、限速与可恢复执行。模型、向量库和外部工具通过隔离舱、熔断与并发配额避免相互拖垮。
当团队规模或部署形态确实需要时,再把变化频率高、资源模型不同的模块独立部署,例如 Ingestion、模型网关和 MCP Gateway;核心编排可继续保持清晰的模块化单体,减少分布式复杂度。
衡量指标
- P50、P95、P99 首 Token 与总响应时间。
- Agent 平均步数、工具成功率、循环终止率。
- RAG Recall@K、引用正确率与无答案率。
- 单次请求 Token、模型成本与 GPU 利用率。
易错点
- 不能把增加机器当作唯一调优方案。
- 缓存必须考虑租户、权限、模型版本和知识库版本。