工程实践
AI 供应商故障手册:告警、降级与复盘怎么串起来
当上游模型波动或供应商不可用时,团队应该怎样定义触发条件、切换路径、对外通知和事后复盘。
阅读全文当单一模型不再可靠时,如何设计一层可观测、可回退、可灰度发布的 AI 路由系统。
很多团队在接入 AI 时,最开始只是把模型名写死在代码里。这样做在验证阶段足够快,但一旦进入生产环境,问题就会逐渐暴露:
这时你真正需要的,已经不是“再换一个模型”,而是一层可控的路由系统。
生产环境里的 AI 路由,至少要回答四个问题:
一个最小可行方案通常包含:
不要一开始就做复杂的权重分发。先把“能稳定切换”做好,比“自动分配最优模型”更重要。
很多人把“回退”理解成再发一遍同样的请求。实际上这只是重试,不是回退。
真正的回退应该在以下维度里至少改变一个:
例如:
gpt-4oclaude-sonnetgpt-4o-mini这条链路的意义在于:你不是把所有失败都丢给用户,而是在预算可接受的前提下,主动换一条能完成任务的路径。
不是所有失败都该切换模型。
建议至少区分这几类:
只有把失败分类先做好,回退链路才不会变成“无差别乱跳”。
如果切换发生了,但你看不见,那这套系统迟早会失控。
至少要在日志中记录:
这些信息决定了两件事:
当你要引入一个新模型时,不要直接把所有流量切过去。
更稳妥的方式是:
这个过程看起来慢,但它能避免最糟糕的情况:新模型一上线,把整条主链路打穿。
路由层不是为了“看起来高级”,而是为了在真实波动中维持交付能力。
如果你只能做三件事,优先顺序建议是:
把这三件事做好,路由层就已经能承担生产价值。后面的权重调度、质量评分、动态预算策略,都是建立在这套基础上的扩展。