每个工作线程的并发限制告诉网关,绝不向某台设备路由超过设定数量的进行中请求 <a href="#ref-1">[1]</a>。饱和的工作线程会被跳过,完全饱和的资源池会立即返回带有 Retry-After 头的 <code>503</code> 状态码。这是真正的背压,而不是让队列默默增长直到系统崩溃。
保持每台设备在最佳状态
当一台设备被要求处理远超其承载能力的并发生成时,它不会优雅降级;而是会频繁抖动、内存耗尽,甚至拖垮邻近设备 <a href="#ref-1">[1]</a>。容量上限让每台设备保持在延迟仍可接受的并发水平。在混合设备环境中,你可以对大型设备设置较高的上限,对小型设备设置较低的上限,每台设备都贡献其实际能力。
快速失败胜过缓慢崩溃
当资源池已满时,调用方会被告知稍后重试,而不是被挂起直到超时 <a href="#ref-1">[1]</a>。AI Suite 应用会自动遵守 <code>Retry-After</code> 头,并在设备端 AI 可用时回退使用,因此繁忙的早晨会变成短暂等待,而非停滞 <a href="#ref-2">[2]</a>。
确定上限
通过从设备在可接受延迟下处理的并发生成数量开始选择上限,并在负载增加时观察仪表板上工作卡的延迟;拐点非常明显 <a href="#ref-2">[2]</a>上限是严格的:饱和的工作节点不会获得任何资源,甚至不会有故障转移流量,这正是保护它不会在最糟糕时刻被推到极限的机制。上限为零表示无限制。