Un límite de concurrencia por trabajador indica al gateway que nunca enrute más de un número establecido de solicitudes en curso a una caja <a href="#ref-1">[1]</a>. Se omite un trabajador saturado, y un grupo completamente saturado responde con <code>503</code> y un encabezado <code>Retry-After</code> de inmediato. Eso es retropresión honesta en lugar de una cola que crece silenciosamente hasta que algo falla.
Mantén cada caja en su punto óptimo
Una caja que se le pide ejecutar muchas más generaciones concurrentes de las que puede manejar no se degrada de forma gradual; se descontrola, se queda sin memoria o arrastra a sus vecinas con ella <a href="#ref-1">[1]</a>. Un límite mantiene cada caja en la concurrencia donde su latencia sigue siendo aceptable. En una flota mixta, se establece un límite más alto en la caja grande y uno más bajo en la caja pequeña, y cada una contribuye con lo que realmente puede.
Fallo rápido mejor que muerte lenta
Cuando el grupo está lleno, se indica a los llamantes que reintenten pronto en lugar de dejarlos esperando hasta un tiempo de espera <a href="#ref-1">[1]</a>. Las aplicaciones de AI Suite respetan automáticamente <code>Retry-After</code> y recurren a la IA en el dispositivo cuando está disponible, por lo que una mañana ocupada se degrada en una breve espera en lugar de una paralización <a href="#ref-2">[2]</a>.
Dimensionando el límite
Elija un límite comenzando por el número de generaciones concurrentes que la caja maneja con una latencia aceptable y observe la latencia de la tarjeta de trabajo en el panel a medida que aumenta la carga; el punto de inflexión es evidente <a href="#ref-2">[2]</a>. Un límite es estricto: un trabajador saturado no recibe nada, ni siquiera tráfico de conmutación por error, que es lo que lo protege de ser sobrepasado en el peor momento. Un límite de cero significa sin límite.