Um limite de concorrência por trabalhador informa ao gateway para nunca encaminhar mais do que um número definido de requisições em andamento para uma caixa <a href="#ref-1">[1]</a>. Um trabalhador saturado é ignorado, e um pool totalmente saturado responde com <code>503</code> e um cabeçalho <code>Retry-After</code> imediatamente. Isso é backpressure honesto em vez de uma fila que cresce silenciosamente até que algo falhe.
Mantenha cada caixa em seu ponto ideal
Uma caixa solicitada a executar muito mais gerações concorrentes do que pode suportar não degrada de forma suave; ela trava, fica sem memória ou derruba suas vizinhas junto com ela <a href="#ref-1">[1]</a>. Um limite mantém cada caixa na concorrência onde sua latência ainda é aceitável. Em uma frota mista, você define um limite maior para a caixa grande e um menor para a caixa pequena, e cada uma contribui com o que realmente pode.
Falha rápida é melhor que morte lenta
Quando o pool está cheio, os chamadores são instruídos a tentar novamente em breve em vez de ficarem esperando até um timeout <a href="#ref-1">[1]</a>. Os aplicativos AI Suite respeitam automaticamente o <code>Retry-After</code> e recorrem à IA no dispositivo quando disponível, então uma manhã ocupada se transforma em uma breve espera em vez de uma paralisação <a href="#ref-2">[2]</a>.
Dimensionando o limite
Escolha um limite começando pelo número de gerações simultâneas que o equipamento suporta com latência aceitável e observando a latência da placa de trabalho no painel conforme a carga aumenta; o ponto de inflexão é óbvio <a href="#ref-2">[2]</a>. Um limite é rígido: um trabalhador saturado não recebe nada, nem mesmo tráfego de failover, que é o que o protege de ser ultrapassado no pior momento. Um limite zero significa sem limite.