Limit współbieżności na pracownika mówi gatewayowi, aby nigdy nie kierował więcej niż określoną liczbę aktywnych żądań do jednego serwera <a href="#ref-1">[1]</a>. Przeciążony pracownik jest pomijany, a w pełni przeciążona pula odpowiada kodem <code>503</code> z nagłówkiem <code>Retry-After</code> natychmiast. To jest uczciwa presja zwrotna, a nie kolejka, która rośnie cicho aż coś się zawiesi.
Utrzymuj każdy serwer w optymalnym zakresie
Serwer, który jest proszony o obsługę znacznie większej liczby równoczesnych generacji niż jest w stanie, nie degraduje się łagodnie; zaczyna się wahać, kończy pamięć lub zabiera ze sobą sąsiednie serwery <a href="#ref-1">[1]</a>. Limit utrzymuje każdy serwer na poziomie współbieżności, przy którym jego opóźnienie jest nadal akceptowalne. W mieszanej flocie ustawiasz wyższy limit na dużym serwerze, a niższy na małym, i każdy wnosi to, co faktycznie może.
Szybka odmowa jest lepsza niż powolna śmierć
Gdy pula jest pełna, wywołujący są informowani, aby spróbowali ponownie wkrótce, zamiast pozostawać w zawieszeniu aż do przekroczenia limitu czasu <a href="#ref-1">[1]</a>. Aplikacje AI Suite automatycznie respektują nagłówek <code>Retry-After</code> i przełączają się na AI działające lokalnie, gdy jest dostępne, więc intensywny poranek zamienia się w krótkie oczekiwanie zamiast zatrzymania <a href="#ref-2">[2]</a>.
Dobór limitu
Wybierz limit, zaczynając od liczby jednoczesnych generacji, które urządzenie obsługuje przy akceptowalnej latencji, i obserwując latencję karty roboczej na pulpicie nawigacyjnym w miarę wzrostu obciążenia; punkt załamania jest oczywisty <a href="#ref-2">[2]</a>. Limit jest sztywny: nasycony pracownik nie otrzymuje nic, nawet ruchu zapasowego, który chroni go przed przekroczeniem granicy w najgorszym momencie. Limit zero oznacza brak limitu.