En begränsning av samtidighet per arbetare talar om för gatewayen att aldrig dirigera fler än ett visst antal pågående förfrågningar till en enhet <a href="#ref-1">[1]</a>. En mättad arbetare hoppas över, och en helt mättad pool svarar med <code>503</code> och en <code>Retry-After</code>-header omedelbart. Det är ärlig backpressure snarare än en kö som växer tyst tills något kraschar.

Håll varje enhet i dess optimala läge

En enhet som ombeds hantera långt fler samtidiga genereringar än den klarar av försämras inte smidigt; den slår runt, får slut på minne eller tar med sig grannarna i fallet <a href="#ref-1">[1]</a>. En gräns håller varje enhet vid den samtidighet där dess latens fortfarande är acceptabel. I en blandad flotta sätter du en högre gräns på den stora enheten och en lägre på en liten enhet, och varje bidrar med vad den faktiskt kan.

Snabbt fel slår långsam död

När poolen är full får anropare besked att försöka igen snart istället för att lämnas hängande tills en timeout inträffar <a href="#ref-1">[1]</a>. AI Suite-appar respekterar <code>Retry-After</code> automatiskt och faller tillbaka på AI på enheten där det är tillgängligt, så en hektisk morgon blir till en kort väntan istället för ett stopp <a href="#ref-2">[2]</a>.

Dimensionering av gräns

Välj en gräns genom att börja med antalet samtidiga genereringar som enheten hanterar med acceptabel latens och övervaka arbetarkortets latens på instrumentpanelen när belastningen ökar; knäpunkten är tydlig <a href="#ref-2">[2]</a>. En gräns är strikt: en mättad arbetare får ingenting, inte ens failover-trafik, vilket skyddar den från att pressas förbi gränsen vid det värsta ögonblicket. En gräns på noll betyder obegränsad.