Verkliga installationer kör blandad hårdvara: en stor VRAM-enhet med en stor modell, några mellanklass-enheter med chattmodeller, en CPU-enhet för embeddings. I en modellmedveten farm dirigerar gatewayen varje förfrågan till en arbetare som redan har den begärda modellen varm, och annonserar unionen av varje arbetares modeller som en katalog <a href="#ref-1">[1]</a>. Anropare ser en modellista och väljer enkelt; placeringen är gatewayens problem, inte deras.
Varm slår kall med flera minuter
En modellinladdning kan vara en flera gigabyte stor, minuter lång process. Att landa en förfrågan på en enhet som redan har modellen är den största vinsten för latens och effektivitet på heterogena farmar <a href="#ref-1">[1]</a>. Förfrågningar dirigeras med varm-först: arbetare som rapporterar den begärda modellen leder, och arbetare utan den finns endast som sista-resort reserv, där deras egen daemon skulle hämta modellen enligt sin policy.
En katalog, många enheter
Gatewayen uppdaterar varje arbetares katalog enligt hälsokontrollens intervall, så modellistan på gatewayen är den deduplicerade unionen av hela farmen, besvarad från cache <a href="#ref-2">[2]</a>. En arbetare vars katalog inte kan hämtas behandlas som möjligen varm snarare än otillgänglig, så dirigeringen försämras aldrig under den enkla strategin.
Köp hårdvara per modellklass
Modellmedveten dirigering är alltid på i gateway-läge, så designen låter dig köpa hårdvara per modellklass istället för att göra varje enhet kapabel att köra allt <a href="#ref-1">[1]</a>. Chat körs där chattmodellerna finns, embeddings på CPU-enheten, vision på den accelerator som passar. Inget extra konfigureras: bygg farmen, installera varje arbetares avsedda modeller, och gatewayen sköter placeringen.
Placering som håller failover varm
Håll varje latenskritisk modell på minst två arbetare så att failover förblir varm istället för att utlösa en kall belastning vid det värsta ögonblicket <a href="#ref-2">[2]</a>. Lastbalanseringsstrategin beställer fortfarande inom den varma uppsättningen, så <code>least-connections</code> eller en <code>weighted</code> fördelning mot den stora enheten kombineras smidigt med värme.