Rzeczywiste instalacje korzystają z mieszanych konfiguracji sprzętowych: maszyna z dużą pamięcią VRAM i dużym modelem, kilka maszyn średniej klasy z modelami czatu, maszyna CPU do embeddingów. W farmie świadomej modeli brama kieruje każde żądanie do pracownika, który już ma załadowany żądany model, i reklamuje związek wszystkich modeli pracowników jako jeden katalog <a href="#ref-1">[1]</a>. Wywołujący widzą jedną listę modeli i po prostu wybierają; rozmieszczenie to problem bramy, nie ich.
Załadowany model wygrywa z zimnym o minuty
Załadowanie modelu może być wielogigabajtowym, trwającym minuty zdarzeniem. Przekierowanie żądania do maszyny, która już posiada model, to największy pojedynczy zysk w opóźnieniach i efektywności na heterogenicznych farmach <a href="#ref-1">[1]</a>. Żądania są kierowane z priorytetem do maszyn z załadowanym modelem: pracownicy, którzy zgłaszają posiadanie żądanego modelu, są preferowani, a pracownicy bez niego pozostają tylko jako ostateczna rezerwa, gdzie ich własny daemon pobiera model zgodnie z polityką.
Jeden katalog, wiele maszyn
Brama odświeża katalog każdego pracownika zgodnie z cyklem kontroli stanu, więc lista modeli na bramie to zdeduplikowany związek całej farmy, odpowiadany z pamięci podręcznej <a href="#ref-2">[2]</a>. Pracownik, którego katalog nie może zostać pobrany, jest traktowany jako potencjalnie załadowany, a nie niedostępny, więc routing nigdy nie spada poniżej podstawowej strategii.
Kupuj sprzęt według klasy modelu
Routing świadomy modeli jest zawsze włączony w trybie bramy, więc projekt pozwala kupować sprzęt według klasy modelu zamiast wymagać, by każda maszyna mogła uruchomić wszystko <a href="#ref-1">[1]</a>Chat działa tam, gdzie znajdują się modele czatu, osadzenia na komputerze z CPU, wizja na odpowiednim akceleratorze. Nic dodatkowego nie jest konfigurowane: zbuduj farmę, zainstaluj modele przeznaczone dla każdego pracownika, a brama zajmie się rozmieszczeniem.
Rozmieszczenie, które utrzymuje failover w gotowości
Utrzymuj każdy model krytyczny pod względem opóźnień na co najmniej dwóch pracownikach, aby failover był gotowy, zamiast wywoływać zimne ładowanie w najgorszym momencie <a href="#ref-2">[2]</a>Strategia równoważenia obciążenia nadal porządkuje w ramach zestawu gotowych, więc <code>least-connections</code> lub <code>weighted</code> z nastawieniem na duży komputer komponuje się czysto z gotowością.