Echte Installationen verwenden gemischte Hardware: eine große VRAM-Maschine mit einem großen Modell, einige Mittelklasse-Rechner mit Chat-Modellen, eine CPU-Maschine für Embeddings. In einer modellbewussten Farm leitet das Gateway jede Anfrage an einen Arbeiter weiter, der das angeforderte Modell bereits geladen hat, und bietet die Vereinigung aller Modelle aller Arbeiter als einen Katalog an. <a href="#ref-1">[1]</a>. Anfragende sehen eine einzige Modellliste und wählen einfach; die Platzierung ist das Problem des Gateways, nicht ihres.

Warm schlägt kalt um Minuten

Das Laden eines Modells kann ein mehrgigabytegroßes, minutenlanges Ereignis sein. Eine Anfrage auf einem Rechner zu landen, der das Modell bereits hält, ist der größte Gewinn bei Latenz und Effizienz in heterogenen Farmen. <a href="#ref-1">[1]</a>. Anfragen werden warm-first geroutet: Arbeiter, die das angeforderte Modell melden, führen, und Arbeiter ohne dieses Modell bleiben nur als letzte Ausweichmöglichkeit, wobei ihr eigener Daemon das Modell gemäß seiner Richtlinie lädt.

Ein Katalog, viele Rechner

Das Gateway aktualisiert den Katalog jedes Arbeiters im Health-Check-Rhythmus, sodass die Modellliste im Gateway die deduplizierte Vereinigung der gesamten Farm ist, beantwortet aus dem Cache. <a href="#ref-2">[2]</a>. Ein Arbeiter, dessen Katalog nicht abgerufen werden kann, wird als möglicherweise warm und nicht als nicht verfügbar behandelt, sodass das Routing nie unter die einfache Strategie fällt.

Hardware pro Modellklasse kaufen

Modellbewusstes Routing ist im Gateway-Modus immer aktiv, sodass das Design es erlaubt, Hardware pro Modellklasse zu kaufen, anstatt jeden Rechner in die Lage zu versetzen, alles auszuführen <a href="#ref-1">[1]</a>. Chat läuft dort, wo die Chat-Modelle sind, Embeddings auf der CPU-Box, Vision auf dem passenden Beschleuniger. Es wird nichts zusätzlich konfiguriert: Bauen Sie den Farm auf, installieren Sie die vorgesehenen Modelle jedes Arbeiters, und das Gateway übernimmt die Platzierung.

Platzierung, die Failover warm hält

Halten Sie jedes latenzkritische Modell auf mindestens zwei Arbeitern, damit das Failover warm bleibt und nicht im ungünstigsten Moment einen Kaltstart auslöst <a href="#ref-2">[2]</a>. Die Lastverteilungsstrategie ordnet innerhalb des warmen Sets, sodass <code>least-connections</code> oder eine <code>gewichtete</code> Bevorzugung des großen Systems sauber mit der Wärme zusammenspielt.