Echte installaties draaien op gemengde hardware: een machine met veel VRAM en een groot model, een paar mid-range machines met chatmodellen, een CPU-machine voor embeddings. In een modelbewuste farm stuurt de gateway elk verzoek naar een worker die het gevraagde model al warm heeft, en adverteert de unie van alle modellen van elke worker als één catalogus <a href="#ref-1">[1]</a>. Aanvragers zien één modellenlijst en kiezen simpelweg; de plaatsing is het probleem van de gateway, niet van hen.
Warm verslaat koud met minuten
Het laden van een model kan een multi-gigabyte en minutenlang proces zijn. Een verzoek landen op een machine die het model al heeft, is de grootste winst in latency en efficiëntie op heterogene farms <a href="#ref-1">[1]</a>. Verzoeken worden warm-first gerouteerd: workers die het gevraagde model rapporteren, krijgen voorrang, en workers zonder dat model blijven alleen als laatste redmiddel over, waarbij hun eigen daemon het model volgens beleid zou laden.
Eén catalogus, veel machines
De gateway ververst de catalogus van elke worker volgens de health-check frequentie, zodat de modellenlijst op de gateway de gededupliceerde unie van de hele farm is, beantwoord vanuit cache <a href="#ref-2">[2]</a>. Een worker waarvan de catalogus niet kan worden opgehaald, wordt behandeld als mogelijk warm in plaats van onbeschikbaar, zodat de routering nooit slechter wordt dan de eenvoudige strategie.
Koop hardware per modelklasse
Modelbewuste routering staat altijd aan in gateway-modus, dus het ontwerp laat je hardware per modelklasse kopen in plaats van elke machine alles te laten draaien <a href="#ref-1">[1]</a>. Chat draait waar de chatmodellen zich bevinden, embeddings op de CPU-box, vision op de accelerator die daarvoor geschikt is. Er wordt niets extra's geconfigureerd: bouw de farm, installeer de bedoelde modellen van elke worker, en de gateway regelt de plaatsing.
Plaatsing die failover warm houdt
Houd elk latentie-kritisch model op minstens twee workers actief zodat failover warm blijft in plaats van een koude start op het slechtste moment te veroorzaken <a href="#ref-2">[2]</a>. De load-balancingstrategie ordent nog steeds binnen de warme set, dus <code>least-connections</code> of een <code>weighted</code> voorkeur voor de grote box werkt netjes samen met warmte.