Les installations réelles utilisent du matériel mixte : une machine avec une grande VRAM et un modèle volumineux, quelques machines de milieu de gamme avec des modèles de chat, une machine CPU pour les embeddings. Dans une ferme consciente des modèles, la passerelle dirige chaque requête vers un travailleur qui a déjà le modèle demandé chargé, et annonce l'union dédupliquée de tous les modèles des travailleurs comme un seul catalogue <a href="#ref-1">[1]</a>. Les appelants voient une seule liste de modèles et choisissent simplement ; le placement est un problème de la passerelle, pas le leur.

Le chaud bat le froid de plusieurs minutes

Le chargement d'un modèle peut être un événement de plusieurs gigaoctets et durer plusieurs minutes. Atterrir une requête sur une machine qui détient déjà le modèle est le plus grand gain en latence et en efficacité sur des fermes hétérogènes <a href="#ref-1">[1]</a>. Les requêtes sont routées en privilégiant les machines chaudes : les travailleurs qui rapportent le modèle demandé sont prioritaires, et ceux qui ne l'ont pas ne servent qu'en dernier recours, où leur propre démon chargerait le modèle selon sa politique.

Un seul catalogue, plusieurs machines

La passerelle actualise le catalogue de chaque travailleur selon la cadence de vérification de santé, donc la liste des modèles sur la passerelle est l'union dédupliquée de toute la ferme, répondue depuis le cache <a href="#ref-2">[2]</a>. Un travailleur dont le catalogue ne peut être récupéré est considéré comme possiblement chaud plutôt qu'indisponible, donc le routage ne descend jamais en dessous de la stratégie simple.

Achetez le matériel par classe de modèle

Le routage conscient des modèles est toujours activé en mode passerelle, donc la conception vous permet d'acheter du matériel par classe de modèle au lieu de rendre chaque machine capable d'exécuter tout <a href="#ref-1">[1]</a>Le chat s'exécute là où résident les modèles de chat, les embeddings sur la machine CPU, la vision sur l'accélérateur adapté. Rien de plus n'est configuré : construisez la ferme, installez les modèles prévus pour chaque travailleur, et la passerelle gère le placement.

Placement qui maintient la bascule à chaud

Gardez chaque modèle critique en latence sur au moins deux travailleurs afin que la bascule reste à chaud plutôt que de déclencher un chargement à froid au pire moment <a href="#ref-2">[2]</a>La stratégie d'équilibrage de charge ordonne toujours au sein de l'ensemble chaud, donc <code>least-connections</code> ou un biais <code>weighted</code> vers la grosse machine se combinent proprement avec la chaleur.