Instalações reais operam com hardware misto: uma máquina com grande VRAM e um modelo grande, algumas máquinas intermediárias com modelos de chat, uma máquina CPU para embeddings. Em uma fazenda consciente de modelo, o gateway direciona cada solicitação para um trabalhador que já tem o modelo solicitado aquecido, e anuncia a união de todos os modelos dos trabalhadores como um único catálogo <a href="#ref-1">[1]</a>. Os chamadores veem uma única lista de modelos e simplesmente escolhem; o posicionamento é problema do gateway, não deles.

Aquecido vence frio por minutos

O carregamento de um modelo pode ser um evento de vários gigabytes e durar minutos. Direcionar uma solicitação para uma máquina que já possui o modelo é a maior vantagem em latência e eficiência em fazendas heterogêneas <a href="#ref-1">[1]</a>. As solicitações são roteadas priorizando o aquecido: trabalhadores que reportam o modelo solicitado lideram, e trabalhadores sem ele permanecem apenas como último recurso de failover, onde seu próprio daemon carregaria o modelo conforme sua política.

Um catálogo, muitas máquinas

O gateway atualiza o catálogo de cada trabalhador na cadência do health-check, então a lista de modelos no gateway é a união deduplicada de toda a fazenda, respondida a partir do cache <a href="#ref-2">[2]</a>. Um trabalhador cujo catálogo não pode ser obtido é tratado como possivelmente aquecido em vez de indisponível, então o roteamento nunca se degrada abaixo da estratégia simples.

Compre hardware por classe de modelo

O roteamento consciente de modelo está sempre ativo no modo gateway, então o design permite comprar hardware por classe de modelo em vez de fazer cada máquina capaz de rodar tudo <a href="#ref-1">[1]</a>. O chat é executado onde os modelos de chat residem, embeddings na máquina CPU, visão no acelerador adequado. Nada extra é configurado: construa a fazenda, instale os modelos pretendidos de cada trabalhador, e o gateway faz o posicionamento.

Posicionamento que mantém o failover aquecido

Mantenha cada modelo crítico para latência em pelo menos dois trabalhadores para que o failover permaneça aquecido em vez de disparar uma carga fria no pior momento <a href="#ref-2">[2]</a>. A estratégia de balanceamento de carga ainda ordena dentro do conjunto aquecido, então <code>least-connections</code> ou um viés <code>weighted</code> em direção à máquina maior compõem-se de forma limpa com o aquecimento.