Las instalaciones reales usan hardware mixto: una máquina con gran VRAM y un modelo grande, algunas máquinas de gama media con modelos de chat, una máquina con CPU para embeddings. En una granja consciente del modelo, la puerta de enlace dirige cada solicitud a un trabajador que ya tiene el modelo solicitado cargado, y anuncia la unión de los modelos de todos los trabajadores como un solo catálogo. <a href="#ref-1">[1]</a>Los llamantes ven una sola lista de modelos y simplemente eligen; la asignación es problema de la puerta de enlace, no de ellos.
Caliente vence a frío por minutos
Cargar un modelo puede ser un evento de varios gigabytes y durar minutos. Dirigir una solicitud a una máquina que ya tiene el modelo es la mayor ganancia en latencia y eficiencia en granjas heterogéneas. <a href="#ref-1">[1]</a>Las solicitudes se enrutan priorizando los modelos cargados: los trabajadores que reportan tener el modelo solicitado lideran, y los que no lo tienen quedan solo como respaldo de último recurso, donde su propio demonio cargaría el modelo según su política.
Un catálogo, muchas máquinas
La puerta de enlace actualiza el catálogo de cada trabajador según la cadencia de chequeo de salud, por lo que la lista de modelos en la puerta de enlace es la unión deduplicada de toda la granja, respondida desde caché. <a href="#ref-2">[2]</a>Un trabajador cuyo catálogo no puede ser obtenido se trata como posiblemente cargado en lugar de no disponible, por lo que el enrutamiento nunca empeora respecto a la estrategia simple.
Compra hardware por clase de modelo
El enrutamiento consciente del modelo está siempre activo en modo puerta de enlace, por lo que el diseño te permite comprar hardware por clase de modelo en lugar de hacer que cada máquina pueda ejecutar todo <a href="#ref-1">[1]</a>La conversación se ejecuta donde residen los modelos de chat, las incrustaciones en la caja CPU, la visión en el acelerador que le corresponde. No se configura nada extra: construye la granja, instala los modelos previstos para cada trabajador, y la puerta de enlace realiza la asignación.
Asignación que mantiene el failover activo
Mantén cada modelo crítico para la latencia en al menos dos trabajadores para que el failover permanezca activo en lugar de activar una carga en frío en el peor momento <a href="#ref-2">[2]</a>La estrategia de balanceo de carga aún ordena dentro del conjunto activo, por lo que <code>least-connections</code> o un sesgo <code>weighted</code> hacia la caja grande se combinan limpiamente con la activación.