Un singolo AI Gateway si trova davanti a un pool di AI Server lavoratori. Le applicazioni si connettono al gateway con un solo URL e una sola chiave, esattamente come se fosse un singolo AI Server; dietro di esso, il gateway bilancia ogni richiesta tra i lavoratori, controlla lo stato di ciascuno e sposta il traffico di un lavoratore in difficoltà verso uno sano prima che il chiamante se ne accorga [1]. Non è un prodotto separato. AI Gateway è AI Server in esecuzione in modalità front-end della farm, quindi l'interfaccia compatibile con OpenAI /v1/* e quella compatibile con Ollama /api/* che espone un singolo server è esattamente quella che espone la farm [1].
Un URL e una chiave, una farm dietro
Il gateway bilancia ogni tipo di richiesta che la piattaforma serve: chat, embeddings, generazione di immagini, visione e audio, incluso il WebSocket per il parlato in tempo reale [1]. Le richieste sono distribuite secondo una strategia scelta da te — round-robin, minor latenza, minor numero di connessioni, ponderata o sticky per cliente. L'instradamento consapevole del modello invia una richiesta a un lavoratore che ha già caricato il modello richiesto, evitando la penalità di caricamento a freddo che si avrebbe se una macchina meno pronta avesse gestito la chiamata [1].
Aggiungi una GPU e la capacità cresce; i client non cambiano nulla. Metti un box offline per manutenzione e il suo traffico si svuota gradualmente, così nessuna richiesta in corso viene persa. Nei nostri test interrompiamo i lavoratori durante il traffico per mantenere questa garanzia: un lavoratore che muore viene ritentato su uno sano, e il failover avviene all'interno del gateway prima che il client veda un errore [1][3].
Il confine di fiducia introdotto da una farm
Una farm cambia chi detiene quali credenziali, e il design mantiene questo confine stretto. La chiave gateway del client non raggiunge mai un lavoratore. Il gateway presenta a ogni lavoratore la propria chiave, quindi una chiave gateway compromessa non può essere riutilizzata direttamente contro un lavoratore, e le credenziali per lavoratore restano all'interno della farm [2]. L'identità del chiamante, cioè quale app e quale installazione ha emesso una richiesta, passa al lavoratore. Il log di audit senza contenuti di ogni lavoratore quindi registra il vero originatore invece di attribuire tutto al gateway [2].
Backpressure invece di timeout
Quando ogni lavoratore è saturato, il gateway restituisce un esplicito "ritenta a breve" invece di mantenere una connessione aperta fino al timeout [1]. I chiamanti ricevono un segnale su cui possono agire. Due controlli di rollout si basano sullo stesso livello di instradamento. Un rilascio canary invia una fetta consistente di traffico a nuove macchine prima che gestiscano il carico completo. Un aggiornamento a zero downtime svuota un lavoratore, lo aggiorna e lo riporta nel pool, mantenendo l'endpoint attivo per tutto il tempo [1].
Kubernetes senza modifiche manuali al pool
Su Kubernetes, i worker vengono scoperti automaticamente durante la scalabilità, quindi una farm autoscalante non necessita di modifiche manuali alla lista dei worker del gateway [2]. La ricetta include tre configurazioni da un unico prodotto: Docker Compose per una demo su singola macchina, manifesti Kubernetes e un chart Helm per il cluster. Il prodotto, le API e la licenza sono identici da un laptop a una farm GPU [2].
Quanto ti costa gestire una farm
Ogni server, gateway incluso, ospita la propria dashboard live ed espone metriche native Prometheus per la salute della flotta, latenza, utilizzo e capacità [3]. La visibilità della flotta è una dashboard unica, non uno stack di monitoraggio assemblato prima della prima richiesta. Il servizio di rete rimane controllato in ogni nodo: un bind non-loopback fallisce e chiude a meno che il nodo non abbia un diritto Pro e almeno una chiave API, impedendo così a una macchina non autorizzata o senza chiave di esporsi silenziosamente sulla LAN [1][4].
Una farm di gateway è la topologia alla base della posizione di disponibilità della piattaforma: l’endpoint AI rimane attivo quando una macchina non lo è, e lo fa senza un cloud vendor nel percorso della richiesta. È concessa in licenza come parte di Pro Commercial e non venduta come prodotto separato [4].