Drie mechanismen die in elke daemon zitten maken een rolling upgrade van nature veilig. De /readyz-probe schakelt naar 503 zodra de shutdown begint, zodat een load balancer of gateway ziet dat de node uit de rotatie gaat, terwijl /livez 200 blijft zodat het proces niet abrupt wordt beëindigd [1]. Een configureerbare drain-hold houdt de node lang genoeg in die drainende staat zodat schedulers stoppen met het sturen van nieuw werk voordat het proces stopt met het accepteren ervan. De gateway proeft /readyz, niet alleen liveness, en de failover per verzoek dekt de handvol verzoeken die de drain-venster inhalen [1].
Drainen, niet droppen
Wanneer een worker een stop-signaal ontvangt, gaat deze in drain: /readyz geeft 503 terug, lopende verzoeken worden afgerond, en pas daarna stopt het proces [2]. De drain-duur wordt ingesteld met AISUITE_DRAIN_SECONDS, en een apart shutdown-budget begrenst hoe lang het proces wacht tot lopend werk is afgerond. De pool-entry verandert nooit; hetzelfde adres komt gezond terug op de nieuwe versie, en de gateway hervat het routeren ernaartoe.
De gateway regelt de rest
In een farm stop je één worker tegelijk. Het dashboard van de gateway toont dat die worker op DRAINING gaat, daarna op DOWN, terwijl het verkeer doorgaat op de andere peers; je vervangt de image en de node komt gezond terug op de nieuwe build voordat je doorgaat naar de volgende [1]. Er verandert tijdens dit alles niets aan de gateway-configuratie. Health probing, niet een configuratiewijziging, zorgt voor het verplaatsen van het verkeer.
Kubernetes: zero downtime door ontwerp
Op Kubernetes maken dezelfde probes <code>kubectl rollout</code> veilig zonder extra tooling: een liveness probe op <code>/livez</code>, een readiness probe op <code>/readyz</code>, en een <code>terminationGracePeriodSeconds</code> ingesteld op of boven het drain- plus shutdown-budget <a href="#ref-2">[2]</a>. De orchestrator stopt met routeren naar een drainende pod, wacht de respijtperiode af en rolt de volgende uit.
Waarom het belangrijk is
"Update Tuesday" zou niet moeten bestaan voor een AI-endpoint waarop andere apps vertrouwen. Dit is ook het mechanisme dat de beschikbaarheidspositie van een gateway-farm end-to-end bewijst: patchen is geen downtime, en het houdt stand onder belasting in plaats van alleen op een rustige console <a href="#ref-1">[1]</a><a href="#ref-3">[3]</a>.