每個工作程序的並發限制指示閘道器絕不會將超過設定數量的進行中請求路由到同一台伺服器。 <a href="#ref-1">[1]</a>. 飽和的工作程序會被跳過,而完全飽和的工作池會立即以帶有 <code>Retry-After</code> 標頭的 <code>503</code> 回應。這是真正的背壓機制,而非靜默增長直到系統崩潰的佇列。
保持每個盒子於最佳狀態
當一部裝置被要求執行遠超其處理能力的並發生成時,系統不會平穩降級;反而會出現劇烈震盪、記憶體耗盡,甚至連帶影響鄰近裝置。 <a href="#ref-1">[1]</a>. 每個伺服器的上限設定在其延遲仍可接受的併發數。對於混合伺服器群組,您會為大型伺服器設定較高的上限,為小型伺服器設定較低的上限,讓每台伺服器都能發揮其實際能力。
快速失敗勝過緩慢死亡
當資源池已滿,呼叫者會被告知稍後重試,而非一直等待直至超時 <a href="#ref-1">[1]</a>. AI Suite 應用程式會自動遵守 <code>Retry-After</code>,並在可用時回退至裝置上的 AI,令繁忙的早晨變成短暫等待,而非停頓 <a href="#ref-2">[2]</a>。
設定上限
選擇上限時,先從系統在可接受延遲下可同時處理的生成數量開始,並在負載增加時觀察儀表板上工作卡的延遲;轉折點非常明顯 <a href="#ref-2">[2]</a>上限設定很嚴格:當工作者飽和時,將不會獲得任何資源,甚至連故障轉移流量也不會有,這正是保護系統不會在最壞時刻被推至極限的機制。設定零上限即表示無上限。