実際の導入では混在したハードウェアが稼働しています:大容量VRAMを搭載した大きなモデル用ボックス、チャットモデル用の中規模ボックス数台、埋め込み用のCPUボックス。モデル認識ファームでは、ゲートウェイが各リクエストを要求されたモデルをすでにウォーム状態で保持するワーカーにルーティングし、すべてのワーカーのモデルの和集合を一つのカタログとして広告します。 <a href="#ref-1">[1]</a>呼び出し元は一つのモデルリストを見て単に選択するだけで、配置はゲートウェイの問題であり、呼び出し元の問題ではありません。
ウォームはコールドに数分の差をつける
モデルのロードは数ギガバイトに及び、数分かかることがあります。リクエストをすでにモデルを保持するボックスに着地させることが、異種ファームにおける最大のレイテンシー削減と効率向上の要因です。 <a href="#ref-1">[1]</a>リクエストはウォーム優先でルーティングされます:要求されたモデルを報告するワーカーが優先され、モデルを持たないワーカーは最後の手段のフェイルオーバーとしてのみ残り、そのワーカーのデーモンがポリシーに従ってモデルを取得します。
一つのカタログ、多数のボックス
ゲートウェイはヘルスチェックの周期で各ワーカーのカタログを更新するため、ゲートウェイ上のモデルリストはファーム全体の重複排除された和集合となり、キャッシュから応答されます。 <a href="#ref-2">[2]</a>カタログが取得できないワーカーは利用不可ではなくウォームの可能性があると扱われるため、ルーティングは単純な戦略を下回ることはありません。
モデルクラスごとにハードウェアを購入する
モデル認識ルーティングはゲートウェイモードで常に有効であるため、設計上はすべてのボックスがすべてを実行可能にするのではなく、モデルクラスごとにハードウェアを購入できます <a href="#ref-1">[1]</a>チャットはチャットモデルが稼働する場所で動作し、埋め込みはCPUボックス上で、ビジョンはそれに適したアクセラレータ上で動作します。追加の設定は不要です:ファームを構築し、各ワーカーに意図されたモデルをインストールし、ゲートウェイが配置を行います。
フェイルオーバーを温かく保つ配置
すべてのレイテンシーに敏感なモデルを少なくとも2台のワーカーで稼働させ、フェイルオーバーが最悪のタイミングでのコールドロードを引き起こすのではなく、温かい状態を維持するようにします。 <a href="#ref-2">[2]</a>ロードバランシング戦略は依然として温かいセット内で順序付けを行うため、<code>least-connections</code>や大規模ボックスへの<code>weighted</code>バイアスは温かさときれいに組み合わさります。