オフィスのGPUボックス上の単一のAI Serverが、APIキー認証付きHTTPでネットワーク上のすべてのワークステーションにサービスを提供します。チームのアプリはローカルでモデルを実行する代わりにこれを指します。 <a href="#ref-1">[1]</a>1台のGPUが20台のノートパソコンにサービスを提供します。モデルは一度だけ読み込まれ、全員で共有されます。データは建物内に留まり、クラウドAIは経路に含まれず、トークンごとの課金もありません。ITは各デスクでなく1か所でモデルを取得・更新します。 <a href="#ref-1">[1]</a>。
デフォルトでキー認証、フェイルクローズ
ネットワークサービスは有料機能です。ループバックのみのサーバーは無料で利用可能です。 <a href="#ref-3">[3]</a>サービングマシン上でデスクトップアプリまたはCLIからAPIキーを発行します。生のキーは一度だけ表示され、サーバーはハッシュのみを保存します。キーが存在しない場合、デーモンは非ループバックバインドでの起動を拒否します。これはエラー回避ではなくフェイルクローズのデフォルト動作です。 <a href="#ref-2">[2]</a><code>/v1/*</code>へのキーなしリクエストは<code>401</code>を返します。ヘルスプローブはキーなしのままで監視が機能します。
サーバーを特定するディスカバリー
ワークステーションは設定のAI Server項目でボックスを検出します:mDNSでLAN上を検出するか、<code>http://<server-ip>:<port></code>を追加してキーを貼り付けます。 <a href="#ref-2">[2]</a>各アプリは初回接続時にサーバーのフィンガープリントを固定するため、後でフィンガープリントが変更された場合は、トラフィックを静かに迂回させるのではなく、信頼する前に警告が表示されます。
他のツールも動作します
任意のOpenAI互換ツールは同じエンドポイントを使用できます:ベースURLは<code>/v1</code>、APIキーはベアラートークンとして使用します <a href="#ref-1">[1]</a>匿名の第三者トラフィックにはレート制限がかかりますが、キー付きトラフィックにはかかりません。オフィスではツールごとに別々の統合を行う代わりに、1つのエンドポイントと1つのキーのポリシーを維持しています。
ITが運用するもの
サーバーは独自のダッシュボードをホストしています:アクティブクライアント、アプリ別のトラフィック、インストール済みモデルの一覧があり、キーを持つ任意のデスクからアクセス可能です。 <a href="#ref-1">[1]</a>これはファームの前段階です。1台のボックスでは足りなくなった場合、同じ製品をゲートウェイの背後に移動させてもアプリは変更されません。