すべてのAI Serverは<code>/dashboard</code>に人間向けのライブダッシュボードを備え、同じデータを集計されたJSONとして公開し、アラート用にネイティブのPrometheusメトリクスを提供します。 <a href="#ref-1">[1]</a>使用状況の集計はキー、アプリ、モデル、ワーカー別に分類され、ワーカープールの状態はファームの自動化のためにクエリ可能で、オーケストレーターのプローブは稼働状況と準備状況をカバーします。すべて組み込み済みなので、インストールではなく活用が重要です。
ユーザーより先に問題を発見する
ダッシュボードはすべてのワーカーの健康状態、エラー率、p95レイテンシ、飽和度を表示し、ワーカーのDOWNやレイテンシの変動をユーザーに影響が出る前に確認できます。 <a href="#ref-2">[2]</a>アラートにはPrometheusエンドポイントをスクレイプし、3つのルールから始めます:エラー率の閾値、ベースラインの2倍のp95が10分間続くこと、そして正常なワーカー数が総数を下回るファームの状態を5分間監視。
メータリングサイドカーなしでのチャージバック
コンテンツフリーの監査はすべてのリクエストをアプリとインストールに紐付け、ファームではサービス中のワーカーに紐付けます。これがチーム別かつアプリ別のチャージバックデータとなります。 <a href="#ref-1">[1]</a>日付範囲での使用状況クエリはアプリ別にグループ化するとリクエスト数、トークン数、エラー数を返し、ワーカー別ではファームのハードウェアコストを分割し、キー別では認証情報ごとに報告します。モデル別の価格設定はサーバー側で構成可能で、集計にはコスト見積もりが含まれます。
デューデリジェンスに耐える数値
ダッシュボードはプロジェクター対応で凡例は非エンジニアにも分かりやすく、負荷下でのライブデモがスライド資料に代わります:チャットを実行してリクエスト数の増加を確認し、ワーカーを停止してフェイルオーバーを観察し、最後にアプリ別ビューを指してチャージバックの全体像を示します <a href="#ref-1">[1]</a>すべての数値はこれらの展開レシピから再現可能であり、これが購入者のデューデリジェンスをクリアする根拠となっています。