每台 AI Server 都在 <code>/dashboard</code> 提供面向人类的实时仪表盘,暴露相同数据的聚合 JSON,并提供原生 Prometheus 指标以便告警。 <a href="#ref-1">[1]</a>。使用汇总数据可按密钥、应用、模型或工作节点细分;工作池状态可查询以支持集群自动化;编排器探针涵盖存活性和就绪性。所有功能均内置,因此重点在于如何有效使用,而非安装。

在用户发现问题之前先行察觉

仪表盘显示每个工作节点的健康状况、错误率、p95 延迟和饱和度,因此工作节点宕机或延迟漂移在影响用户之前即可被发现。 <a href="#ref-2">[2]</a>。告警方面,抓取 Prometheus 端点并从三条规则开始:错误率阈值、p95 延迟超过基线两倍且持续十分钟,以及健康工作节点数低于总数且持续五分钟的集群。

无需计量旁车的计费

无内容审计将每个请求归因于其应用和安装,在集群环境中归因于服务工作节点,原生支持按团队和按应用计费数据。 <a href="#ref-1">[1]</a>。按日期范围查询使用情况,按应用分组返回每个应用的请求数、令牌数和错误数;按工作节点分组则将成本分摊至集群硬件;按密钥分组则报告每个凭证。服务器端可配置按模型定价,使汇总数据包含成本估算。

经得起尽职调查的数据

仪表盘支持投影显示,其图例对非工程师也易于理解,因此在负载下的实时演示可替代幻灯片演示:运行聊天并观察每秒请求数变化,关闭一个工作节点并观察故障切换,然后指向按应用视图展示计费情况。 <a href="#ref-1">[1]</a>每个数据均可通过这些部署方案复现,这也是让声明经得起买方尽职调查的原因。