实际部署中硬件混合运行:一台大显存机器运行大型模型,几台中端机器运行聊天模型,一台 CPU 机器用于生成嵌入。在模型感知集群中,网关将每个请求路由到已加载请求模型的工作节点,并将所有工作节点模型的并集作为统一目录进行广告发布。 <a href="#ref-1">[1]</a>调用方看到的是一个模型列表,直接选择;模型部署由网关负责,调用方无需关心。
预热优于冷启动数分钟
模型加载可能是多 GB 级别、耗时数分钟的操作。将请求发送到已加载该模型的机器,是异构集群中延迟和效率提升的最大关键。 <a href="#ref-1">[1]</a>请求优先路由到已预热模型的工作节点;未加载该模型的节点仅作为最后的故障切换选项,其守护进程会根据策略拉取模型。
统一目录,多台机器
网关按照健康检查频率刷新每个工作节点的目录,因此网关上的模型列表是整个集群模型的去重并集,且从缓存中响应。 <a href="#ref-2">[2]</a>无法获取目录的工作节点被视为可能已预热而非不可用,因此路由策略不会退化到简单策略。
按模型类别采购硬件
模型感知路由在网关模式下始终开启,设计允许你根据模型类别采购硬件,而无需让每台机器都能运行所有模型。 <a href="#ref-1">[1]</a>聊天运行在聊天模型所在的位置,嵌入运行在CPU服务器上,视觉运行在适合的加速器上。无需额外配置:搭建集群,安装每个工作节点所需的模型,网关负责调度。
保持故障切换的热备状态
确保每个延迟关键模型至少运行在两个工作节点上,以便故障切换时保持热备状态,而不是在最糟糕的时刻触发冷加载。 <a href="#ref-2">[2]</a>负载均衡策略仍在热备集内排序,因此<code>least-connections</code>或带有<code>weighted</code>偏好的策略可以与热备状态完美结合。