AWS Machine Learning Blog9/18 21:08100 分精选
亚马逊推出 SageMaker HyperPod 推理网关
Introducing Amazon SageMaker HyperPod Inference Gateway
推荐理由:首 token 延迟最多降 82% 且无需改模型服务器或客户端,做推理部署和产品孵化的可以直接抄这个路由思路。
AWS 发布 Amazon SageMaker HyperPod Inference Gateway,这是一个面向 Amazon EKS 的 Kubernetes 原生、GPU 感知路由插件。它利用实时 GPU 信号将每个推理请求发送到最合适的 pod,在无需修改模型服务器或客户端应用的情况下,将首 token 延迟最多降低 82%。