A Amazon lança SageMaker HyperPod Inference Gateway, um sistema de roteamento GPU-aware que reduz a latência do primeiro token em até 82%. O recurso foi lançado em 18 de setembro de 2026.
O sistema usa métricas em tempo real para direcionar requisições para pods otimizados. Isso permite suporte a múltiplos modelos e otimiza a alocação de recursos com base em métricas como utilização de cache e presença de adaptadores LoRA. O SageMaker HyperPod Inference Gateway é um addon Kubernetes-native que se instala em clusters HyperPod.
Ele reduz a latência e melhora a utilização de GPU. A Amazon afirma que o recurso é parte das 13 novas capacidades lançadas em 2026. O SageMaker HyperPod Inference Gateway é uma das duas vias de implantação da Amazon SageMaker, juntamente com SageMaker Endpoints.
O novo recurso é integrado ao Amazon SageMaker e disponível como addon EKS. Ele visa otimizar a latência e a utilização de recursos em inferência de modelos de linguagem.
O recurso é integrado ao Amazon SageMaker e disponível como addon EKS, visando otimizar a latência e a utilização de recursos em inferência de modelos de linguagem.
O SageMaker HyperPod Inference Gateway roda com latência do primeiro token reduzida em até 82%, o que acelera respostas em aplicações de inteligência artificial. Isso faz com que o uso da GPU aumente, deixando menos recursos ociosos.
A redução de latência e o aumento da eficiência são pontos-chave. Isso permite que diferentes cargas de trabalho sejam processadas de forma mais eficiente, sem sobrecarregar a infraestrutura. A capacidade de rotear requisições para pods otimizados também ajuda a manter a estabilidade do sistema durante picos de demanda.
Ele visa otimizar a latência e a utilização de recursos em inferência de modelos de linguagem, com suporte a múltiplos modelos e otimização baseada em métricas em tempo real. Antes, a AWS já havia lançado soluções para reduzir cold starts em inferência, como o uso de caching de modelos.
A nova ferramenta se encaixa em uma linha de evolução que busca acelerar respostas de IA, com foco em latência e eficiência de recursos. O SageMaker HyperPod Inference Gateway é um addon EKS que se integra ao SageMaker, permitindo roteamento GPU-aware para inferência de modelos de linguagem. A AWS já trabalhava com soluções para reduzir cold starts, como o uso de caching de modelos, mas o novo recurso vai além, com otimização baseada em métricas em tempo real. A ferramenta é parte de uma estratégia contínua da empresa para acelerar respostas de IA, priorizando latência e eficiência de recursos em aplicações de inteligência artificial.
O SageMaker HyperPod Inference Gateway muda a forma como clusters usam GPUs, priorizando pods otimizados em tempo real. A nova funcionalidade permite multi-modelo e roteamento inteligente, melhorando a eficiência do cluster.
A nova funcionalidade integra-se ao Amazon SageMaker e está disponível como addon EKS. Essa abordagem redefine a gestão de recursos em ambientes de inferência de IA.
Ficha técnica
| Item | Especificação |
|---|---|
| Capacidades | parte das 13 novas capacidades lançadas pela Amazon SageMaker em 2026 |
Sem confirmação
- Preço e data no Brasil não informados
- Não há detalhes sobre modelos específicos suportados
- Não há informações sobre preços ou custos específicos
Fontes
- Aws launches sagemaker hyperpod inference gateway for gpu aware routingunite.ai
- Introducing amazon sagemaker hyperpod inference gatewayaws.amazon.com
- Amazon sagemaker inference 2026 year to date launches in reviewaws.amazon.com
- Reduce inference cold starts on amazon sagemaker hyperpod with model cachingaws.amazon.com
- Unlock efficient model deployment simplified inference operator setup on amazon sagemaker hyperpodaws.amazon.com
Produtos relacionados · link de afiliado



