A Amazon lança SageMaker HyperPod Inference Gateway, um sistema de roteamento GPU-aware que reduz a latência do primeiro token em até 82%. O recurso foi lançado em 18 de setembro de 2026.

O sistema usa métricas em tempo real para direcionar requisições para pods otimizados. Isso permite suporte a múltiplos modelos e otimiza a alocação de recursos com base em métricas como utilização de cache e presença de adaptadores LoRA. O SageMaker HyperPod Inference Gateway é um addon Kubernetes-native que se instala em clusters HyperPod.

Ele reduz a latência e melhora a utilização de GPU. A Amazon afirma que o recurso é parte das 13 novas capacidades lançadas em 2026. O SageMaker HyperPod Inference Gateway é uma das duas vias de implantação da Amazon SageMaker, juntamente com SageMaker Endpoints.

O novo recurso é integrado ao Amazon SageMaker e disponível como addon EKS. Ele visa otimizar a latência e a utilização de recursos em inferência de modelos de linguagem.

O recurso é integrado ao Amazon SageMaker e disponível como addon EKS, visando otimizar a latência e a utilização de recursos em inferência de modelos de linguagem.

O SageMaker HyperPod Inference Gateway roda com latência do primeiro token reduzida em até 82%, o que acelera respostas em aplicações de inteligência artificial. Isso faz com que o uso da GPU aumente, deixando menos recursos ociosos.

A redução de latência e o aumento da eficiência são pontos-chave. Isso permite que diferentes cargas de trabalho sejam processadas de forma mais eficiente, sem sobrecarregar a infraestrutura. A capacidade de rotear requisições para pods otimizados também ajuda a manter a estabilidade do sistema durante picos de demanda.

Ele visa otimizar a latência e a utilização de recursos em inferência de modelos de linguagem, com suporte a múltiplos modelos e otimização baseada em métricas em tempo real. Antes, a AWS já havia lançado soluções para reduzir cold starts em inferência, como o uso de caching de modelos.

A nova ferramenta se encaixa em uma linha de evolução que busca acelerar respostas de IA, com foco em latência e eficiência de recursos. O SageMaker HyperPod Inference Gateway é um addon EKS que se integra ao SageMaker, permitindo roteamento GPU-aware para inferência de modelos de linguagem. A AWS já trabalhava com soluções para reduzir cold starts, como o uso de caching de modelos, mas o novo recurso vai além, com otimização baseada em métricas em tempo real. A ferramenta é parte de uma estratégia contínua da empresa para acelerar respostas de IA, priorizando latência e eficiência de recursos em aplicações de inteligência artificial.

O SageMaker HyperPod Inference Gateway muda a forma como clusters usam GPUs, priorizando pods otimizados em tempo real. A nova funcionalidade permite multi-modelo e roteamento inteligente, melhorando a eficiência do cluster.

A nova funcionalidade integra-se ao Amazon SageMaker e está disponível como addon EKS. Essa abordagem redefine a gestão de recursos em ambientes de inferência de IA.

Ficha técnica

Ficha técnica
ItemEspecificação
Capacidadesparte das 13 novas capacidades lançadas pela Amazon SageMaker em 2026

Sem confirmação

  • Preço e data no Brasil não informados
  • Não há detalhes sobre modelos específicos suportados
  • Não há informações sobre preços ou custos específicos

Fontes

  1. Aws launches sagemaker hyperpod inference gateway for gpu aware routingunite.ai
  2. Introducing amazon sagemaker hyperpod inference gatewayaws.amazon.com
  3. Amazon sagemaker inference 2026 year to date launches in reviewaws.amazon.com
  4. Reduce inference cold starts on amazon sagemaker hyperpod with model cachingaws.amazon.com
  5. Unlock efficient model deployment simplified inference operator setup on amazon sagemaker hyperpodaws.amazon.com

Produtos relacionados · link de afiliado