Amazon lança solução que treina modelos de IA em diferentes regiões sem mover grandes volumes de dados. A tecnologia usa Qumulo Cloud Data Fabric para acesso remoto com latência de 60 ms. Testes mostram que clusters em regiões distintas atingem desempenho comparável ao local

A HyperPod oferece resiliência, checkpointing e monitoramento via Grafana. Um treinamento com modelo LLaMA v3 (1,02 bilhão de parâmetros) foi feito em dois clusters, com resultados semelhantes em velocidade e throughput. A latência inicial é visível, mas convergente em 100–150 batches.

O desempenho do modelo melhorou de 43,75% para mais de 95% em um conjunto fixo de 64 mazes. A HyperPod Inference Gateway reduz latência de primeiro token em até 82% e evita desperdício de recursos. A combinação de HyperPod e Qumulo Cloud Data Fabric permite treinar modelos em regiões distintas sem mover grandes volumes de dados.

A latência de rede é de 60 ms, e os clusters mantêm desempenho comparável ao local. A tecnologia NeuralCache prevê acesso a dados, reduzindo a latência durante o treinamento.

A latência de 60 ms entre regiões permite que modelos sejam treinados sem mover dados. Isso reduz custos e tempo de transferência. O desempenho de treinamento, com 115–117 samples por segundo, é comparável a clusters locais.

Testes mostram que modelos treinados em regiões distintas têm desempenho equivalente ao local. Um modelo LLaMA v3 (1,02 bilhão de parâmetros) teve melhoria de 43,75% para mais de 95% em um conjunto fixo de 64 mazes. Isso significa que a solução pode ser usada em múltiplas regiões sem comprometer qualidade.

A solução também inclui ferramentas como NeuralCache e VPC peering, que otimizam o acesso aos dados e a eficiência do treinamento. Isso abre espaço para escalabilidade e resiliência em clusters distribuídos.

Clusters em diferentes zonas atingem desempenho equivalente ao local, sem mover dados. Testes com LLaMA v3 mostram que velocidade e throughput são semelhantes a um cluster centralizado.

A latência de 60 ms permite operações em tempo real, mesmo em regiões distantes. A convergência dos clusters ocorre em 100–150 batches.

Isso mostra que a arquitetura é eficaz mesmo com dados distribuídos. A redução de latência de primeiro token ajuda a acelerar o início do treinamento.

Ficha técnica

Ficha técnica
ItemEspecificação
Regiões de treinamentoUS East (Ohio) e US West (Oregon)
Modelo de treinamentoLLaMA v3 (1,02 bilhão de parâmetros)
Redução de latência de primeiro tokenaté 82%
Arquitetura do Inference GatewayDuas camadas (Tier 1 e Tier 2)

Preço e disponibilidade no Brasil não foram confirmados

  • Preço e disponibilidade no Brasil não foram confirmados
  • Dados de desempenho com concorrente direto não foram informados

Fontes

  1. Multi region training with amazon sagemaker hyperpod and qumuloaws.amazon.com
  2. Accelerate multimodal rl training with skyrl on amazon sagemaker hyperpodaws.amazon.com
  3. Introducing amazon sagemaker hyperpod inference gatewayaws.amazon.com
  4. Build an ai powered product tagging system with amazon sagemaker serverless model customizationaws.amazon.com
  5. Selecting a vector store for amazon bedrock knowledge basesaws.amazon.com