Amazon lança solução que treina modelos de IA em diferentes regiões sem mover grandes volumes de dados. A tecnologia usa Qumulo Cloud Data Fabric para acesso remoto com latência de 60 ms. Testes mostram que clusters em regiões distintas atingem desempenho comparável ao local
A HyperPod oferece resiliência, checkpointing e monitoramento via Grafana. Um treinamento com modelo LLaMA v3 (1,02 bilhão de parâmetros) foi feito em dois clusters, com resultados semelhantes em velocidade e throughput. A latência inicial é visível, mas convergente em 100–150 batches.
O desempenho do modelo melhorou de 43,75% para mais de 95% em um conjunto fixo de 64 mazes. A HyperPod Inference Gateway reduz latência de primeiro token em até 82% e evita desperdício de recursos. A combinação de HyperPod e Qumulo Cloud Data Fabric permite treinar modelos em regiões distintas sem mover grandes volumes de dados.
A latência de rede é de 60 ms, e os clusters mantêm desempenho comparável ao local. A tecnologia NeuralCache prevê acesso a dados, reduzindo a latência durante o treinamento.
A latência de 60 ms entre regiões permite que modelos sejam treinados sem mover dados. Isso reduz custos e tempo de transferência. O desempenho de treinamento, com 115–117 samples por segundo, é comparável a clusters locais.
Testes mostram que modelos treinados em regiões distintas têm desempenho equivalente ao local. Um modelo LLaMA v3 (1,02 bilhão de parâmetros) teve melhoria de 43,75% para mais de 95% em um conjunto fixo de 64 mazes. Isso significa que a solução pode ser usada em múltiplas regiões sem comprometer qualidade.
A solução também inclui ferramentas como NeuralCache e VPC peering, que otimizam o acesso aos dados e a eficiência do treinamento. Isso abre espaço para escalabilidade e resiliência em clusters distribuídos.
Clusters em diferentes zonas atingem desempenho equivalente ao local, sem mover dados. Testes com LLaMA v3 mostram que velocidade e throughput são semelhantes a um cluster centralizado.
A latência de 60 ms permite operações em tempo real, mesmo em regiões distantes. A convergência dos clusters ocorre em 100–150 batches.
Isso mostra que a arquitetura é eficaz mesmo com dados distribuídos. A redução de latência de primeiro token ajuda a acelerar o início do treinamento.
Ficha técnica
| Item | Especificação |
|---|---|
| Regiões de treinamento | US East (Ohio) e US West (Oregon) |
| Modelo de treinamento | LLaMA v3 (1,02 bilhão de parâmetros) |
| Redução de latência de primeiro token | até 82% |
| Arquitetura do Inference Gateway | Duas camadas (Tier 1 e Tier 2) |
Preço e disponibilidade no Brasil não foram confirmados
- Preço e disponibilidade no Brasil não foram confirmados
- Dados de desempenho com concorrente direto não foram informados
Fontes
- Multi region training with amazon sagemaker hyperpod and qumuloaws.amazon.com
- Accelerate multimodal rl training with skyrl on amazon sagemaker hyperpodaws.amazon.com
- Introducing amazon sagemaker hyperpod inference gatewayaws.amazon.com
- Build an ai powered product tagging system with amazon sagemaker serverless model customizationaws.amazon.com
- Selecting a vector store for amazon bedrock knowledge basesaws.amazon.com



