AllenAI lança Olmo-core 3, uma nova infraestrutura de treinamento para modelos de linguagem grandes. O sistema escala até trilhões de parâmetros e usa DDP em vez de FSDP. A tecnologia está disponível no GitHub.
A tecnologia aumenta a throughput em 2,7x em testes com 47 bilhões de parâmetros. Suporta MXFP8, reduzindo a memória ativa de 103 GiB para 95 GiB e aumentando a throughput em 21%. Permite que apenas uma parte do modelo seja ativada durante o treinamento, reduzindo custos computacionais. O Olmo-core 3 processa 52.000 tokens por segundo em GPUs B3000, 2,7 vezes mais rápido que a arquitetura Megatron-core da Nvidia. A disponibilidade aberta reforça a abordagem colaborativa do projeto.
Testes mostram que o sistema escala até trilhões de parâmetros, mantendo a performance. A modelagem em até 512 GPUs permite treinar modelos de 1,2 trilhão de parâmetros. O Olmo-core 3 é aberto e pode ser usado por pesquisadores e desenvolvedores. O Olmo-core 3 troca FSDP por DDP, ganha suporte a MXFP8 e permite treinamento parcial do modelo, medindo avanços na eficiência e escalabilidade de grandes modelos de linguagem. A tecnologia foi testada em até 512 GPUs, com uma modelagem de 1,2 trilhão de parâmetros e 58,36 bilhões de parâmetros ativos por token.
Preço e disponibilidade no Brasil não informados
- Preço do Olmo-core 3 não informado
Com informações de siliconangle.com, huggingface.co e ai.cnmo.com.
Fontes
Quer ver o resumer primeiro nas buscas do Google?
Adicionar às Fontes Preferidas do Google


