AllenAI lança Olmo-core 3, uma nova infraestrutura de treinamento para modelos de linguagem grandes. O sistema escala até trilhões de parâmetros e usa DDP em vez de FSDP. A tecnologia está disponível no GitHub.

A tecnologia aumenta a throughput em 2,7x em testes com 47 bilhões de parâmetros. Suporta MXFP8, reduzindo a memória ativa de 103 GiB para 95 GiB e aumentando a throughput em 21%. Permite que apenas uma parte do modelo seja ativada durante o treinamento, reduzindo custos computacionais. O Olmo-core 3 processa 52.000 tokens por segundo em GPUs B3000, 2,7 vezes mais rápido que a arquitetura Megatron-core da Nvidia. A disponibilidade aberta reforça a abordagem colaborativa do projeto.

Testes mostram que o sistema escala até trilhões de parâmetros, mantendo a performance. A modelagem em até 512 GPUs permite treinar modelos de 1,2 trilhão de parâmetros. O Olmo-core 3 é aberto e pode ser usado por pesquisadores e desenvolvedores. O Olmo-core 3 troca FSDP por DDP, ganha suporte a MXFP8 e permite treinamento parcial do modelo, medindo avanços na eficiência e escalabilidade de grandes modelos de linguagem. A tecnologia foi testada em até 512 GPUs, com uma modelagem de 1,2 trilhão de parâmetros e 58,36 bilhões de parâmetros ativos por token.

Preço e disponibilidade no Brasil não informados

  • Preço do Olmo-core 3 não informado

Com informações de siliconangle.com, huggingface.co e ai.cnmo.com.

Fontes

  1. Ai2 releases olmo core 3 to make developing large mixture of experts llms more efficientsiliconangle.com
  2. huggingface.co
  3. ai.cnmo.com
  4. Infrastructure for large scale ai model training on dedicated gpu clustersmedium.com
  5. Markdown default language search data ai modelsthenextweb.com

Quer ver o resumer primeiro nas buscas do Google?

Adicionar às Fontes Preferidas do Google