PrismML lança Ternary Bonsai 2 27B, versão compactada do Qwen3.8 27B. Modelo ocupa 5,9 GB e mantém 98,2% do desempenho original.

Foi reduzido usando quantização de 3-valores, permitindo que execute em dispositivos móveis. Suporta contexto de 262K tokens e oferece velocidade de inferência de até 143 tok/s no RTX 5090.

Pode rodar em navegador com WebGPU, usando menos de 6 GB de memória. Lançado em 18 de setembro de 2026, é compatível com NVIDIA e Apple. A versão é uma alternativa mais eficiente, permitindo modelos grandes em laptops.

A empresa destacou a redução de tamanho sem comprometer desempenho. A versão é compatível com dispositivos que antes não suportavam modelos tão grandes. O modelo foi desenvolvido pela PrismML como alternativa mais eficiente em termos de memória e desempenho.

O Ternary Bonsai 2 27B roda em navegadores usando WebGPU, com menos de 6 GB de memória. Isso permite usar o modelo em dispositivos com menos recursos. A compatibilidade com NVIDIA e Apple abre mais opções de hardware.

A velocidade de inferência de até 143 tok/s no RTX 5090 faz com que respostas cheguem mais rápido. Mas o modelo também funciona no M5 Max, com 47 tok/s, o que ainda é eficiente para tarefas comuns. A redução para 5,9 GB, usando quantização de 3-valores, mantém a performance do modelo original.

Isso significa que a experiência não sofre, mesmo com o tamanho reduzido. A versão compactada é. O modelo suporta contexto de 262K tokens, permitindo conversas longas e processamento de textos complexos. Isso é útil para tarefas como resumos, análise de dados ou criação de conteúdo.

A versão compactada do modelo é uma evolução do Bonsai 27B, que já tinha reduzido o Qwen3.6 27B para 53,8 GB. A empresa já havia mostrado a capacidade de compressão em modelos anteriores, mas a nova versão é mais eficiente.

A redução de tamanho sem perda de desempenho abre espaço para execução em dispositivos móveis e laptops. A versão anterior, Bonsai 27B, já tinha feito isso com o Qwen3.6 27B, mas a nova atualização traz melhorias em inferência e performance. A tecnologia de quantização trival é a chave para essa compactação.

A tecnologia de quantização trival permite que o modelo mantenha sua eficácia mesmo com tamanho reduzido. A versão anterior, Bonsai 27B, já demonstrava essa capacidade com o Qwen3.6 27B, mas a nova atualização eleva a eficiência.

A compatibilidade com WebGPU é a chave para essa flexibilidade.

O modelo roda em dispositivos com limitação de memória. A redução de tamanho não compromete a capacidade de processamento. A nova versão foi lançada em 18 de setembro de 2026.

A compatibilidade com NVIDIA e Apple amplia a versatilidade do modelo. A redução de 27 bilhões de parâmetros para 5,9 GB facilita o uso em dispositivos menos potentes.

Ficha técnica

Ficha técnica
ItemEspecificação
Velocidade de inferênciaaté 143 tok/s no RTX 5090; outra fonte: até 47 tok/s no M5 Max

Preço e disponibilidade no Brasil não informados

  • Preço e data no Brasil não informados

Fontes

  1. gigazine.net
  2. pc.watch.impress.co.jp
  3. ithome.com
  4. What is bonsai 2 why a 27b model now fits on the laptop you already ownmedium.com
  5. techmeme.com
  6. byteshape.com

Produtos relacionados · link de afiliado