PrismML lança Ternary Bonsai 2 27B, versão compactada do Qwen3.8 27B. Modelo ocupa 5,9 GB e mantém 98,2% do desempenho original.
Foi reduzido usando quantização de 3-valores, permitindo que execute em dispositivos móveis. Suporta contexto de 262K tokens e oferece velocidade de inferência de até 143 tok/s no RTX 5090.
Pode rodar em navegador com WebGPU, usando menos de 6 GB de memória. Lançado em 18 de setembro de 2026, é compatível com NVIDIA e Apple. A versão é uma alternativa mais eficiente, permitindo modelos grandes em laptops.
A empresa destacou a redução de tamanho sem comprometer desempenho. A versão é compatível com dispositivos que antes não suportavam modelos tão grandes. O modelo foi desenvolvido pela PrismML como alternativa mais eficiente em termos de memória e desempenho.
O Ternary Bonsai 2 27B roda em navegadores usando WebGPU, com menos de 6 GB de memória. Isso permite usar o modelo em dispositivos com menos recursos. A compatibilidade com NVIDIA e Apple abre mais opções de hardware.
A velocidade de inferência de até 143 tok/s no RTX 5090 faz com que respostas cheguem mais rápido. Mas o modelo também funciona no M5 Max, com 47 tok/s, o que ainda é eficiente para tarefas comuns. A redução para 5,9 GB, usando quantização de 3-valores, mantém a performance do modelo original.
Isso significa que a experiência não sofre, mesmo com o tamanho reduzido. A versão compactada é. O modelo suporta contexto de 262K tokens, permitindo conversas longas e processamento de textos complexos. Isso é útil para tarefas como resumos, análise de dados ou criação de conteúdo.
A versão compactada do modelo é uma evolução do Bonsai 27B, que já tinha reduzido o Qwen3.6 27B para 53,8 GB. A empresa já havia mostrado a capacidade de compressão em modelos anteriores, mas a nova versão é mais eficiente.
A redução de tamanho sem perda de desempenho abre espaço para execução em dispositivos móveis e laptops. A versão anterior, Bonsai 27B, já tinha feito isso com o Qwen3.6 27B, mas a nova atualização traz melhorias em inferência e performance. A tecnologia de quantização trival é a chave para essa compactação.
A tecnologia de quantização trival permite que o modelo mantenha sua eficácia mesmo com tamanho reduzido. A versão anterior, Bonsai 27B, já demonstrava essa capacidade com o Qwen3.6 27B, mas a nova atualização eleva a eficiência.
A compatibilidade com WebGPU é a chave para essa flexibilidade.
O modelo roda em dispositivos com limitação de memória. A redução de tamanho não compromete a capacidade de processamento. A nova versão foi lançada em 18 de setembro de 2026.
A compatibilidade com NVIDIA e Apple amplia a versatilidade do modelo. A redução de 27 bilhões de parâmetros para 5,9 GB facilita o uso em dispositivos menos potentes.
Ficha técnica
| Item | Especificação |
|---|---|
| Velocidade de inferência | até 143 tok/s no RTX 5090; outra fonte: até 47 tok/s no M5 Max |
Preço e disponibilidade no Brasil não informados
- Preço e data no Brasil não informados
Mais imagens

Fontes
Produtos relacionados · link de afiliado



