Modelo ternário Bonsai 1.7B roda a 442 tokens/s em M4 Max
A demonstração de um modelo de 1,7 bilhão de parâmetros com pesos ternários rodando a altíssima velocidade em hardware Apple mostra que inferência local de alta performance está cada vez mais viável. Para startups latinas com restrições de custo de GPU na nuvem, modelos compactos e rápidos são um caminho estratégico.


