O máximo que consegui extrair da velocidade de saída do Bonsai foi cerca de 40 tokens por segundo; a média ficou entre 10 e 20. Desabilitar o pensamento aumentou a velocidade de produção e reduziu o tempo para o primeiro token (e o tempo geral de produção), mas às vezes isso acontecia às custas da precisão ou da coerência. Por exemplo, a pergunta de William Gibson funcionou melhor com reflexão. Pensando bem, recebi uma resposta escandalosamente falsa. (Não, William Gibson não escreveu Meridiano de Sangue; Cormac McCarthy fez.)

Os custos de reflexão também tiveram um grande impacto nas instruções relacionadas à codificação. A questão da modularidade do código, por exemplo, levou mais de seis minutos apenas na fase de reflexão, e a resposta real levou mais de dois minutos para ser gerada a 4,1 tokens por segundo. Pensando bem, os resultados vieram mais rapidamente (embora houvesse uma boa sobrecarga para tokenizar a entrada), e o Bonsai gerou uma resposta mais curta, mas ainda útil, de 7,7 tokens por segundo.

Uma capacidade intrigante do Bonsai 27B é a capacidade de usar modelos preliminares para decodificação especulativa, uma técnica para acelerar a geração de tokens. Isso é feito no lugar do uso da previsão de vários tokens, ou MTP. No entanto, a decodificação especulativa requer o carregamento do modelo principal e do modelo preliminar na memória da GPU, portanto, só é adequada para casos em que você tem muito VRAM para resolver o problema. (O MTP está integrado ao próprio modelo.) Minha configuração não tinha memória suficiente para usar a decodificação especulativa com o Bonsai.