Em um teste resumindo documentos com Gemma 4 E4B, desligar o pensamento aumentou cinco vezes a velocidade e a qualidade do resultado foi praticamente a mesma. Para o Gemma 4 12B, a melhoria na velocidade foi oito vezes maior.

A forma como o pensamento afeta a codificação dependerá da complexidade da tarefa. Você pode querer testar algum trabalho do mundo real para ver se o tempo gasto “pensando” compensa com melhores resultados.

Executando modelos fora do catálogo Ollama

Uma das maiores fontes de LLMs de código aberto é o Hugging Face, e muitos modelos possuem um botão “usar este modelo” que fornece o comando necessário para fazer o download e executá-lo no Ollama. Esteja ciente de que nem todos esses modelos são tão plug-and-play quanto as versões otimizadas para Ollama no Ollama.com, especialmente os novos.

Por exemplo, tentei executar a versão quantizada de 2 bits do projeto Unsloth do novo Muse Glimmer do Meta. O comando foi

ollama run hf.co/unsloth/Muse-Glimmer-30B-GGUF:UD-Q2_K_XL

No entanto, isso errou imediatamente. ChatGPT me ajudou a corrigir o problema (com um Modelfile para criar uma versão modificada do LLM) depois que eu contei as mensagens de erro.

Fundição

O resultado final

Os LLMs locais já percorreram um longo caminho, mas um modelo que caiba dentro de um desktop ou laptop de consumo não será capaz de fazer o tipo de trabalho que os principais modelos baseados em nuvem podem. Gemma 4 12B pode escrever boas funções básicas e resumos de documentos, mas não espere que ele execute tarefas complicadas a partir de um único prompt, como “criar um pacote R para usar a API do Serviço Meteorológico Nacional”. Tal como acontece com os antigos LLMs de fronteira, você precisará seguir passo a passo, ser específico e ter um pouco de paciência. Se você nunca quiser voltar a esses dias, fique com os modelos de última geração na nuvem.

Gemma funciona bem para análise básica de dados, “importação, organização e visualização de dados” e “recuperação de informações e perguntas factuais curtas”, de acordo com a documentação da Posit AI. “Ele é menos confiável do que os modelos de Claude em tarefas mais longas e de várias etapas. Você pode ver uma resposta forte em um turno e uma leitura incorreta no próximo. Não recomendamos o Gemma 4 para codificação de agentes de longa execução ou desenvolvimento de pacotes complexos.”

Esse era praticamente o status dos LLMs pagos baseados em nuvem alguns anos atrás.

Mesmo que limitada em comparação com os modelos atuais de última geração, a ajuda de codificação gratuita que é 100% local e privada ainda pode ser atraente para casos de uso como explorar dados confidenciais, resumir documentos pessoais, realizar tarefas simples, trabalhar em um avião com Internet ruim e economizar tokens pagos para quando for importante. Além disso, pode ser fortalecedor ter tudo em seu próprio sistema.

E os recursos do modelo local provavelmente continuarão melhorando.