Família de modelos de peso aberto Google Gemma

A família Gemma do Google é um bom ponto de equilíbrio para laptops. Um checkpoint 4B cabe confortavelmente em 8GB de VRAM, a licença é permissiva o suficiente para ferramentas internas, e o Ollama baixa os pesos em um comando. Também não é o único modelo pequeno com peso aberto que funciona bem em um desktop modesto. Desde que Gemma 3 chegou, testamos seis outras famílias no mesmo laptop de 16GB e em um desktop de 24GB, e várias delas superam Gemma em tarefas que importam para nós. Abaixo estão as alternativas ao Gemma que deixamos instaladas.

Comparação rápida

Família de modelos Melhor para Plano gratuito Licença Recurso destacado
Llama 3 (Meta) Chat geral, uso de ferramentas Sim, pesos no Hugging Face Licença comunitária Meta Suporte de ferramentas e quantização mais amplo
Qwen 3 (Alibaba) Raciocínio multilíngue Sim Apache 2.0 Modo de pensamento integrado que você pode ativar
Phi-4 (Microsoft) Laptops de 8GB Sim MIT Melhor raciocínio de modelo pequeno por gigabyte
Mistral 7B / Nemo Código e chat rápido Sim Apache 2.0 Chamadas de função prontas para uso
DeepSeek V3 / R1 distills Matemática, código, cadeias de pensamento Sim MIT (distills) Tags <think> explícitas
IBM Granite 3.3 Rascunhos seguros para empresas Sim Apache 2.0 Forte em extração estruturada
SmolLM 3 Raspberry Pi e laptops antigos Sim Apache 2.0 Modelo 3B que funciona abaixo de 4GB de RAM

Por que as pessoas procuram alternativas ao Gemma

Gemma 3 é capaz, mas algumas lacunas reais nos empurram para outras famílias de modelos:

As alternativas

Llama 3 (Meta) - Melhor para o ecossistema mais amplo

Llama 3 é o modelo local padrão para a maioria das pessoas que hospedam sua própria IA, e o motivo é chato: cada executor o suporta, cada formato de quantização o direciona primeiro, e cada comunidade fine-tune escreve para ele. O modelo 8B funciona no mesmo laptop de 16GB onde Gemma 4B cabe, com um pouco mais de espaço de RAM, e o modelo 70B escala até GPUs de estação de trabalho.

Onde ele fica aquém: a licença comunitária Meta tem restrições de uso que Apache 2.0 não tem. A qualidade multilíngue fica atrás de Qwen 3.

Preços:

Migração do Gemma: ollama pull llama3.1:8b e troque o nome do modelo na sua configuração Open WebUI ou LM Studio. Os prompts portam-se bem. Os modelos de chat diferem, então reexecute quaisquer prompts do sistema uma vez.

Download: ollama.com/library/llama3.1

Resumo: escolha Llama 3 quando a amplitude das ferramentas é mais importante que benchmarks brutos. Pule se você precisar de Apache 2.0.

Qwen 3 (Alibaba) - Melhor como padrão versátil

Qwen 3 se tornou a recomendação de uso geral mais segura para uso local. A família cobre checkpoints densos de 0,6B a 32B, mais uma variante MoE de 30B e 235B, para que você possa escolher por VRAM e alternar entre checkpoints sem alterar seu estilo de prompt. A qualidade do raciocínio em matemática e código supera Gemma com o mesmo número de parâmetros, e há um modo de pensamento apropriado que você pode ativar no momento da inferência.

Onde ele fica aquém: as cláusulas de licença da Alibaba sobre limites de contagem de usuários irritam algumas empresas. As variantes MoE precisam de um executor que suporte mixture-of-experts, e nem todo aplicativo de desktop lida bem com isso.

Preços:

Migração do Gemma: fluxo Ollama idêntico. Se você usar as heurísticas de prompt do sistema integradas do Gemma, Qwen aceita as mesmas instruções. Ative o modo de pensamento com /set think na CLI.

Download: ollama.com/library/qwen3

Resumo: o modelo que sugerimos a qualquer pessoa que pergunta “o que devo executar localmente” sem mais contexto.

Phi-4 (Microsoft) - Melhor para hardware fraco

Phi-4 e seu irmão Phi-4-mini visam máquinas pequenas. O modelo 14B se sobressai em benchmarks de raciocínio, e Phi-4-mini com 3,8B funciona em 8GB de RAM sem GPU. Microsoft licencia tudo sob MIT, então se encaixa em projetos comerciais sem papelada.

Onde ele fica aquém: o chat geral parece mais seco que Llama ou Qwen, e a escrita criativa é fraca. Não é o modelo a usar para cópia de marketing ou narrativa.

Preços:

Migração do Gemma: substituição direta. A janela de contexto de Phi-4-mini é menor (128k no modelo completo, 32k em mini), então audite prompts de documentos longos primeiro.

Download: ollama.com/library/phi4

Resumo: escolha Phi-4-mini para laptops antigos e Phi-4 quando a qualidade do raciocínio é mais importante que a personalidade.

Mistral 7B e Mistral Nemo - Melhor para código e chamadas de função

Mistral 7B permanece nítido, e o modelo Nemo 12B mais recente que Mistral construiu com NVIDIA é a família a que recorremos quando queremos conclusão de código rápida e chamadas de função confiáveis. O uso de ferramentas de Nemo funcionou na primeira tentativa em cada executor de desktop que testamos. Apache 2.0, sem condições.

Onde ele fica aquém: os modelos base são menos conversadores que Llama 3, e as saídas podem parecer concisas. Modelos Mistral maiores e mais novos estão protegidos por sua API comercial.

Preços:

Migração do Gemma: pull do Ollama, ajuste o modelo de chat para o formato [INST] de Mistral. Se você usar Gemma para agentes de chamada de ferramenta, Nemo será uma atualização na primeira vez que executar.

Download: mistral.ai

Resumo: a alternativa quando o suporte de ferramentas do Gemma o decepcionou.

DeepSeek V3 e R1 distills - Melhor para raciocínio

DeepSeek oferece duas famílias que vale a pena conhecer: V3, um modelo MoE geral forte, e os distills R1 que fine-tune bases Llama e Qwen em máquinas de pensamento. Os distills R1 expõem sua cadeia de pensamento dentro de tags <think>, que é o que o escritor de XDA quis dizer com “um LLM local que realmente pensa antes de responder.” Em problemas de palavras matemáticas e mudanças de código de várias etapas, os distills R1 frequentemente superam Gemma 3 27B enquanto funcionam em menos VRAM.

Onde ele fica aquém: o modo de pensamento consome tokens, o que desacelera a latência do primeiro token e consome contexto. O modelo MoE V3 é pesado para a maioria dos desktops.

Preços:

Migração do Gemma: puxe deepseek-r1:14b e solicite exatamente como faria com Gemma. Filtre tags <think> de sua interface se os usuários finais não devem vê-las.

Download: ollama.com/library/deepseek-r1

Resumo: a escolha orientada para o raciocínio.

IBM Granite 3.3 - Melhor para extração estruturada

IBM Granite é silencioso, sem brilho, e muito bom no trabalho corporativo que a maioria dos LLMs locais são realmente usados para: extrair campos de documentos, rascunhar e-mails, classificar tickets. Licença Apache 2.0, ferramentas Watsonx no lado empresarial, e o modelo 8B funciona ao lado de Gemma no mesmo hardware.

Onde ele fica aquém: o tom de conversação é rígido. Tarefas criativas parecem um memorando legal.

Preços:

Migração do Gemma: substituição direta. Se você usar Gemma com um wrapper de prompt em modo JSON, Granite o respeita com mais confiabilidade.

Download: ollama.com/library/granite3.3

Resumo: a resposta chata correta para pipelines de extração e classificação.

SmolLM 3 - Melhor para laptops antigos e computadores de placa única

SmolLM 3 do Hugging Face é um modelo 3B projetado para funcionar em hardware minúsculo. Cabe abaixo de 4GB de RAM, é inicializado em um Raspberry Pi 5 e realiza uma conversa coerente. Não vai superar Gemma 4B em raciocínio, mas continuará funcionando em uma máquina onde Gemma faria swap para disco.

Onde ele fica aquém: a data limite de conhecimento é mais antiga, e o recall de contexto longo é mais fraco.

Preços:

Migração do Gemma: puxe via Ollama ou execute via llama.cpp diretamente. Espere refazer qualquer prompt que assuma a data limite de conhecimento específica do Gemma.

Download: huggingface.co/HuggingFaceTB/SmolLM3-3B

Resumo: o fallback quando a máquina não consegue lidar com nada maior.

Como escolher

Escolha por memória primeiro, tarefa segundo.

FAQ

Qual é uma boa alternativa ao Gemma para um laptop de 16GB? Qwen 3 8B ou Phi-4-mini ambos cabem e ambos superam Gemma 3 4B em raciocínio geral. Qwen 3 vence em trabalho multilíngue, Phi vence em matemática.

DeepSeek R1 é melhor que Gemma para codificação? Para tarefas de debug em várias etapas e refatoração, o distill R1 em 14B geralmente supera Gemma 3 27B, principalmente porque a cadeia de pensamento ajuda a capturar casos extremos perdidos.

Posso executar Llama 3 ao lado de Gemma no Ollama? Sim. O Ollama alterna modelos sob demanda. Puxe ambos, alterne por nome na CLI ou em Open WebUI.

Qual LLM local leve tem a licença mais permissiva? Qwen 3, Mistral 7B, IBM Granite e SmolLM 3 todos vêm sob Apache 2.0. Phi-4 e distills DeepSeek R1 são MIT.

Existe uma alternativa ao Gemma com modo de pensamento incorporado? Qwen 3 tem um toggle de pensamento explícito, e os distills DeepSeek R1 envolvem raciocínio em tags <think>. Gemma 3 não expõe nenhum dos dois.