Um artigo da XDA esta semana descrevia o treinamento de um LLM local em seus próprios erros. O autor reuniu as saídas incorretas do modelo, anotou manualmente algumas dúzias delas, as empacotou em um pequeno conjunto de dados e executou um fine-tuning leve. O resultado foi um modelo notavelmente melhor nos problemas exatos em que a versão base estava errando. O que costumava exigir um cluster alugado agora funciona em um laptop com uma GPU de 12 GB. Estes são os sete melhores aplicativos para fine-tuning de LLM local em desktop em 2026, todos gratuitos e de código aberto, classificados pela velocidade em que o primeiro fine-tuning realmente funciona.
O que procurar em um aplicativo de fine-tuning local
- Suporte a LoRA e QLoRA. O fine-tuning completo é limitado pelo hardware. Adaptadores de baixo posto (LoRA) e LoRA quantizado de 4 bits (QLoRA) são a única forma realista de afinar um modelo 7B ou 13B em GPUs de consumidor.
- Executa no hardware que você tem. NVIDIA CUDA é o padrão; ROCm em AMD é segunda classe. Apple Silicon (série M) tem seu próprio caminho através do MLX. Um aplicativo de “fine-tune” é apenas útil se funcionar em sua GPU ou NPU.
- Um formato de conjunto de dados que não é assustador. JSON Lines com campos
instructioneoutputé o padrão moderno. Se o aplicativo quer um formato binário personalizado, será complicado. - Avaliação e checkpointing. O fine-tuning pode dar errado. Uma ferramenta que cria snapshots a cada N etapas e mostra curvas de perda permite que você volte de uma execução ruim antes de queimar o fim de semana.
- Exportação para GGUF ou MLX. Após o fine-tuning, o modelo precisa ser carregado em uma stack de inferência. GGUF para llama.cpp; MLX para Apple. Se a ferramenta bloquear os pesos em seu próprio formato, você não poderá usar o resultado.
Comparação rápida
| Aplicativo | Melhor para | Backend | LoRA/QLoRA | Apple Silicon | Facilidade |
|---|---|---|---|---|---|
| Unsloth | LoRA single-GPU mais rápido | CUDA | Sim | Beta | Altíssima |
| Axolotl | Execuções de produção configuráveis | CUDA (+ROCm) | Sim | Não | Média |
| LLaMA-Factory | Fine-tuning com web-UI | CUDA (+ROCm) | Sim | Beta | Alta |
| MLX-LM | Fine-tuning em Apple Silicon | MLX | Sim | Sim | Alta |
| Torchtune | Referência oficial do PyTorch | CUDA | Sim | Limitado | Média |
| Hugging Face TRL | RLHF/DPO/PPO em cima de Transformers | CUDA (+ROCm) | Sim | Não | Média |
| LM Studio | GUI tudo-em-um para inferência + workflows leves de fine-tuning | CUDA/Metal | Carregamento de adapter | Sim | Muito alta |
1. Unsloth, Melhor para LoRA single-GPU mais rápido
Unsloth é a ferramenta que transformou “afinar um modelo 7B no seu laptop” de um artigo de pesquisa em um notebook Colab e um pip install. Em uma única RTX 4070 com 12 GB de VRAM, uma execução 7B QLoRA em contexto 2048 termina em cerca de 30 minutos para alguns centenas de exemplos. O truque matemático é um passo para frente-para trás eficiente em memória; o benefício prático é um fine-tuning que funciona enquanto você faz café.
Onde falha: O fine-tuning multi-GPU é segunda classe em relação ao Axolotl ou Torchtune. Algumas arquiteturas especializadas chegam mais tarde do que nas stacks de referência.
Preço: Grátis.
Plataformas: Linux (melhor), Windows (via WSL2), Apple Silicon (beta).
Baixar: unsloth.ai / github.com/unslothai/unsloth
Conclusão: A escolha padrão para o primeiro fine-tuning de qualquer pessoa com uma única GPU de consumidor.
2. Axolotl, Melhor para execuções de produção configuráveis
Axolotl é o que as equipes usam quando o caminho feliz do Unsloth não é suficiente. A abordagem baseada em arquivo de configuração torna as execuções reproduzíveis: um único arquivo YAML descreve o modelo base, o conjunto de dados, o posto LoRA, a taxa de aprendizado, a cadência de avaliação e o destino de exportação. Multi-GPU com DeepSpeed e FSDP funciona. A comunidade publicou dezenas de configs predefinidas para tarefas comuns.
Onde falha: A curva de aprendizado é mais íngreme do que a do Unsloth. A primeira execução significa ler um arquivo de configuração YAML e entender o que cada campo faz.
Preço: Grátis.
Plataformas: Linux, Windows via WSL2.
Baixar: github.com/axolotl-ai-cloud/axolotl
Conclusão: A ferramenta para usar depois que o primeiro fine-tuning do Unsloth funcionou e você quer mais controle.
3. LLaMA-Factory, Melhor para workflow de fine-tuning com web-UI
LLaMA-Factory envolve a mesma matemática que Axolotl e Unsloth atrás de uma web-UI. Carregue um modelo base, escolha um conjunto de dados de uma pasta local, ajuste um controle deslizante para posto LoRA e inicie a execução. As curvas de perda são renderizadas no navegador. Para alguém que não quer tocar em um terminal, é a coisa mais próxima de um aplicativo de fine-tuning de desktop amigável.
Onde falha: A web-UI não é um IDE completo. Pipelines complexos de vários estágios ainda querem uma config real. Nem todos os otimizadores são expostos na interface.
Preço: Grátis.
Plataformas: Linux, Windows via WSL2, macOS via Docker.
Baixar: github.com/hiyouga/LLaMA-Factory
Conclusão: A melhor opção se um workflow baseado em terminal o desanima.
4. MLX-LM, Melhor para fine-tuning em Apple Silicon
MLX-LM é a stack oficial de modelo de linguagem da Apple, construída na estrutura de arrays MLX. Em uma M2 Max ou M3 Max com 64 GB de memória unificada, um fine-tuning 7B LoRA funciona em velocidades competitivas com uma GPU NVIDIA de gama média. Em uma M2 Pro com 16 GB funciona para modelos menores. MLX-LM exporta diretamente para formato MLX para Ollama e os runtimes de inferência próprios da Apple.
Onde falha: Nem todo modelo base está disponível em formato MLX; a etapa de conversão de pesos Hugging Face adiciona fricção. O ecossistema é menor que a stack CUDA.
Preço: Grátis.
Plataformas: Apenas Apple Silicon macOS.
Baixar: github.com/ml-explore/mlx-lm
Conclusão: A ferramenta certa em um Mac. Nada mais usa Apple Silicon tão bem.
5. Torchtune, Melhor para a referência oficial do PyTorch
Torchtune é a biblioteca de fine-tuning própria do PyTorch, executada pela equipe da Meta. As receitas são Python legível, não um DSL de configuração, o que é adequado para engenheiros que querem ver e modificar o loop de treinamento. Suporte para fine-tuning completo, LoRA e DPO. Multi-GPU funciona pronto para uso. A documentação é de qualidade de engenharia.
Onde falha: Menos “baterias incluídas” do que Unsloth ou Axolotl. A postura de implementação de referência significa menos atalhos.
Preço: Grátis.
Plataformas: Linux, Windows via WSL2, macOS com recursos limitados.
Baixar: github.com/pytorch/torchtune
Conclusão: Escolha Torchtune se você já escreve PyTorch e quer ver o loop de treinamento.
6. Hugging Face TRL, Melhor para RLHF, DPO e modelagem de recompensa
TRL (Transformer Reinforcement Learning) é o toolkit para os passos de fine-tuning além do fine-tuning supervisionado simples: DPO (otimização de preferência direta), PPO (otimização de política proximal), treinamento de modelo de recompensa. No workflow “train on failures” da XDA, DPO é a técnica real que transformou as falhas anotadas em um modelo melhor. TRL é o que a executa.
Onde falha: Mais matemática para entender. RLHF/DPO pode dar errado de formas que SFT não pode; espere alguns testes falhos antes de clicar.
Preço: Grátis.
Plataformas: Linux, Windows via WSL2.
Baixar: github.com/huggingface/trl
Conclusão: A ferramenta para o segundo estágio de um pipeline de fine-tuning real “aprenda com seus erros”.
7. LM Studio, Melhor para GUI tudo-em-um de desktop
LM Studio não é principalmente um aplicativo de fine-tuning. É uma GUI de desktop para baixar, executar e conversar com modelos locais no Windows, macOS e Linux. Seu papel nesta lista é o polish que fornece em torno do workflow de fine-tuning: carregue um modelo base, carregue um adapter LoRA produzido por Unsloth ou Axolotl, converse com o modelo fine-tuned, itere. As versões de 2026 adicionaram wrappers de conveniência de fine-tuning leve que chamam Unsloth sob o capô.
Onde falha: O lado do treinamento é fino. LM Studio é um chat e frontend de inferência; use-o para a metade de inferência do loop, não a metade de treinamento.
Preço: Grátis.
Plataformas: Windows, macOS, Linux.
Baixar: lmstudio.ai
Conclusão: Escolha LM Studio como o lado de inferência do loop de fine-tuning, não o lado de treinamento.
Como escolher o certo
- Nunca afinado um modelo, tem uma única GPU NVIDIA: Unsloth. Siga primeiro o notebook QLoRA.
- Em um Mac com Apple Silicon: MLX-LM. Nada mais usa o hardware assim.
- Quer web-UI e sem terminal: LLaMA-Factory.
- Construindo um pipeline reproduzível para uma equipe: Axolotl com configs YAML em Git.
- Fazendo o workflow XDA “train on failures”: Unsloth para o SFT inicial, depois TRL para DPO nas falhas anotadas.
- Quer ver o loop de treinamento em PyTorch simples: Torchtune.
Combine qualquer ferramenta de treinamento que escolher com LM Studio para testar o adapter resultante localmente antes de enviá-lo para uma stack de inferência.
FAQ
Qual é a GPU mínima para afinar um modelo 7B?
QLoRA em contexto 2048 cabe em 8 GB de VRAM para as menores variantes 7B e 12 GB confortavelmente. 8 GB funciona para contextos mais curtos e postos menores; 24 GB abre 13B QLoRA.
Podemos afinar sem GPU?
Tecnicamente sim, na CPU, mas é muito lento para ser prático. Aluguel de nuvem por algumas horas geralmente é mais barato do que a eletricidade para executar um fine-tuning de CPU até completar.
Que formato de dados essas ferramentas aceitam?
JSON Lines com campos instruction e output (estilo Alpaca) é o padrão universal. A maioria das ferramentas também aceita formato ShareGPT e formato de mensagens de chat do OpenAI.
Os modelos afinados funcionam em Ollama, LM Studio ou llama.cpp?
Sim, após exportar para GGUF (para llama.cpp e Ollama) ou MLX (para a stack Apple). Cada ferramenta acima exporta para pelo menos um desses formatos.
É legal o fine-tuning para pesos de modelo fechado?
Apenas para modelos cuja licença permite. Llama 3 e 4, modelos Mistral, Qwen, Gemma e todos os modelos open-weight nesta lista permitem fine-tuning sob suas licenças. Modelos fechados (classe GPT-4) não têm pesos baixáveis, então fine-tuning local não é possível.