Unsloth realizando fine-tuning de um modelo Llama local em uma GPU de desktop

Um artigo da XDA esta semana descrevia o treinamento de um LLM local em seus próprios erros. O autor reuniu as saídas incorretas do modelo, anotou manualmente algumas dúzias delas, as empacotou em um pequeno conjunto de dados e executou um fine-tuning leve. O resultado foi um modelo notavelmente melhor nos problemas exatos em que a versão base estava errando. O que costumava exigir um cluster alugado agora funciona em um laptop com uma GPU de 12 GB. Estes são os sete melhores aplicativos para fine-tuning de LLM local em desktop em 2026, todos gratuitos e de código aberto, classificados pela velocidade em que o primeiro fine-tuning realmente funciona.

O que procurar em um aplicativo de fine-tuning local

Comparação rápida

Aplicativo Melhor para Backend LoRA/QLoRA Apple Silicon Facilidade
Unsloth LoRA single-GPU mais rápido CUDA Sim Beta Altíssima
Axolotl Execuções de produção configuráveis CUDA (+ROCm) Sim Não Média
LLaMA-Factory Fine-tuning com web-UI CUDA (+ROCm) Sim Beta Alta
MLX-LM Fine-tuning em Apple Silicon MLX Sim Sim Alta
Torchtune Referência oficial do PyTorch CUDA Sim Limitado Média
Hugging Face TRL RLHF/DPO/PPO em cima de Transformers CUDA (+ROCm) Sim Não Média
LM Studio GUI tudo-em-um para inferência + workflows leves de fine-tuning CUDA/Metal Carregamento de adapter Sim Muito alta

1. Unsloth, Melhor para LoRA single-GPU mais rápido

Unsloth é a ferramenta que transformou “afinar um modelo 7B no seu laptop” de um artigo de pesquisa em um notebook Colab e um pip install. Em uma única RTX 4070 com 12 GB de VRAM, uma execução 7B QLoRA em contexto 2048 termina em cerca de 30 minutos para alguns centenas de exemplos. O truque matemático é um passo para frente-para trás eficiente em memória; o benefício prático é um fine-tuning que funciona enquanto você faz café.

Onde falha: O fine-tuning multi-GPU é segunda classe em relação ao Axolotl ou Torchtune. Algumas arquiteturas especializadas chegam mais tarde do que nas stacks de referência.

Preço: Grátis.

Plataformas: Linux (melhor), Windows (via WSL2), Apple Silicon (beta).

Baixar: unsloth.ai / github.com/unslothai/unsloth

Conclusão: A escolha padrão para o primeiro fine-tuning de qualquer pessoa com uma única GPU de consumidor.

2. Axolotl, Melhor para execuções de produção configuráveis

Axolotl é o que as equipes usam quando o caminho feliz do Unsloth não é suficiente. A abordagem baseada em arquivo de configuração torna as execuções reproduzíveis: um único arquivo YAML descreve o modelo base, o conjunto de dados, o posto LoRA, a taxa de aprendizado, a cadência de avaliação e o destino de exportação. Multi-GPU com DeepSpeed e FSDP funciona. A comunidade publicou dezenas de configs predefinidas para tarefas comuns.

Onde falha: A curva de aprendizado é mais íngreme do que a do Unsloth. A primeira execução significa ler um arquivo de configuração YAML e entender o que cada campo faz.

Preço: Grátis.

Plataformas: Linux, Windows via WSL2.

Baixar: github.com/axolotl-ai-cloud/axolotl

Conclusão: A ferramenta para usar depois que o primeiro fine-tuning do Unsloth funcionou e você quer mais controle.

3. LLaMA-Factory, Melhor para workflow de fine-tuning com web-UI

LLaMA-Factory envolve a mesma matemática que Axolotl e Unsloth atrás de uma web-UI. Carregue um modelo base, escolha um conjunto de dados de uma pasta local, ajuste um controle deslizante para posto LoRA e inicie a execução. As curvas de perda são renderizadas no navegador. Para alguém que não quer tocar em um terminal, é a coisa mais próxima de um aplicativo de fine-tuning de desktop amigável.

Onde falha: A web-UI não é um IDE completo. Pipelines complexos de vários estágios ainda querem uma config real. Nem todos os otimizadores são expostos na interface.

Preço: Grátis.

Plataformas: Linux, Windows via WSL2, macOS via Docker.

Baixar: github.com/hiyouga/LLaMA-Factory

Conclusão: A melhor opção se um workflow baseado em terminal o desanima.

4. MLX-LM, Melhor para fine-tuning em Apple Silicon

MLX-LM é a stack oficial de modelo de linguagem da Apple, construída na estrutura de arrays MLX. Em uma M2 Max ou M3 Max com 64 GB de memória unificada, um fine-tuning 7B LoRA funciona em velocidades competitivas com uma GPU NVIDIA de gama média. Em uma M2 Pro com 16 GB funciona para modelos menores. MLX-LM exporta diretamente para formato MLX para Ollama e os runtimes de inferência próprios da Apple.

Onde falha: Nem todo modelo base está disponível em formato MLX; a etapa de conversão de pesos Hugging Face adiciona fricção. O ecossistema é menor que a stack CUDA.

Preço: Grátis.

Plataformas: Apenas Apple Silicon macOS.

Baixar: github.com/ml-explore/mlx-lm

Conclusão: A ferramenta certa em um Mac. Nada mais usa Apple Silicon tão bem.

5. Torchtune, Melhor para a referência oficial do PyTorch

Torchtune é a biblioteca de fine-tuning própria do PyTorch, executada pela equipe da Meta. As receitas são Python legível, não um DSL de configuração, o que é adequado para engenheiros que querem ver e modificar o loop de treinamento. Suporte para fine-tuning completo, LoRA e DPO. Multi-GPU funciona pronto para uso. A documentação é de qualidade de engenharia.

Onde falha: Menos “baterias incluídas” do que Unsloth ou Axolotl. A postura de implementação de referência significa menos atalhos.

Preço: Grátis.

Plataformas: Linux, Windows via WSL2, macOS com recursos limitados.

Baixar: github.com/pytorch/torchtune

Conclusão: Escolha Torchtune se você já escreve PyTorch e quer ver o loop de treinamento.

6. Hugging Face TRL, Melhor para RLHF, DPO e modelagem de recompensa

TRL (Transformer Reinforcement Learning) é o toolkit para os passos de fine-tuning além do fine-tuning supervisionado simples: DPO (otimização de preferência direta), PPO (otimização de política proximal), treinamento de modelo de recompensa. No workflow “train on failures” da XDA, DPO é a técnica real que transformou as falhas anotadas em um modelo melhor. TRL é o que a executa.

Onde falha: Mais matemática para entender. RLHF/DPO pode dar errado de formas que SFT não pode; espere alguns testes falhos antes de clicar.

Preço: Grátis.

Plataformas: Linux, Windows via WSL2.

Baixar: github.com/huggingface/trl

Conclusão: A ferramenta para o segundo estágio de um pipeline de fine-tuning real “aprenda com seus erros”.

7. LM Studio, Melhor para GUI tudo-em-um de desktop

LM Studio não é principalmente um aplicativo de fine-tuning. É uma GUI de desktop para baixar, executar e conversar com modelos locais no Windows, macOS e Linux. Seu papel nesta lista é o polish que fornece em torno do workflow de fine-tuning: carregue um modelo base, carregue um adapter LoRA produzido por Unsloth ou Axolotl, converse com o modelo fine-tuned, itere. As versões de 2026 adicionaram wrappers de conveniência de fine-tuning leve que chamam Unsloth sob o capô.

Onde falha: O lado do treinamento é fino. LM Studio é um chat e frontend de inferência; use-o para a metade de inferência do loop, não a metade de treinamento.

Preço: Grátis.

Plataformas: Windows, macOS, Linux.

Baixar: lmstudio.ai

Conclusão: Escolha LM Studio como o lado de inferência do loop de fine-tuning, não o lado de treinamento.

Como escolher o certo

Combine qualquer ferramenta de treinamento que escolher com LM Studio para testar o adapter resultante localmente antes de enviá-lo para uma stack de inferência.

FAQ

Qual é a GPU mínima para afinar um modelo 7B?

QLoRA em contexto 2048 cabe em 8 GB de VRAM para as menores variantes 7B e 12 GB confortavelmente. 8 GB funciona para contextos mais curtos e postos menores; 24 GB abre 13B QLoRA.

Podemos afinar sem GPU?

Tecnicamente sim, na CPU, mas é muito lento para ser prático. Aluguel de nuvem por algumas horas geralmente é mais barato do que a eletricidade para executar um fine-tuning de CPU até completar.

Que formato de dados essas ferramentas aceitam?

JSON Lines com campos instruction e output (estilo Alpaca) é o padrão universal. A maioria das ferramentas também aceita formato ShareGPT e formato de mensagens de chat do OpenAI.

Os modelos afinados funcionam em Ollama, LM Studio ou llama.cpp?

Sim, após exportar para GGUF (para llama.cpp e Ollama) ou MLX (para a stack Apple). Cada ferramenta acima exporta para pelo menos um desses formatos.

Apenas para modelos cuja licença permite. Llama 3 e 4, modelos Mistral, Qwen, Gemma e todos os modelos open-weight nesta lista permitem fine-tuning sob suas licenças. Modelos fechados (classe GPT-4) não têm pesos baixáveis, então fine-tuning local não é possível.