LM Studio e Ollama tornaram a execução de LLMs locais uma coisa de um clique. Fine-tuning permaneceu um trabalho de data center por anos, fora de alcance no mesmo hardware. Isso finalmente está mudando. O novo aplicativo desktop do Unsloth é o sinal visível, mas um pequeno grupo de frameworks abertos agora treina um adaptador LoRA real em uma única GPU de consumidor de 12 GB ou 24 GB no espaço de uma tarde.
Testamos sete ferramentas em uma RTX 4070, uma RTX 4090 e um Mac M2 Pro base. As escolhas abaixo são as que completaram uma execução LoRA Llama 3.1 8B ou Mistral 7B sem ficar sem memória, sem precisar de um cluster e sem pedir que você escreva um loop de treinamento em PyTorch primeiro. A lista mistura ferramentas com prioridade de GUI com frameworks com prioridade de CLI para que você possa escolher o nível ergonômico que deseja.
O que procurar em um fine-tuner de GPU de consumidor
- Suporte LoRA e QLoRA, para que um modelo 7B treine em 12 GB e um 13B em 24 GB.
- Carregamento quantizado de 4-bit e 8-bit, que é a razão pela qual tudo isso cabe.
- Flash Attention ou um kernel equivalente para que a velocidade de treinamento não despenque.
- Suporte para as famílias de modelos que você realmente se importa: Llama, Mistral, Qwen, Gemma, Phi.
- Formatos de conjunto de dados fáceis de preparar, idealmente JSONL com campos instruction/output.
- Checkpointing para que um travamento na hora quatro não custe a execução inteira.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Plano gratuito | Preço inicial/mês | Licença |
|---|---|---|---|---|---|
| Unsloth | LoRA mais rápido em 12–24 GB | Windows, Linux | Aplicativo completo | Gratuito (Pro tier) | Apache 2.0 |
| Axolotl | Usuário avançado de arquivo de configuração | Linux | Aplicativo completo | Gratuito | Apache 2.0 |
| LLaMA-Factory | Baseado em GUI, suporte amplo de modelos | Windows, Linux | Aplicativo completo | Gratuito | Apache 2.0 |
| Text Generation WebUI | Anexe LoRA e teste no local | Windows, macOS, Linux | Aplicativo completo | Gratuito | AGPLv3 |
| PEFT | Biblioteca para seu próprio loop de treinamento | Windows, macOS, Linux | Aplicativo completo | Gratuito | Apache 2.0 |
| H2O LLM Studio | UI corporativa com rastreamento de experimentos | Windows, Linux | Gratuito (código aberto) | Suporte Enterprise | Apache 2.0 |
| MLX-LM | Fine-tuning nativo no Apple Silicon | macOS | Aplicativo completo | Gratuito | MIT |
Os aplicativos
1. Unsloth, melhor LoRA mais rápido em 12–24 GB
Unsloth reescreve os caminhos críticos do fine-tuning de Llama, Mistral, Qwen, Gemma e Phi para ser aproximadamente duas a cinco vezes mais rápido e cerca de metade da memória do Transformers padrão. Um LoRA 7B cabe em uma única GPU de 12 GB e termina em um conjunto de dados modesto em uma tarde. O novo aplicativo desktop remove a última etapa CLI para receitas comuns.
Onde fica aquém: a cobertura se inclina em direção às famílias de modelos mais populares; arquiteturas obscuras precisam do caminho Transformers upstream.
Preços:
- Gratuito: Framework completo e aplicativo desktop.
- Pago: Pro tier para suporte empresarial e kernels multi-GPU mais rápidos.
Plataformas: Windows (via WSL2), Linux.
Baixar: unsloth.ai · GitHub
Conclusão: A escolha padrão em 2026 para treinamento LoRA em uma única placa de consumidor.
2. Axolotl, melhor usuário avançado de arquivo de configuração
Axolotl é um framework de treinamento baseado em configuração construído em torno do Hugging Face. Um único arquivo YAML descreve o modelo, conjunto de dados, rank LoRA e argumentos de treinamento, e Axolotl cuida do resto. Ele suporta menos otimizações de velocidade do que Unsloth, mas vence em flexibilidade em modelos menos comuns e formatos de conjunto de dados.
Onde fica aquém: sem GUI; a configuração tem uma curva de aprendizado; a documentação assume que você já treinou algo.
Preços:
- Gratuito: Aplicativo completo.
- Pago: Não aplicável.
Plataformas: Linux (Docker em macOS/Windows).
Baixar: GitHub (axolotl-ai-cloud/axolotl)
Conclusão: A escolha certa quando Unsloth não tem seu modelo e você ainda deseja um pipeline sensato.
3. LLaMA-Factory, melhor treinador baseado em GUI
LLaMA-Factory fornece uma GUI baseada em Gradio sobre um amplo kit de ferramentas de treinamento. Escolha um modelo, carregue um conjunto de dados, defina o rank LoRA e a taxa de aprendizado, e inicie. Ele cobre 100+ famílias de modelos prontas para uso e seus gráficos tornam o ajuste de hiperparâmetros acessível.
Onde fica aquém: a GUI oculta algumas das escolhas mais difíceis; em casos extremos de VRAM, ela precisa da CLI mesmo assim.
Preços:
- Gratuito: Aplicativo completo.
- Pago: Não aplicável.
Plataformas: Windows, Linux.
Baixar: GitHub (hiyouga/LLaMA-Factory)
Conclusão: O melhor ponto de entrada baseado em GUI para qualquer pessoa nova em treinamento LoRA.
4. Text Generation WebUI, melhor para anexar e testar LoRA
Text Generation WebUI (“oobabooga”) é a UI de chat LLM local que a maioria dos entusiastas já executa. Sua guia Training faz treinamento LoRA no local, e quando uma execução termina, você pode ativar o adaptador e conversar com o modelo para verificar o resultado imediatamente.
Onde fica aquém: não é o treinador mais rápido nesta lista; a guia de treinamento é uma boa ferramenta “conecte os pontos”, não um pipeline de produção.
Preços:
- Gratuito: Aplicativo completo.
- Pago: Não aplicável.
Plataformas: Windows, macOS, Linux.
Baixar: GitHub (oobabooga/text-generation-webui)
Conclusão: A ferramenta com menos atrito para ver se o fine-tuning de seus dados muda algo que você se importa.
5. PEFT, melhor biblioteca para seu próprio loop de treinamento
PEFT é a biblioteca Parameter-Efficient Fine-Tuning do Hugging Face. É um conjunto de blocos de construção Python, LoRA, IA3, ajuste de prefixo, que você coloca em um Trainer. Se você quiser controlar o loop, este é o nível em que você trabalha.
Onde fica aquém: sem UI; cada experimento é um script; você é responsável pela ergonomia.
Preços:
- Gratuito: Aplicativo completo.
- Pago: Não aplicável.
Plataformas: Windows, macOS, Linux.
Baixar: GitHub (huggingface/peft)
Conclusão: O nível correto de abstração para um pesquisador ou hobbyista sério que quer controle total.
6. H2O LLM Studio, melhor treinador com sabor corporativo
H2O LLM Studio envolve os mesmos frameworks abertos em uma interface de usuário React limpa, adiciona rastreamento de experimentos e se integra perfeitamente com as ferramentas de nuvem do H2O quando uma execução cresce para além de uma única GPU. Em uma estação de trabalho com um 4090 é confortável.
Onde fica aquém: a UI é uma instalação mais pesada do que qualquer outra escolha aqui; padrões opinados podem ocultar os controles subjacentes.
Preços:
- Gratuito: Aplicativo completamente de código aberto.
- Pago: Suporte Enterprise.
Plataformas: Windows, Linux.
Baixar: GitHub (h2oai/h2o-llmstudio)
Conclusão: A escolha quando experimentos vão para uma equipe, não para um único laptop.
7. MLX-LM, melhor fine-tuning nativo no Apple Silicon
MLX-LM é o framework LM nativo Apple construído em MLX. Em um Mac Studio ou um Mac M2 Pro base com 32 GB de memória unificada, fine-tuning LoRA em modelos 7B e 13B agora é um caminho suportado, e o modelo de memória do framework usa a alocação compartilhada GPU/CPU para ajustar modelos que CUDA nunca poderia.
Onde fica aquém: apenas macOS; o catálogo de modelos é menor do que o do CUDA; menos maduro do que ferramentas baseadas em PyTorch.
Preços:
- Gratuito: Aplicativo completo.
- Pago: Não aplicável.
Plataformas: macOS (Apple Silicon).
Baixar: GitHub (ml-explore/mlx-lm)
Conclusão: A escolha certa em um Mac moderno, a escolha errada em qualquer outro lugar.
Como escolher a correta
Se você tiver uma única GPU de consumidor de 12 GB ou 24 GB e quiser velocidade, instale Unsloth e execute um de seus notebooks. Nada mais nesta lista chega a um adaptador funcional mais rapidamente.
Se seu modelo ou formato de conjunto de dados está fora do caminho rápido do Unsloth, escolha Axolotl por sua flexibilidade baseada em configuração.
Se você nunca treinou nada antes, LLaMA-Factory coloca uma GUI nas mesmas ferramentas e encurta o debate “que taxa de aprendizado”.
Se você já executa Text Generation WebUI, use sua guia Training. Não adicione outra ferramenta para uma execução única.
Para controlar o loop de treinamento, PEFT é a biblioteca certa. Espere escrever Python.
Se experimentos precisarem ser revistos por outras pessoas, H2O LLM Studio fornece essa UI no nível de código aberto.
MLX-LM é a escolha correta no Apple Silicon e apenas lá.
FAQ
Preciso de uma GPU de 24 GB para fine-tune um modelo 7B?
Não. Unsloth e QLoRA cabem em 8–12 GB de LoRA 7B. 24 GB conseguem 13B confortavelmente.
Posso fazer fine-tuning em CPU?
Tecnicamente sim, da forma como você tecnicamente pode cruzar um oceano em um barco a remos. Use uma GPU ou Apple Silicon.
O fine-tuning melhorará meu modelo local para meu trabalho?
Para seguir instruções e vocabulário de domínio, sim. Para ganhos de raciocínio duro, em sua maioria não; o teto do modelo base é o teto.
Qual deve ser o tamanho do meu conjunto de dados?
Para um LoRA focado em tarefas, 500 a 5.000 exemplos de alta qualidade vencem 100.000 exemplos mediocres. Curar sem piedade.
Posso compartilhar o adaptador LoRA que treinei?
Sim; adaptadores são pequenos. Verifique a licença do modelo base primeiro, a maioria das variantes Llama e Mistral são permissivas, mas não idênticas.