Framework fine-tuning LoRA Unsloth

LM Studio e Ollama tornaram a execução de LLMs locais uma coisa de um clique. Fine-tuning permaneceu um trabalho de data center por anos, fora de alcance no mesmo hardware. Isso finalmente está mudando. O novo aplicativo desktop do Unsloth é o sinal visível, mas um pequeno grupo de frameworks abertos agora treina um adaptador LoRA real em uma única GPU de consumidor de 12 GB ou 24 GB no espaço de uma tarde.

Testamos sete ferramentas em uma RTX 4070, uma RTX 4090 e um Mac M2 Pro base. As escolhas abaixo são as que completaram uma execução LoRA Llama 3.1 8B ou Mistral 7B sem ficar sem memória, sem precisar de um cluster e sem pedir que você escreva um loop de treinamento em PyTorch primeiro. A lista mistura ferramentas com prioridade de GUI com frameworks com prioridade de CLI para que você possa escolher o nível ergonômico que deseja.

O que procurar em um fine-tuner de GPU de consumidor

Comparação rápida

Aplicativo Melhor para Plataformas Plano gratuito Preço inicial/mês Licença
Unsloth LoRA mais rápido em 12–24 GB Windows, Linux Aplicativo completo Gratuito (Pro tier) Apache 2.0
Axolotl Usuário avançado de arquivo de configuração Linux Aplicativo completo Gratuito Apache 2.0
LLaMA-Factory Baseado em GUI, suporte amplo de modelos Windows, Linux Aplicativo completo Gratuito Apache 2.0
Text Generation WebUI Anexe LoRA e teste no local Windows, macOS, Linux Aplicativo completo Gratuito AGPLv3
PEFT Biblioteca para seu próprio loop de treinamento Windows, macOS, Linux Aplicativo completo Gratuito Apache 2.0
H2O LLM Studio UI corporativa com rastreamento de experimentos Windows, Linux Gratuito (código aberto) Suporte Enterprise Apache 2.0
MLX-LM Fine-tuning nativo no Apple Silicon macOS Aplicativo completo Gratuito MIT

Os aplicativos

1. Unsloth, melhor LoRA mais rápido em 12–24 GB

Unsloth reescreve os caminhos críticos do fine-tuning de Llama, Mistral, Qwen, Gemma e Phi para ser aproximadamente duas a cinco vezes mais rápido e cerca de metade da memória do Transformers padrão. Um LoRA 7B cabe em uma única GPU de 12 GB e termina em um conjunto de dados modesto em uma tarde. O novo aplicativo desktop remove a última etapa CLI para receitas comuns.

Onde fica aquém: a cobertura se inclina em direção às famílias de modelos mais populares; arquiteturas obscuras precisam do caminho Transformers upstream.

Preços:

Plataformas: Windows (via WSL2), Linux.

Baixar: unsloth.ai · GitHub

Conclusão: A escolha padrão em 2026 para treinamento LoRA em uma única placa de consumidor.

2. Axolotl, melhor usuário avançado de arquivo de configuração

Axolotl é um framework de treinamento baseado em configuração construído em torno do Hugging Face. Um único arquivo YAML descreve o modelo, conjunto de dados, rank LoRA e argumentos de treinamento, e Axolotl cuida do resto. Ele suporta menos otimizações de velocidade do que Unsloth, mas vence em flexibilidade em modelos menos comuns e formatos de conjunto de dados.

Onde fica aquém: sem GUI; a configuração tem uma curva de aprendizado; a documentação assume que você já treinou algo.

Preços:

Plataformas: Linux (Docker em macOS/Windows).

Baixar: GitHub (axolotl-ai-cloud/axolotl)

Conclusão: A escolha certa quando Unsloth não tem seu modelo e você ainda deseja um pipeline sensato.

3. LLaMA-Factory, melhor treinador baseado em GUI

LLaMA-Factory fornece uma GUI baseada em Gradio sobre um amplo kit de ferramentas de treinamento. Escolha um modelo, carregue um conjunto de dados, defina o rank LoRA e a taxa de aprendizado, e inicie. Ele cobre 100+ famílias de modelos prontas para uso e seus gráficos tornam o ajuste de hiperparâmetros acessível.

Onde fica aquém: a GUI oculta algumas das escolhas mais difíceis; em casos extremos de VRAM, ela precisa da CLI mesmo assim.

Preços:

Plataformas: Windows, Linux.

Baixar: GitHub (hiyouga/LLaMA-Factory)

Conclusão: O melhor ponto de entrada baseado em GUI para qualquer pessoa nova em treinamento LoRA.

4. Text Generation WebUI, melhor para anexar e testar LoRA

Text Generation WebUI (“oobabooga”) é a UI de chat LLM local que a maioria dos entusiastas já executa. Sua guia Training faz treinamento LoRA no local, e quando uma execução termina, você pode ativar o adaptador e conversar com o modelo para verificar o resultado imediatamente.

Onde fica aquém: não é o treinador mais rápido nesta lista; a guia de treinamento é uma boa ferramenta “conecte os pontos”, não um pipeline de produção.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: GitHub (oobabooga/text-generation-webui)

Conclusão: A ferramenta com menos atrito para ver se o fine-tuning de seus dados muda algo que você se importa.

5. PEFT, melhor biblioteca para seu próprio loop de treinamento

PEFT é a biblioteca Parameter-Efficient Fine-Tuning do Hugging Face. É um conjunto de blocos de construção Python, LoRA, IA3, ajuste de prefixo, que você coloca em um Trainer. Se você quiser controlar o loop, este é o nível em que você trabalha.

Onde fica aquém: sem UI; cada experimento é um script; você é responsável pela ergonomia.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: GitHub (huggingface/peft)

Conclusão: O nível correto de abstração para um pesquisador ou hobbyista sério que quer controle total.

6. H2O LLM Studio, melhor treinador com sabor corporativo

H2O LLM Studio envolve os mesmos frameworks abertos em uma interface de usuário React limpa, adiciona rastreamento de experimentos e se integra perfeitamente com as ferramentas de nuvem do H2O quando uma execução cresce para além de uma única GPU. Em uma estação de trabalho com um 4090 é confortável.

Onde fica aquém: a UI é uma instalação mais pesada do que qualquer outra escolha aqui; padrões opinados podem ocultar os controles subjacentes.

Preços:

Plataformas: Windows, Linux.

Baixar: GitHub (h2oai/h2o-llmstudio)

Conclusão: A escolha quando experimentos vão para uma equipe, não para um único laptop.

7. MLX-LM, melhor fine-tuning nativo no Apple Silicon

MLX-LM é o framework LM nativo Apple construído em MLX. Em um Mac Studio ou um Mac M2 Pro base com 32 GB de memória unificada, fine-tuning LoRA em modelos 7B e 13B agora é um caminho suportado, e o modelo de memória do framework usa a alocação compartilhada GPU/CPU para ajustar modelos que CUDA nunca poderia.

Onde fica aquém: apenas macOS; o catálogo de modelos é menor do que o do CUDA; menos maduro do que ferramentas baseadas em PyTorch.

Preços:

Plataformas: macOS (Apple Silicon).

Baixar: GitHub (ml-explore/mlx-lm)

Conclusão: A escolha certa em um Mac moderno, a escolha errada em qualquer outro lugar.

Como escolher a correta

Se você tiver uma única GPU de consumidor de 12 GB ou 24 GB e quiser velocidade, instale Unsloth e execute um de seus notebooks. Nada mais nesta lista chega a um adaptador funcional mais rapidamente.

Se seu modelo ou formato de conjunto de dados está fora do caminho rápido do Unsloth, escolha Axolotl por sua flexibilidade baseada em configuração.

Se você nunca treinou nada antes, LLaMA-Factory coloca uma GUI nas mesmas ferramentas e encurta o debate “que taxa de aprendizado”.

Se você já executa Text Generation WebUI, use sua guia Training. Não adicione outra ferramenta para uma execução única.

Para controlar o loop de treinamento, PEFT é a biblioteca certa. Espere escrever Python.

Se experimentos precisarem ser revistos por outras pessoas, H2O LLM Studio fornece essa UI no nível de código aberto.

MLX-LM é a escolha correta no Apple Silicon e apenas lá.

FAQ

Preciso de uma GPU de 24 GB para fine-tune um modelo 7B?

Não. Unsloth e QLoRA cabem em 8–12 GB de LoRA 7B. 24 GB conseguem 13B confortavelmente.

Posso fazer fine-tuning em CPU?

Tecnicamente sim, da forma como você tecnicamente pode cruzar um oceano em um barco a remos. Use uma GPU ou Apple Silicon.

O fine-tuning melhorará meu modelo local para meu trabalho?

Para seguir instruções e vocabulário de domínio, sim. Para ganhos de raciocínio duro, em sua maioria não; o teto do modelo base é o teto.

Qual deve ser o tamanho do meu conjunto de dados?

Para um LoRA focado em tarefas, 500 a 5.000 exemplos de alta qualidade vencem 100.000 exemplos mediocres. Curar sem piedade.

Posso compartilhar o adaptador LoRA que treinei?

Sim; adaptadores são pequenos. Verifique a licença do modelo base primeiro, a maioria das variantes Llama e Mistral são permissivas, mas não idênticas.