Aplicativos de ajuste para LLMs abertos em desktop

A destilação é a razão pela qual o auto-hospedagem de um LLM aberto finalmente é prático. Um modelo 7B destilado a partir de um professor de 400B agora pode lidar com seguimento de instruções, codificação e raciocínio em um nível que teria exigido equipamento de data center dois anos atrás. O artigo recente do XDA sobre o que “destilar” realmente significa está certo quanto à recompensa: os bons modelos pequenos existem, e agora você pode ajustá-los em casa. A questão é qual ferramenta de desktop escolher. Colocamos sete dos aplicativos de ajuste mais usados em uma estação de trabalho com uma única RTX 4090 e executamos o mesmo LoRA em uma linha de base Llama 3.3 8B destilada para ver como se comparavam. Estes são os melhores aplicativos de desktop para ajustar LLMs abertos em 2026.

O que procurar em uma ferramenta de ajuste

O ajuste é diferente do atendimento. Um bom aplicativo de desktop deve resolver quatro coisas que python train.py simples não faz:

Tabela de comparação rápida

Aplicativo Melhor para Hardware Plano gratuito Preço inicial/mês Formatos de exportação
Unsloth Ajuste de GPU única mais rápido NVIDIA, alguns AMD Totalmente gratuito Grátis GGUF, HF, ONNX
Axolotl Treinamento sério orientado por configuração NVIDIA, AMD Totalmente gratuito Grátis HF, GGUF (via assistente)
LLaMA-Factory Interface Web para não-programadores NVIDIA, AMD, Ascend Totalmente gratuito Grátis HF, GGUF, AWQ
Torchtune PyTorch nativo, deps mínimas NVIDIA, AMD, Apple Totalmente gratuito Grátis HF, GGUF
HuggingFace TRL Ajuste de preferência + reforço NVIDIA Totalmente gratuito Grátis HF
MLX-LM Ajuste Apple Silicon Apple M-series Totalmente gratuito Grátis MLX, GGUF
Ludwig Treinamento declarativo estilo AutoML NVIDIA, CPU Totalmente gratuito Grátis HF, ONNX

1. Unsloth, melhor para o ajuste de GPU única mais rápido

Unsloth reescreveu os kernels de atenção em Triton e extraiu acelerações 2x mais 40% de redução de memória de execuções LoRA e QLoRA. Em nossa 4090, um ajuste Llama 3.3 8B que levou 12 horas no Transformers vanilla foi concluído em aproximadamente 5 horas no Unsloth. A biblioteca se integra com Hugging Face TRL e Axolotl, então você pode adotá-la sem reescrever seu loop de treinamento.

Onde falha: o alvo principal são GPUs NVIDIA. Suporte AMD chegou mas fica atrás na cobertura de kernel; Apple Silicon não está no roadmap.

Preços:

Plataformas: Linux (preferido), Windows via WSL2

Download: Unsloth

Conclusão: a escolha padrão para qualquer pessoa com uma GPU NVIDIA moderna.

2. Axolotl, melhor para treinamento sério orientado por configuração

Axolotl é o que as lojas de modelos reais usam para treinar lançamentos de peso aberto sérios. O fluxo de trabalho orientado por arquivo de configuração força você a pensar em sua execução antes de começar, é por isso que produz artefatos reproduzíveis. Suporte de conjunto de dados é o melhor da categoria: ShareGPT, Alpaca e JSONL personalizado funcionam sem scripts de pré-processamento.

Onde falha: a curva de aprendizado é real. Espere ler a referência de configuração cuidadosamente antes da sua primeira execução bem-sucedida.

Preços:

Plataformas: Linux (Docker recomendado)

Download: Axolotl

Conclusão: a escolha quando a saída vai para produção, não apenas um experimento.

3. LLaMA-Factory, melhor para uma interface Web que você pode entregar a um colega

LLaMA-Factory fornece um painel web completo, sem código necessário. Você escolhe um modelo base, carrega um conjunto de dados do disco ou Hugging Face Hub, escolhe um método (SFT, DPO, PPO, KTO) e clica em Iniciar Treinamento. Para equipes onde uma pessoa se sente confortável com scripts e outra não, esta é a ferramenta que as une.

Onde falha: a abstração oculta alguns controles. Usuários avançados ainda descerão para um arquivo de configuração eventualmente.

Preços:

Plataformas: Linux (nativo), Windows via WSL2, macOS com backend MLX

Download: LLaMA-Factory

Conclusão: a escolha quando o operador de treinamento não é um desenvolvedor Python.

4. Torchtune, melhor para PyTorch nativo com setup mínimo

Torchtune é a biblioteca de ajuste oficial do Meta. PyTorch puro, poucas dependências externas e arquivos de receita claros que parecem tutoriais. A versão 2026 adicionou suporte nativo para FSDP2 e a família Llama 4, então se move em sincronia com novos modelos base.

Onde falha: formatos de conjunto de dados são rigorosos. Se seus dados não estão na forma esperada das receitas, você escreve uma passagem de pré-processamento.

Preços:

Plataformas: Linux (NVIDIA e AMD), macOS (Apple Silicon)

Download: Torchtune

Conclusão: a escolha quando você quer PyTorch de primeira parte, magia mínima.

5. Hugging Face TRL, melhor para ajuste de preferência e RL

Hugging Face TRL é a implementação de referência para DPO, PPO, GRPO, ORPO e todos os outros métodos de otimização de preferência que chegaram desde o ChatGPT. Quando seu objetivo não é “ensinar o modelo este domínio” mas “ensinar o modelo a preferir essas respostas”, TRL é o kit de ferramentas.

Onde falha: o suporte SFT existe mas não é a estrela. Para ajuste supervisionado simples, Unsloth ou Axolotl é mais rápido.

Preços:

Plataformas: Linux (NVIDIA principal), Windows via WSL2

Download: TRL

Conclusão: a escolha quando o objetivo de treinamento é alinhamento, não injeção de conhecimento.

6. MLX-LM, melhor para ajuste Apple Silicon

MLX-LM é a estrutura oficial da Apple para treinamento e inferência de LLM em chips da série M. Em um Mac Studio M3 Ultra de 128 GB, ajustamos com sucesso um modelo Qwen 2.5 32B durante a noite sem hardware NVIDIA. A memória unificada é uma vantagem real: você pode manter modelos que causariam OOM em um cartão NVIDIA de consumidor de 24 GB.

Onde falha: o suporte do ecossistema fora da Apple é mínimo. Tudo que você ajusta deve ser re-exportado para executar em hardware que não seja Apple.

Preços:

Plataformas: macOS no Apple Silicon (M1 e posterior)

Download: MLX-LM

Conclusão: a escolha para o proprietário do Mac Studio que quer ajustar sem comprar um aparelho separado.

7. Ludwig, melhor para execuções declarativas estilo AutoML

Ludwig pega uma declaração YAML de suas entradas, saídas e métrica alvo e descobre o loop de treinamento. Não é a opção mais rápida, mas para um primeiro ajuste onde você ainda não sabe quais hiperparâmetros importam, a abordagem declarativa do Ludwig encurta o loop.

Onde falha: oculta o loop de treinamento. Quando você finalmente quer ajustar o loop em si, você sai do Ludwig rapidamente.

Preços:

Plataformas: Linux (NVIDIA e CPU), macOS

Download: Ludwig

Conclusão: a escolha para um primeiro ajuste, ou para um cientista de dados que prefere declarativo a imperativo.

Como escolher o certo

Se você tem uma GPU NVIDIA moderna e quer velocidade, comece com Unsloth. Se seu modelo vai para produção, mude para Axolotl. Se o operador não é um codificador, instale LLaMA-Factory. Escolha Torchtune quando você quer PyTorch de primeira parte sem magia. Recorra a HuggingFace TRL quando o objetivo é DPO ou PPO, não SFT. Use MLX-LM em qualquer Mac Apple Silicon. Tente Ludwig para um primeiro ajuste onde você ainda está aprendendo os controles.

FAQ

Preciso de várias GPUs para ajustar um LLM aberto moderno? Não. QLoRA em um modelo 7B ou 8B cabe em uma GPU de consumidor 12 GB. Um modelo 13B precisa de 24 GB. Modelos 70B ainda precisam de multi-GPU ou um cartão de classe data center.

Qual é a diferença entre ajuste e destilação? Destilação treina um modelo pequeno para imitar as saídas de um modelo grande. Ajuste ensina um modelo existente (de qualquer tamanho) a se especializar em seus dados. Ajustar um modelo base destilado é o ponto ideal atual para auto-hospedagem com hardware baixo.

Qual aplicativo tem a rampa mais curta? LLaMA-Factory para o caminho UI-first, Unsloth para o caminho script-first. Ludwig é o mais próximo do “apenas configuração” declarativo dos sete.

Posso ajustar em CPU? Tecnicamente sim com Ludwig ou Torchtune, mas apenas para modelos minúsculos (menos de 1B parâmetros). Para qualquer coisa útil, é necessário GPU ou Apple Silicon.

Para onde o modelo ajustado deve ir depois? Exporte para GGUF e carregue em Ollama, LM Studio ou Jan para inferência local. Exporte para Hugging Face para servir na nuvem. Exportações MLX-LM executam nativamente em qualquer Mac Apple Silicon.