Treinar um modelo local em seus próprios erros não é exatamente pré-treinamento, mas feito corretamente, ensina a um modelo pequeno a parar de repetir o erro que o incomodou ontem. Essa é a promessa por trás do loop de “auto-melhoria” que a comunidade LLM local tem iterado durante todo o ano: registre as respostas erradas do modelo, organize-as em um pequeno conjunto de dados de feedback, execute um ajuste fino de LoRA leve e veja a taxa de erro cair. Esses são os melhores aplicativos para auto-melhoria de LLM local a partir de falhas no desktop, seja você executando um modelo 7B em um laptop ou 70B em uma workstation.
O que procurar em uma stack de auto-melhoria
- Captura de feedback incorporada. Uma ferramenta que registra prompt, resposta e um sinal de polegar para cima/para baixo (ou melhor, uma resposta corrigida) é onde o loop começa.
- Curação de conjunto de dados. O registro de falhas precisa se tornar um conjunto de dados de ajuste fino de instrução limpo antes de ser útil.
- Ajuste fino eficiente. LoRA e QLoRA reduzem um ajuste fino de 24 GB para algo que uma única GPU de consumidor pode executar durante a noite.
- Inferência local para avaliação. A mesma ferramenta que serve o modelo para seu agente deve servir a versão ajustada para que você possa comparar as duas.
- Otimização programática de prompts. Para muitos modos de falha, a solução não é ajuste fino, mas um prompt melhor. Frameworks de otimização tornam isso mecânico.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Plano gratuito | Preço inicial/mês | Avaliação |
|---|---|---|---|---|---|
| LangChain | Encadear captura de feedback no fluxo de trabalho de ajuste fino | Windows, macOS, Linux | Completo | Gratuito (código aberto) | 4.5 |
| LM Studio | Inferência diária mais exportação de conjunto de dados | Windows, macOS, Linux | Completo | Gratuito | 4.6 |
| Ollama | Servir modelos ajustados a qualquer cliente | Windows, macOS, Linux | Completo | Gratuito (código aberto) | 4.7 |
| Axolotl | Execuções LoRA reproduzíveis orientadas por YAML | Linux (Windows via WSL, macOS via contêiner) | Completo | Gratuito (código aberto) | 4.6 |
| Unsloth | LoRA 2-5x mais rápido em uma única GPU | Windows, Linux | Completo | Nível gratuito, Pro disponível | 4.8 |
| Text Generation WebUI | Interface local para inferência, avaliação e rotulagem manual | Windows, macOS, Linux | Completo | Gratuito (código aberto) | 4.4 |
| DSPy | Otimizar prompts e pipelines de falhas rotuladas | Windows, macOS, Linux | Completo | Gratuito (código aberto) | 4.7 |
Os aplicativos
1. LangChain – melhor para encadear o loop de feedback
LangChain não é um ajustador fino. O que faz bem é fornecer os blocos de construção para capturar cada par de prompt-resposta de um agente, marcar falhas e encaminhá-las para um conjunto de dados de treinamento. As camadas Callbacks e Tracing são exatamente o que um loop de auto-melhoria precisa: um registro durável do que o modelo disse, o que o usuário fez com a resposta e como foi corrigido.
Onde falha: A superfície da API é grande e muda frequentemente. Exemplos de código mais antigos na internet geralmente estão incorretos.
Preços:
- Gratuito: O framework.
- Pago: LangSmith é um rastreador gerenciado pago se você quiser um painel hospedado.
Plataformas: Windows, macOS, Linux.
Download: langchain.com — Código-fonte (GitHub)
Resumo: Comece aqui para a plumbing entre o modelo, aplicativo e dados de treinamento.
2. LM Studio – melhor para inferência diária e exportação de conjunto de dados
LM Studio é a UI de inferência local mais fácil do desktop. Aponte para um modelo do Hugging Face, obtenha uma janela de chat e um servidor local compatível com OpenAI, e comece a coletar sessões. As versões recentes adicionaram um recurso de exportação de sessão que despeja conversas como JSONL, que é a matéria-prima para um conjunto de dados de feedback.
Onde falha: Nenhum ajuste fino incorporado. LM Studio é inferência em primeiro lugar; o treinamento acontece em outro lugar.
Preços:
- Gratuito: Tudo.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Download: lmstudio.ai
Resumo: O padrão para capturar e inspecionar a saída do modelo no caminho para uma execução de ajuste fino.
3. Ollama – melhor para servir o modelo ajustado depois
Ollama é o servidor de modelos chato e confiável. Depois que você ajusta um LoRA, envolva-o como um arquivo de modelo Ollama e cada cliente que conversa com um endpoint OpenAI local obtém sua versão melhorada instantaneamente. As versões recentes adicionaram carregamento de LoRA de primeira classe, então você pode trocar adaptadores sem baixar novamente pesos base.
Onde falha: Sem UI. É um daemon que espera que outras ferramentas fiquem no topo.
Preços:
- Gratuito: Tudo.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Download: ollama.com — Código-fonte (GitHub)
Resumo: A escolha certa para hospedar o modelo ajustado em sua máquina.
4. Axolotl – melhor para execuções LoRA reproduzíveis
Axolotl é um wrapper orientado por YAML em torno do stack de treinamento do Hugging Face. Aponte para um conjunto de dados, escolha um modelo base, defina sua classificação de LoRA e taxa de aprendizado, e vá. Cada execução é reproduzível no arquivo de configuração, o que importa quando todo o ponto de auto-melhoria é medir a melhoria entre iterações.
Onde falha: Nativo do Linux. Roda no Windows via WSL e no macOS via contêiner, mas com bordas ásperas.
Preços:
- Gratuito: Tudo.
- Pago: Nenhum.
Plataformas: Principalmente Linux; WSL para Windows.
Download: github.com/axolotl-ai-cloud/axolotl
Resumo: A escolha certa se você quiser que experimentos sejam reproduzíveis um mês depois.
5. Unsloth – melhor para LoRA rápido em GPU única
Unsloth é uma biblioteca de ajuste fino que extrai 2-5x de velocidade em uma única GPU de consumidor em comparação com o Trainer Hugging Face padrão. O uso de VRAM é aproximadamente reduzido pela metade. Em uma 4090, isso significa uma execução 7B LoRA em uma hora, não quatro; em uma 3060, significa que a execução termina totalmente.
Onde falha: Algumas arquiteturas ficam atrás da versão base do transformador. O suporte para os modelos mais novos chega uma ou duas versões depois.
Preços:
- Gratuito: Tudo em uma GPU única.
- Pago: Unsloth Pro para multi-GPU e suporte corporativo.
Plataformas: Windows, Linux.
Download: unsloth.ai — Código-fonte (GitHub)
Resumo: A escolha certa quando uma única GPU de desktop é tudo que você tem.
6. Text Generation WebUI – melhor para rotulagem manual e avaliação
Text Generation WebUI (Oobabooga) é a UI de trabalho para inferência local e também funciona como ambiente de rotulagem e avaliação. Carregue os modelos base e ajustado lado a lado, execute o mesmo prompt em ambos e marque qual resposta é melhor. Cada avaliação vai para o mesmo registro de conversação para a próxima rodada.
Onde falha: A UI padrão é desatualizada. A configuração pode ser complicada no Windows sem WSL.
Preços:
- Gratuito: Tudo.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Download: github.com/oobabooga/text-generation-webui
Resumo: O arnês de avaliação para pessoas que gostam de uma UI.
7. DSPy – melhor quando a falha é o prompt, não os pesos
DSPy trata prompts como parâmetros. Dê a ele um pequeno conjunto de dados rotulado de falhas, defina uma métrica e ele otimiza o prompt (e alguns exemplos) para se ajustar. Para muitos modos de falha, isso é mais rápido e barato que o ajuste fino. O prompt otimizado pode então alimentar seu agente de produção.
Onde falha: Curva de aprendizado. As abstrações (Signatures, Modules, Optimizers) são poderosas, mas não óbvias na primeira leitura.
Preços:
- Gratuito: Tudo.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Download: dspy.ai — Código-fonte (GitHub)
Resumo: Experimente DSPy antes do ajuste fino. Prompts baratos corrigem falhas baratas.
Como escolher o certo
Se você está começando e quer uma stack única, LM Studio para inferência mais LangChain para captura mais Unsloth para a execução de ajuste fino LoRA é o caminho mais barato para um loop funcional.
Se suas falhas são principalmente lacunas de raciocínio (o modelo divagou, pulou uma etapa), comece com DSPy. A otimização de prompts geralmente fecha a lacuna por centavos em vez de horas de GPU.
Se suas falhas são específicas do domínio (o modelo não conhece sua base de código ou produto), isso é ajuste fino. Use Axolotl ou Unsloth no topo do duo LM Studio e Ollama.
Se você está em uma workstation com duas ou mais GPUs, Axolotl escala além do nível gratuito da Unsloth.
Use Text Generation WebUI como sua UI de avaliação, independentemente do que você treinar. Testes A/B manuais são a forma mais rápida de saber que um ajuste realmente melhorou as coisas.
Perguntas frequentes
Posso auto-melhorar um LLM local sem treinar com meus próprios dados? Apenas até certo ponto. A otimização de prompts com DSPy o leva mais longe do que a maioria das pessoas esperaria, mas as falhas específicas do domínio precisam de dados específicos do domínio.
Quanta dados preciso para um ajuste fino LoRA útil? Para uma correção direcionada, algumas centenas de exemplos de falha rotulados são suficientes. O ajuste fino de instrução de um modelo geral precisa de dezenas de milhares.
O que é mais rápido em uma 3060 ou 4060: Unsloth ou Axolotl? Unsloth, por uma margem grande em uma GPU única. Axolotl é melhor uma vez que você tem várias GPUs ou quer configurações YAML reproduzíveis.
Perco as habilidades do modelo base quando ajusto LoRA? Normalmente não. LoRA congela os pesos base e adiciona um pequeno adaptador. Você pode descarregar o adaptador e recuperar o modelo base.
Posso executar tudo isso em um Mac Apple Silicon? Inferência (LM Studio, Ollama, Text Generation WebUI) sim. O treinamento é mais lento no Metal do que no CUDA; algumas arquiteturas ainda precisam de uma caixa GPU Linux para tempos de treinamento práticos.