LangChain

Treinar um modelo local em seus próprios erros não é exatamente pré-treinamento, mas feito corretamente, ensina a um modelo pequeno a parar de repetir o erro que o incomodou ontem. Essa é a promessa por trás do loop de “auto-melhoria” que a comunidade LLM local tem iterado durante todo o ano: registre as respostas erradas do modelo, organize-as em um pequeno conjunto de dados de feedback, execute um ajuste fino de LoRA leve e veja a taxa de erro cair. Esses são os melhores aplicativos para auto-melhoria de LLM local a partir de falhas no desktop, seja você executando um modelo 7B em um laptop ou 70B em uma workstation.

O que procurar em uma stack de auto-melhoria

Comparação rápida

Aplicativo Melhor para Plataformas Plano gratuito Preço inicial/mês Avaliação
LangChain Encadear captura de feedback no fluxo de trabalho de ajuste fino Windows, macOS, Linux Completo Gratuito (código aberto) 4.5
LM Studio Inferência diária mais exportação de conjunto de dados Windows, macOS, Linux Completo Gratuito 4.6
Ollama Servir modelos ajustados a qualquer cliente Windows, macOS, Linux Completo Gratuito (código aberto) 4.7
Axolotl Execuções LoRA reproduzíveis orientadas por YAML Linux (Windows via WSL, macOS via contêiner) Completo Gratuito (código aberto) 4.6
Unsloth LoRA 2-5x mais rápido em uma única GPU Windows, Linux Completo Nível gratuito, Pro disponível 4.8
Text Generation WebUI Interface local para inferência, avaliação e rotulagem manual Windows, macOS, Linux Completo Gratuito (código aberto) 4.4
DSPy Otimizar prompts e pipelines de falhas rotuladas Windows, macOS, Linux Completo Gratuito (código aberto) 4.7

Os aplicativos

1. LangChain – melhor para encadear o loop de feedback

LangChain não é um ajustador fino. O que faz bem é fornecer os blocos de construção para capturar cada par de prompt-resposta de um agente, marcar falhas e encaminhá-las para um conjunto de dados de treinamento. As camadas Callbacks e Tracing são exatamente o que um loop de auto-melhoria precisa: um registro durável do que o modelo disse, o que o usuário fez com a resposta e como foi corrigido.

Onde falha: A superfície da API é grande e muda frequentemente. Exemplos de código mais antigos na internet geralmente estão incorretos.

Preços:

Plataformas: Windows, macOS, Linux.

Download: langchain.com — Código-fonte (GitHub)

Resumo: Comece aqui para a plumbing entre o modelo, aplicativo e dados de treinamento.

2. LM Studio – melhor para inferência diária e exportação de conjunto de dados

LM Studio é a UI de inferência local mais fácil do desktop. Aponte para um modelo do Hugging Face, obtenha uma janela de chat e um servidor local compatível com OpenAI, e comece a coletar sessões. As versões recentes adicionaram um recurso de exportação de sessão que despeja conversas como JSONL, que é a matéria-prima para um conjunto de dados de feedback.

Onde falha: Nenhum ajuste fino incorporado. LM Studio é inferência em primeiro lugar; o treinamento acontece em outro lugar.

Preços:

Plataformas: Windows, macOS, Linux.

Download: lmstudio.ai

Resumo: O padrão para capturar e inspecionar a saída do modelo no caminho para uma execução de ajuste fino.

3. Ollama – melhor para servir o modelo ajustado depois

Ollama é o servidor de modelos chato e confiável. Depois que você ajusta um LoRA, envolva-o como um arquivo de modelo Ollama e cada cliente que conversa com um endpoint OpenAI local obtém sua versão melhorada instantaneamente. As versões recentes adicionaram carregamento de LoRA de primeira classe, então você pode trocar adaptadores sem baixar novamente pesos base.

Onde falha: Sem UI. É um daemon que espera que outras ferramentas fiquem no topo.

Preços:

Plataformas: Windows, macOS, Linux.

Download: ollama.com — Código-fonte (GitHub)

Resumo: A escolha certa para hospedar o modelo ajustado em sua máquina.

4. Axolotl – melhor para execuções LoRA reproduzíveis

Axolotl é um wrapper orientado por YAML em torno do stack de treinamento do Hugging Face. Aponte para um conjunto de dados, escolha um modelo base, defina sua classificação de LoRA e taxa de aprendizado, e vá. Cada execução é reproduzível no arquivo de configuração, o que importa quando todo o ponto de auto-melhoria é medir a melhoria entre iterações.

Onde falha: Nativo do Linux. Roda no Windows via WSL e no macOS via contêiner, mas com bordas ásperas.

Preços:

Plataformas: Principalmente Linux; WSL para Windows.

Download: github.com/axolotl-ai-cloud/axolotl

Resumo: A escolha certa se você quiser que experimentos sejam reproduzíveis um mês depois.

5. Unsloth – melhor para LoRA rápido em GPU única

Unsloth é uma biblioteca de ajuste fino que extrai 2-5x de velocidade em uma única GPU de consumidor em comparação com o Trainer Hugging Face padrão. O uso de VRAM é aproximadamente reduzido pela metade. Em uma 4090, isso significa uma execução 7B LoRA em uma hora, não quatro; em uma 3060, significa que a execução termina totalmente.

Onde falha: Algumas arquiteturas ficam atrás da versão base do transformador. O suporte para os modelos mais novos chega uma ou duas versões depois.

Preços:

Plataformas: Windows, Linux.

Download: unsloth.ai — Código-fonte (GitHub)

Resumo: A escolha certa quando uma única GPU de desktop é tudo que você tem.

6. Text Generation WebUI – melhor para rotulagem manual e avaliação

Text Generation WebUI (Oobabooga) é a UI de trabalho para inferência local e também funciona como ambiente de rotulagem e avaliação. Carregue os modelos base e ajustado lado a lado, execute o mesmo prompt em ambos e marque qual resposta é melhor. Cada avaliação vai para o mesmo registro de conversação para a próxima rodada.

Onde falha: A UI padrão é desatualizada. A configuração pode ser complicada no Windows sem WSL.

Preços:

Plataformas: Windows, macOS, Linux.

Download: github.com/oobabooga/text-generation-webui

Resumo: O arnês de avaliação para pessoas que gostam de uma UI.

7. DSPy – melhor quando a falha é o prompt, não os pesos

DSPy trata prompts como parâmetros. Dê a ele um pequeno conjunto de dados rotulado de falhas, defina uma métrica e ele otimiza o prompt (e alguns exemplos) para se ajustar. Para muitos modos de falha, isso é mais rápido e barato que o ajuste fino. O prompt otimizado pode então alimentar seu agente de produção.

Onde falha: Curva de aprendizado. As abstrações (Signatures, Modules, Optimizers) são poderosas, mas não óbvias na primeira leitura.

Preços:

Plataformas: Windows, macOS, Linux.

Download: dspy.ai — Código-fonte (GitHub)

Resumo: Experimente DSPy antes do ajuste fino. Prompts baratos corrigem falhas baratas.

Como escolher o certo

Se você está começando e quer uma stack única, LM Studio para inferência mais LangChain para captura mais Unsloth para a execução de ajuste fino LoRA é o caminho mais barato para um loop funcional.

Se suas falhas são principalmente lacunas de raciocínio (o modelo divagou, pulou uma etapa), comece com DSPy. A otimização de prompts geralmente fecha a lacuna por centavos em vez de horas de GPU.

Se suas falhas são específicas do domínio (o modelo não conhece sua base de código ou produto), isso é ajuste fino. Use Axolotl ou Unsloth no topo do duo LM Studio e Ollama.

Se você está em uma workstation com duas ou mais GPUs, Axolotl escala além do nível gratuito da Unsloth.

Use Text Generation WebUI como sua UI de avaliação, independentemente do que você treinar. Testes A/B manuais são a forma mais rápida de saber que um ajuste realmente melhorou as coisas.

Perguntas frequentes

Posso auto-melhorar um LLM local sem treinar com meus próprios dados? Apenas até certo ponto. A otimização de prompts com DSPy o leva mais longe do que a maioria das pessoas esperaria, mas as falhas específicas do domínio precisam de dados específicos do domínio.

Quanta dados preciso para um ajuste fino LoRA útil? Para uma correção direcionada, algumas centenas de exemplos de falha rotulados são suficientes. O ajuste fino de instrução de um modelo geral precisa de dezenas de milhares.

O que é mais rápido em uma 3060 ou 4060: Unsloth ou Axolotl? Unsloth, por uma margem grande em uma GPU única. Axolotl é melhor uma vez que você tem várias GPUs ou quer configurações YAML reproduzíveis.

Perco as habilidades do modelo base quando ajusto LoRA? Normalmente não. LoRA congela os pesos base e adiciona um pequeno adaptador. Você pode descarregar o adaptador e recuperar o modelo base.

Posso executar tudo isso em um Mac Apple Silicon? Inferência (LM Studio, Ollama, Text Generation WebUI) sim. O treinamento é mais lento no Metal do que no CUDA; algumas arquiteturas ainda precisam de uma caixa GPU Linux para tempos de treinamento práticos.