Aplicativos de benchmarking local de GPU AI para desktop

O relatório da XDA de que uma GPU de gama média pode subsidiar uma pilha de assinaturas de IA pagas é bem preciso. Uma RTX 4070 Ti ou Radeon RX 7900 XT executa modelos de 13B e 34B parâmetros em uma velocidade que supera o que a maioria dos serviços em nuvem cobra por um único nível de assinatura. Mas escolher qual modelo, quantização e runtime usar no hardware que você já possui requer números reais, não especulações.

Os sete aplicativos abaixo cobrem dois tipos de benchmarking. Os três primeiros são benchmarks integrados ao runtime que relatam tokens por segundo e tempo até o primeiro token para cargas de trabalho reais. O resto são suites de benchmark de terceiros que fornecem pontuações reproduzíveis para comparar hardware. Cada opção funciona em Windows e Linux; duas também funcionam em macOS com Apple Silicon.

O que procurar em um benchmark de GPU AI

Nem todo benchmark de IA lhe diz o que você precisa saber. Verifique estas cinco coisas:

Qualquer coisa que apenas relate um único número de throughput em um contexto não é útil para dimensionamento real de hardware.

Comparação rápida

Aplicativo Melhor para Plano gratuito Preço inicial Recurso destaque
llama-bench Throughput LLM reproduzível Sim Gratuito Incluído com llama.cpp
LM Studio Benchmarks GUI + compra de modelos Sim Gratuito Catálogo de modelos integrado
Ollama benchmark Teste de estresse LLM de um comando Sim Gratuito Executa com qualquer modelo baixado
UL Procyon AI Benchmark de fornecedor padrão da indústria Teste Licença paga Caminhos ONNX + DirectML
Geekbench AI Pontuação de IA multiplataforma Sim Nível gratuito iOS, Android, Windows, macOS
MLPerf Client Benchmark de referência da MLCommons Sim Gratuito Perfilagem profunda de hardware
koboldcpp benchmark Simulação de carga de trabalho roleplay/chat Sim Gratuito Simula sessões de chat realisticamente

Os aplicativos

1. llama-bench – Melhor throughput LLM reproduzível

llama-bench é fornecido como parte do llama.cpp e é a coisa mais próxima que o mundo do LLM local tem de uma vara padrão. Aponte para um arquivo GGUF, diga um tamanho de contexto e tamanho de lote, e ele relatará tokens de prompt por segundo, tokens de geração por segundo e tempo até o primeiro token. Funciona em qualquer backend CUDA, ROCm, Metal ou CPU, portanto uma ferramenta fornece números comparáveis em seu rig Nvidia, compilação Radeon e MacBook.

Onde falha: Somente linha de comando. Sem GUI. Algumas opções (BLAS, tamanho de lote) requerem leitura da documentação.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: llama.cpp no GitHub

Conclusão: O benchmark padrão ao comparar quantizações ou modelos. Aprenda seus sinalizadores uma vez.

2. LM Studio – Melhor benchmark GUI com compra de modelos

LM Studio é um aplicativo de desktop que envolve llama.cpp com uma interface gráfica para baixar, executar e agora fazer benchmarks de modelos. A guia de benchmark integrada testa qualquer modelo baixado em uma carga de trabalho preestablecida e relata métricas de uma forma que não-especialistas podem ler. Também mostra espaço VRAM restante, o que ajuda a dimensionar o próximo modelo.

Onde falha: Código fechado. O catálogo de modelos se sobrepõe ao HuggingFace e não é abrangente.

Preços:

Plataformas: Windows, macOS (Apple Silicon), Linux.

Baixar: LM Studio

Conclusão: A maneira mais amigável de fazer benchmark de um modelo novo sem tocar em um terminal.

3. Ollama benchmark – Melhor teste de estresse LLM de um comando

Ollama vem com um flag run --verbose que produz temporizações por token. Combinado com scripts mantidos pela comunidade, funciona como ferramenta de benchmark. Como Ollama extrai modelos pelo nome, executar o mesmo benchmark em uma segunda máquina leva dois comandos.

Onde falha: Não é uma suite de benchmark completa. Focado em velocidade de conclusão; menos útil para cargas de trabalho pesadas de prompt.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: Ollama

Conclusão: Instale Ollama para uso diário de modelos; use --verbose quando quiser uma leitura de throughput rápida.

4. UL Procyon AI – Melhor benchmark de fornecedor padrão da indústria

UL Procyon AI Computer Vision Benchmark é a mesma UL que publica 3DMark e PCMark. Executa modelos ONNX padrão (MobileNet, ResNet, Inception) em backends TensorRT, DirectML, OpenVINO e CoreML e produz uma pontuação. Fornecedores citam números Procyon em análises, portanto a pontuação é diretamente comparável em toda a indústria.

Onde falha: Focado em cargas de trabalho de visão; menos útil para throughput LLM. Licença paga para uso comercial.

Preços:

Plataformas: Windows.

Baixar: UL Procyon AI

Conclusão: Compre isso se você tomar decisões de compra usando benchmarks de fornecedores. Pule se você só se importa com a velocidade do LLM.

5. Geekbench AI – Melhor pontuação de IA multiplataforma

Geekbench AI produz três números por execução: FP32, FP16 e INT8 quantizado. Executa no Windows, macOS, Linux, iOS e Android, portanto uma comparação laptop-vs-phone para a mesma carga de trabalho está a um benchmark de distância. O banco de dados de resultados públicos permite comparar sua execução com milhares de outras.

Onde falha: Não específico para LLM. As três pontuações colapsam muita nuance.

Preços:

Plataformas: Windows, macOS, Linux, iOS, Android.

Baixar: Geekbench AI

Conclusão: O número de referência para “como meu hardware com capacidade de IA se compara”.

6. MLPerf Client – Melhor benchmark de referência da MLCommons

MLPerf Client é o benchmark de referência apoiado por MLCommons para IA em hardware cliente. Executa uma carga de trabalho LLM preestablecida (atualmente Llama 2 7B, mudando para modelos mais recentes) e relata latência, throughput e regressão de qualidade em relação a uma implementação de referência. Como MLCommons publica resultados de forma transparente, comparar configurações é simples.

Onde falha: A configuração é mais envolvida do que as alternativas. Não se destina a usuários finais.

Preços:

Plataformas: Windows, Linux (nativo), macOS (builds da comunidade).

Baixar: MLPerf Client no GitHub

Conclusão: O benchmark autoritário. Vale o custo de configuração se você planeja publicar uma comparação de hardware.

7. koboldcpp benchmark – Melhor simulação de carga de trabalho roleplay e chat

koboldcpp é um fork de llama.cpp focado em roleplay e chat de contexto longo. Seu modo de benchmark simula uma sessão de chat real com contexto contínuo, que é um teste mais honesto de como um servidor LLM doméstico se sentirá dia a dia. Os números incluem o custo de troca de contexto e comportamento de overflow de RAM do sistema, que llama-bench omite.

Onde falha: Focado em cargas de trabalho de chat/RP; perde métricas focadas em código. A interface se parece ocupada à primeira vista.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: koboldcpp no GitHub

Conclusão: O benchmark mais representativo para quem o caso de uso real é chat, não conclusão de código.

Como escolher o certo

Comece com llama-bench para números reproduzíveis em quantizações. Adicione a guia de benchmark integrada do LM Studio se preferir GUI. Use o flag verbose do Ollama para uma verificação de integridade rápida em uma máquina onde você já executa modelos. Adicione Geekbench AI quando precisar de uma pontuação portátil única. Guarde UL Procyon ou MLPerf Client para comparações formais de hardware onde a legitimidade de terceiros importa. Use benchmark koboldcpp quando sua carga de trabalho diária for chat em vez de conclusão de código.

Pule folhas de especificações “AI TOPS” de fornecedores como substituto; os números são teóricos de pico e raramente refletem o throughput de inferência real nas quantizações que você usa.

Perguntas Frequentes

Qual GPU oferece a melhor velocidade de LLM local hoje? Para placas de consumo, RTX 4090, 4080 Super e 5080 lideram em Nvidia; RX 7900 XTX lidera em AMD. Apple M3 Max e M4 Max fecham a lacuna para modelos que cabem em memória unificada.

Quantos tokens por segundo eu realmente preciso? O chat em tempo real se sente bem acima de 20 t/s na saída do modelo. Qualquer coisa acima de 40 t/s é indistinguível de uma API SaaS rápida.

Mais VRAM ajuda ou a computação vence? Para LLMs, VRAM é a restrição mais difícil. Encaixar o modelo completo em VRAM sem transbordar para RAM do sistema é mais importante do que computação pura acima de um limite.

Um benchmark no Windows é comparável a um no Linux? Para testes baseados em CUDA, em grande parte sim. Diferenças de driver adicionam alguns pontos percentuais de variância. Para DirectML vs ROCm a diferença é muito maior e os números do Linux geralmente são mais altos.

Qual é a opção de benchmark mais barata? llama-bench e Ollama custam nada. Ambos funcionam em qualquer GPU de consumo.

Isso me ajuda a escolher entre LM Studio e Ollama? Sim. Faça benchmark do mesmo modelo em ambos e compare tokens por segundo e velocidade de processamento de prompt. Ollama tende a vencer na velocidade de troca de modelos; a GUI do LM Studio ajuda em experimentos.