O relatório da XDA de que uma GPU de gama média pode subsidiar uma pilha de assinaturas de IA pagas é bem preciso. Uma RTX 4070 Ti ou Radeon RX 7900 XT executa modelos de 13B e 34B parâmetros em uma velocidade que supera o que a maioria dos serviços em nuvem cobra por um único nível de assinatura. Mas escolher qual modelo, quantização e runtime usar no hardware que você já possui requer números reais, não especulações.
Os sete aplicativos abaixo cobrem dois tipos de benchmarking. Os três primeiros são benchmarks integrados ao runtime que relatam tokens por segundo e tempo até o primeiro token para cargas de trabalho reais. O resto são suites de benchmark de terceiros que fornecem pontuações reproduzíveis para comparar hardware. Cada opção funciona em Windows e Linux; duas também funcionam em macOS com Apple Silicon.
O que procurar em um benchmark de GPU AI
Nem todo benchmark de IA lhe diz o que você precisa saber. Verifique estas cinco coisas:
- Relata tokens por segundo em múltiplos comprimentos de contexto (128, 2048, 8192)
- Mede processamento de prompt (prefill) e geração separadamente
- Suporta a quantização que você realmente planeja usar (Q4_K_M, Q8, FP16)
- Lê utilização de VRAM e RAM do sistema durante a execução
- Publica resultados em formato compartilhável para que os números sejam comparáveis entre configurações
Qualquer coisa que apenas relate um único número de throughput em um contexto não é útil para dimensionamento real de hardware.
Comparação rápida
| Aplicativo | Melhor para | Plano gratuito | Preço inicial | Recurso destaque |
|---|---|---|---|---|
| llama-bench | Throughput LLM reproduzível | Sim | Gratuito | Incluído com llama.cpp |
| LM Studio | Benchmarks GUI + compra de modelos | Sim | Gratuito | Catálogo de modelos integrado |
| Ollama benchmark | Teste de estresse LLM de um comando | Sim | Gratuito | Executa com qualquer modelo baixado |
| UL Procyon AI | Benchmark de fornecedor padrão da indústria | Teste | Licença paga | Caminhos ONNX + DirectML |
| Geekbench AI | Pontuação de IA multiplataforma | Sim | Nível gratuito | iOS, Android, Windows, macOS |
| MLPerf Client | Benchmark de referência da MLCommons | Sim | Gratuito | Perfilagem profunda de hardware |
| koboldcpp benchmark | Simulação de carga de trabalho roleplay/chat | Sim | Gratuito | Simula sessões de chat realisticamente |
Os aplicativos
1. llama-bench – Melhor throughput LLM reproduzível
llama-bench é fornecido como parte do llama.cpp e é a coisa mais próxima que o mundo do LLM local tem de uma vara padrão. Aponte para um arquivo GGUF, diga um tamanho de contexto e tamanho de lote, e ele relatará tokens de prompt por segundo, tokens de geração por segundo e tempo até o primeiro token. Funciona em qualquer backend CUDA, ROCm, Metal ou CPU, portanto uma ferramenta fornece números comparáveis em seu rig Nvidia, compilação Radeon e MacBook.
Onde falha: Somente linha de comando. Sem GUI. Algumas opções (BLAS, tamanho de lote) requerem leitura da documentação.
Preços:
- Gratuito: Código aberto sob MIT.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: llama.cpp no GitHub
Conclusão: O benchmark padrão ao comparar quantizações ou modelos. Aprenda seus sinalizadores uma vez.
2. LM Studio – Melhor benchmark GUI com compra de modelos
LM Studio é um aplicativo de desktop que envolve llama.cpp com uma interface gráfica para baixar, executar e agora fazer benchmarks de modelos. A guia de benchmark integrada testa qualquer modelo baixado em uma carga de trabalho preestablecida e relata métricas de uma forma que não-especialistas podem ler. Também mostra espaço VRAM restante, o que ajuda a dimensionar o próximo modelo.
Onde falha: Código fechado. O catálogo de modelos se sobrepõe ao HuggingFace e não é abrangente.
Preços:
- Gratuito: Aplicativo completo.
- Pago: Nenhum.
Plataformas: Windows, macOS (Apple Silicon), Linux.
Baixar: LM Studio
Conclusão: A maneira mais amigável de fazer benchmark de um modelo novo sem tocar em um terminal.
3. Ollama benchmark – Melhor teste de estresse LLM de um comando
Ollama vem com um flag run --verbose que produz temporizações por token. Combinado com scripts mantidos pela comunidade, funciona como ferramenta de benchmark. Como Ollama extrai modelos pelo nome, executar o mesmo benchmark em uma segunda máquina leva dois comandos.
Onde falha: Não é uma suite de benchmark completa. Focado em velocidade de conclusão; menos útil para cargas de trabalho pesadas de prompt.
Preços:
- Gratuito: Código aberto sob MIT.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: Ollama
Conclusão: Instale Ollama para uso diário de modelos; use --verbose quando quiser uma leitura de throughput rápida.
4. UL Procyon AI – Melhor benchmark de fornecedor padrão da indústria
UL Procyon AI Computer Vision Benchmark é a mesma UL que publica 3DMark e PCMark. Executa modelos ONNX padrão (MobileNet, ResNet, Inception) em backends TensorRT, DirectML, OpenVINO e CoreML e produz uma pontuação. Fornecedores citam números Procyon em análises, portanto a pontuação é diretamente comparável em toda a indústria.
Onde falha: Focado em cargas de trabalho de visão; menos útil para throughput LLM. Licença paga para uso comercial.
Preços:
- Gratuito: Pontuação de teste revela números base.
- Pago: Licença desbloqueia a execução completa.
Plataformas: Windows.
Baixar: UL Procyon AI
Conclusão: Compre isso se você tomar decisões de compra usando benchmarks de fornecedores. Pule se você só se importa com a velocidade do LLM.
5. Geekbench AI – Melhor pontuação de IA multiplataforma
Geekbench AI produz três números por execução: FP32, FP16 e INT8 quantizado. Executa no Windows, macOS, Linux, iOS e Android, portanto uma comparação laptop-vs-phone para a mesma carga de trabalho está a um benchmark de distância. O banco de dados de resultados públicos permite comparar sua execução com milhares de outras.
Onde falha: Não específico para LLM. As três pontuações colapsam muita nuance.
Preços:
- Gratuito: Execução de visualização.
- Pago: Licença completa desbloqueia execuções em lote e exportação de histórico.
Plataformas: Windows, macOS, Linux, iOS, Android.
Baixar: Geekbench AI
Conclusão: O número de referência para “como meu hardware com capacidade de IA se compara”.
6. MLPerf Client – Melhor benchmark de referência da MLCommons
MLPerf Client é o benchmark de referência apoiado por MLCommons para IA em hardware cliente. Executa uma carga de trabalho LLM preestablecida (atualmente Llama 2 7B, mudando para modelos mais recentes) e relata latência, throughput e regressão de qualidade em relação a uma implementação de referência. Como MLCommons publica resultados de forma transparente, comparar configurações é simples.
Onde falha: A configuração é mais envolvida do que as alternativas. Não se destina a usuários finais.
Preços:
- Gratuito: Código aberto.
- Pago: Nenhum.
Plataformas: Windows, Linux (nativo), macOS (builds da comunidade).
Baixar: MLPerf Client no GitHub
Conclusão: O benchmark autoritário. Vale o custo de configuração se você planeja publicar uma comparação de hardware.
7. koboldcpp benchmark – Melhor simulação de carga de trabalho roleplay e chat
koboldcpp é um fork de llama.cpp focado em roleplay e chat de contexto longo. Seu modo de benchmark simula uma sessão de chat real com contexto contínuo, que é um teste mais honesto de como um servidor LLM doméstico se sentirá dia a dia. Os números incluem o custo de troca de contexto e comportamento de overflow de RAM do sistema, que llama-bench omite.
Onde falha: Focado em cargas de trabalho de chat/RP; perde métricas focadas em código. A interface se parece ocupada à primeira vista.
Preços:
- Gratuito: Código aberto.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: koboldcpp no GitHub
Conclusão: O benchmark mais representativo para quem o caso de uso real é chat, não conclusão de código.
Como escolher o certo
Comece com llama-bench para números reproduzíveis em quantizações. Adicione a guia de benchmark integrada do LM Studio se preferir GUI. Use o flag verbose do Ollama para uma verificação de integridade rápida em uma máquina onde você já executa modelos. Adicione Geekbench AI quando precisar de uma pontuação portátil única. Guarde UL Procyon ou MLPerf Client para comparações formais de hardware onde a legitimidade de terceiros importa. Use benchmark koboldcpp quando sua carga de trabalho diária for chat em vez de conclusão de código.
Pule folhas de especificações “AI TOPS” de fornecedores como substituto; os números são teóricos de pico e raramente refletem o throughput de inferência real nas quantizações que você usa.
Perguntas Frequentes
Qual GPU oferece a melhor velocidade de LLM local hoje? Para placas de consumo, RTX 4090, 4080 Super e 5080 lideram em Nvidia; RX 7900 XTX lidera em AMD. Apple M3 Max e M4 Max fecham a lacuna para modelos que cabem em memória unificada.
Quantos tokens por segundo eu realmente preciso? O chat em tempo real se sente bem acima de 20 t/s na saída do modelo. Qualquer coisa acima de 40 t/s é indistinguível de uma API SaaS rápida.
Mais VRAM ajuda ou a computação vence? Para LLMs, VRAM é a restrição mais difícil. Encaixar o modelo completo em VRAM sem transbordar para RAM do sistema é mais importante do que computação pura acima de um limite.
Um benchmark no Windows é comparável a um no Linux? Para testes baseados em CUDA, em grande parte sim. Diferenças de driver adicionam alguns pontos percentuais de variância. Para DirectML vs ROCm a diferença é muito maior e os números do Linux geralmente são mais altos.
Qual é a opção de benchmark mais barata? llama-bench e Ollama custam nada. Ambos funcionam em qualquer GPU de consumo.
Isso me ajuda a escolher entre LM Studio e Ollama? Sim. Faça benchmark do mesmo modelo em ambos e compare tokens por segundo e velocidade de processamento de prompt. Ollama tende a vencer na velocidade de troca de modelos; a GUI do LM Studio ajuda em experimentos.