O speedtest dos LLMs locais no Apple Silicon.Dê aos seus agentes IA
visão sobre a inferência
Compare Ollama, LM Studio, mlx-lm, llama.cpp e mais cinco motores frente a frente — tok/s, TTFT, energia e térmica, com um comando.A API REST do asiai permite que seus agentes IA monitorem, diagnostiquem e otimizem a infraestrutura LLM local de forma autônoma.
{
"chip": "Apple M4 Pro",
"ram_gb": 64.0,
"memory_pressure": "normal",
"gpu_utilization_percent": 45.2,
"engines": {
"ollama": { "running": true, "models_loaded": 2 },
"lmstudio": { "running": true, "models_loaded": 1 }
}
}
{
"system": {
"chip": "Apple M4 Pro",
"gpu_cores": 20,
"gpu_utilization_percent": 45.2,
"thermal_state": "nominal"
},
"engines": [{
"name": "ollama",
"models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
}]
}
O problema dos LLMs locais
Parece familiar?
Fragmentado
Ollama, LM Studio, mlx-lm — cada um com seu CLI, formatos e métricas. Nenhum terreno comum.
Às cegas
Sem monitoramento VRAM em tempo real, sem rastreamento de energia, sem alertas térmicos. Você voa às cegas.
Manual
Benchmark significa scripts curl, copiar números e comparar em planilhas.
Um CLI. Quatro superfícies.
Tudo se instala com o binário — sem plugins, sem arquivos de configuração para começar.
Faça bench de qualquer motor
7 tipos de bench — throughput, burst, agentic, qualidade, contexto, energia, versões. Estilo MLPerf: warmup, mediana, decodificação greedy, CI95.
$ asiai bench
Dashboard ao vivo
GPU, VRAM, energia e térmica em tempo real via IOReport passivo — gauges ao vivo, sparklines, controles de benchmark.
$ asiai web
Cockpit da frota
Todos os Macs da sua rede em uma tela — motores, modelos carregados, cache KV, energia e alertas, com controles de operador.
$ asiai fleetRanking comunitário
Compartilhe benchmarks anonimamente e veja o que outros Macs alcançam no mesmo chip — no terminal ou na web.
$ asiai leaderboardO que você vai descobrir?
Perguntas reais do r/LocalLLaMA, respondidas com um comando.
“Qual motor é o mais rápido?”
Comparação direta — a pergunta n°1 no r/LocalLLaMA.
“Monitorar um enxame multi-agente”
LLMs rodando 24/7 para agentes IA — acompanhe VRAM, temperatura e desempenho.
“Comparar eficiência energética”
tok/s por watt entre motores. Crítico para homelabs Mac Mini 24/7.
“Detectar regressões após atualizações”
A atualização do Ollama ou macOS quebrou seu desempenho? Detecção automática via SQLite.
“Testar suporte a contexto longo”
Benchmarks --context-size 64k. Seu modelo sobrevive a 256k de contexto?
“Meu Mac está com throttling térmico?”
Detecção de deriva térmica entre execuções. Único no asiai.
“Benchmarks reprodutíveis”
Metodologia MLPerf/SPEC. Warmup, mediana, decodificação greedy. Compartilhe com confiança.
“Diagnóstico em um comando”
asiai doctor diagnostica sistema, motores e banco de dados com sugestões de correção.
“Dashboard visual”
Dashboard web dark/light com gráficos ao vivo, progresso SSE e controles de benchmark.
“Comparar LLMs frente a frente”
Mesmo motor, modelos diferentes. Qual quantização ganha?
“Monitoramento Prometheus + Grafana”
Exponha /metrics, scrape com Prometheus, visualize no Grafana. Observabilidade de nível produção.
“Rastrear inferência de agentes IA”
Atividade GPU, conexões TCP, cache KV — saiba quando seus agentes estão pensando, ociosos ou sobrecarregados. API pronta para orquestradores de swarm.
Funcionando em 60 segundos
Três comandos. Só isso.
Instalar
Detectar
Benchmark
Descobertas reais
Números de benchmarks reais em Apple Silicon.
MLX vs llama.cpp
MLX é 2,3x mais rápido para arquiteturas MoE (Qwen3.5-35B-A3B) em Apple Silicon.
VRAM: 64k → 256k
A VRAM permanece constante de 64k a 256k de contexto com DeltaNet — não documentado em nenhum outro lugar.
Motor > Modelo
Mesmo modelo, mesmo Mac: 30 tok/s em um motor, 71 tok/s em outro. O motor importa mais.
Motores suportados
Detecção automática, zero configuração.
A porta 8000 é compartilhada por oMLX, vllm-mlx, vMLX e Rapid-MLX — o asiai os distingue via /v1/models.
O que medimos
8 métricas, metodologia consistente, cada execução.
tok/s
Velocidade de geração (tokens/seg)
TTFT
Tempo ao primeiro token
Power (W)
Consumo GPU em watts
tok/s/W
Eficiência energética
Stability
Variância entre execuções
VRAM
Pegada de memória GPU
Thermal
Estado de throttling
Context
Escala contexto longo
Os mais rápidos da comunidade
Dados ao vivo de Macs reais, janela de 90 dias. Anônimo por design.
Um comando. Um cartão compartilhável.
Cada tipo de bench gera uma imagem 1200×630 — modelo, chip, medianas medidas, gates de honestidade. Feito para Reddit, X e Discord.