asiai speedometer logo Open source · Apache 2.0 · Zero dependencies

O speedtest dos LLMs locais no Apple Silicon.Dê aos seus agentes IA
visão sobre a inferência

Compare Ollama, LM Studio, mlx-lm, llama.cpp e mais cinco motores frente a frente — tok/s, TTFT, energia e térmica, com um comando.A API REST do asiai permite que seus agentes IA monitorem, diagnostiquem e otimizem a infraestrutura LLM local de forma autônoma.

$pip install asiai
$asiai bench# 15s → your first comparison
Python 3.11+ · stdlib only · 9 engines auto-detected · agent-ready API
GET /api/status ≤ 500ms
{
  "chip": "Apple M4 Pro",
  "ram_gb": 64.0,
  "memory_pressure": "normal",
  "gpu_utilization_percent": 45.2,
  "engines": {
    "ollama": { "running": true, "models_loaded": 2 },
    "lmstudio": { "running": true, "models_loaded": 1 }
  }
}
GET /api/snapshot Full state
{
  "system": {
    "chip": "Apple M4 Pro",
    "gpu_cores": 20,
    "gpu_utilization_percent": 45.2,
    "thermal_state": "nominal"
  },
  "engines": [{
    "name": "ollama",
    "models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
  }]
}

O problema dos LLMs locais

Parece familiar?

01

Fragmentado

Ollama, LM Studio, mlx-lm — cada um com seu CLI, formatos e métricas. Nenhum terreno comum.

02

Às cegas

Sem monitoramento VRAM em tempo real, sem rastreamento de energia, sem alertas térmicos. Você voa às cegas.

03

Manual

Benchmark significa scripts curl, copiar números e comparar em planilhas.

Um CLI. Quatro superfícies.

Tudo se instala com o binário — sem plugins, sem arquivos de configuração para começar.

asiai Benchmark screen — one-click Quick Bench with live progress

Faça bench de qualquer motor

7 tipos de bench — throughput, burst, agentic, qualidade, contexto, energia, versões. Estilo MLPerf: warmup, mediana, decodificação greedy, CI95.

$ asiai bench
asiai live web dashboard — CPU load, memory, GPU power and loaded models

Dashboard ao vivo

GPU, VRAM, energia e térmica em tempo real via IOReport passivo — gauges ao vivo, sparklines, controles de benchmark.

$ asiai web
asiai fleet cockpit — engines, models, KV cache and power across every Mac on the network

Cockpit da frota

Todos os Macs da sua rede em uma tela — motores, modelos carregados, cache KV, energia e alertas, com controles de operador.

$ asiai fleet

Ranking comunitário

Compartilhe benchmarks anonimamente e veja o que outros Macs alcançam no mesmo chip — no terminal ou na web.

$ asiai leaderboard

O que você vai descobrir?

Perguntas reais do r/LocalLLaMA, respondidas com um comando.

“Qual motor é o mais rápido?”

Comparação direta — a pergunta n°1 no r/LocalLLaMA.

“Monitorar um enxame multi-agente”

LLMs rodando 24/7 para agentes IA — acompanhe VRAM, temperatura e desempenho.

“Comparar eficiência energética”

tok/s por watt entre motores. Crítico para homelabs Mac Mini 24/7.

“Detectar regressões após atualizações”

A atualização do Ollama ou macOS quebrou seu desempenho? Detecção automática via SQLite.

“Testar suporte a contexto longo”

Benchmarks --context-size 64k. Seu modelo sobrevive a 256k de contexto?

“Meu Mac está com throttling térmico?”

Detecção de deriva térmica entre execuções. Único no asiai.

“Benchmarks reprodutíveis”

Metodologia MLPerf/SPEC. Warmup, mediana, decodificação greedy. Compartilhe com confiança.

“Diagnóstico em um comando”

asiai doctor diagnostica sistema, motores e banco de dados com sugestões de correção.

“Dashboard visual”

Dashboard web dark/light com gráficos ao vivo, progresso SSE e controles de benchmark.

“Comparar LLMs frente a frente”

Mesmo motor, modelos diferentes. Qual quantização ganha?

“Monitoramento Prometheus + Grafana”

Exponha /metrics, scrape com Prometheus, visualize no Grafana. Observabilidade de nível produção.

“Rastrear inferência de agentes IA”

Atividade GPU, conexões TCP, cache KV — saiba quando seus agentes estão pensando, ociosos ou sobrecarregados. API pronta para orquestradores de swarm.

Funcionando em 60 segundos

Três comandos. Só isso.

1

Instalar

$ brew install druide67/tap/asiai
# or: pip install asiai
2

Detectar

$ asiai detect
ollama (11434)
lmstudio (1234)
mlx-lm (8080)
→ 3 motores encontrados
3

Benchmark

$ asiai bench -m qwen3.5
ENGINETOK/STTFT
lmstudio71.242ms
ollama54.861ms
mlx-lm30.138ms

Descobertas reais

Números de benchmarks reais em Apple Silicon.

2.3×

MLX vs llama.cpp

MLX é 2,3x mais rápido para arquiteturas MoE (Qwen3.5-35B-A3B) em Apple Silicon.

Flat

VRAM: 64k → 256k

A VRAM permanece constante de 64k a 256k de contexto com DeltaNet — não documentado em nenhum outro lugar.

30 vs 71

Motor > Modelo

Mesmo modelo, mesmo Mac: 30 tok/s em um motor, 71 tok/s em outro. O motor importa mais.

O que medimos

8 métricas, metodologia consistente, cada execução.

tok/s

Velocidade de geração (tokens/seg)

TTFT

Tempo ao primeiro token

Power (W)

Consumo GPU em watts

tok/s/W

Eficiência energética

Stability

Variância entre execuções

VRAM

Pegada de memória GPU

Thermal

Estado de throttling

Context

Escala contexto longo

Os mais rápidos da comunidade

Dados ao vivo de Macs reais, janela de 90 dias. Anônimo por design.

Ranking completo →
01 llama-3.2-3b-instruct-4bit mlxlm Apple M4 Max · 64 GB 228.0 88 ms
02 qwen3.6:35b-a3b-nvfp4 ollama Apple M5 Max · 128 GB 124.9 39 ms
03 gemma-4-31b-it ollama Apple M5 Max · 128 GB 115.8 64 ms
Contribua com o seu: asiai bench --share

Um comando. Um cartão compartilhável.

Cada tipo de bench gera uma imagem 1200×630 — modelo, chip, medianas medidas, gates de honestidade. Feito para Reddit, X e Discord.

asiai bench --card
asiai throughput card — mtplx-qwen36-27b-optimized-speed on mlx-lm at 48.2 tok/s median (±1 CI95, n=5), Apple M5 Max
asiai agentic card — prefix-cache reuse fraction 0.80 across cold, warm and prefix phases, Qwen3.6-27B on llama.cpp asiai code-quality card — tool_call, recovery and thinking suites at 100%, deterministic grading, Qwen3.6-27B on llama.cpp