asiai speedometer logo Open source · Apache 2.0 · Zero dependencies

Lo speedtest dei LLM locali su Apple Silicon.Dai ai tuoi agenti IA
visibilità sull'inferenza

Confronta Ollama, LM Studio, mlx-lm, llama.cpp e altri cinque motori testa a testa — tok/s, TTFT, potenza e termica, con un comando.L'API REST di asiai consente ai tuoi agenti IA di monitorare, diagnosticare e ottimizzare l'infrastruttura LLM locale in autonomia.

$pip install asiai
$asiai bench# 15s → your first comparison
Python 3.11+ · stdlib only · 9 engines auto-detected · agent-ready API
GET /api/status ≤ 500ms
{
  "chip": "Apple M4 Pro",
  "ram_gb": 64.0,
  "memory_pressure": "normal",
  "gpu_utilization_percent": 45.2,
  "engines": {
    "ollama": { "running": true, "models_loaded": 2 },
    "lmstudio": { "running": true, "models_loaded": 1 }
  }
}
GET /api/snapshot Full state
{
  "system": {
    "chip": "Apple M4 Pro",
    "gpu_cores": 20,
    "gpu_utilization_percent": 45.2,
    "thermal_state": "nominal"
  },
  "engines": [{
    "name": "ollama",
    "models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
  }]
}

Il problema dei LLM locali

Ti suona familiare?

01

Frammentato

Ollama, LM Studio, mlx-lm — ognuno con il proprio CLI, formati e metriche. Nessun terreno comune.

02

Alla cieca

Nessun monitoraggio VRAM in tempo reale, nessun tracking energetico, nessun allarme termico. Voli alla cieca.

03

Manuale

Benchmark significa script curl, copiare numeri e confrontare nei fogli di calcolo.

Una CLI. Quattro superfici.

Tutto si installa con il binario — niente plugin, niente file di configurazione per iniziare.

asiai Benchmark screen — one-click Quick Bench with live progress

Benchmark di qualsiasi motore

7 tipi di bench — throughput, burst, agentic, qualità, contesto, energia, versioni. Stile MLPerf: warmup, mediana, decodifica greedy, CI95.

$ asiai bench
asiai live web dashboard — CPU load, memory, GPU power and loaded models

Dashboard live

GPU, VRAM, potenza e termica in tempo reale tramite IOReport passivo — gauge live, sparkline, controlli benchmark.

$ asiai web
asiai fleet cockpit — engines, models, KV cache and power across every Mac on the network

Cockpit della flotta

Tutti i Mac della tua rete su uno schermo — motori, modelli caricati, cache KV, potenza e avvisi, con controlli operatore.

$ asiai fleet

Classifica community

Condividi benchmark in modo anonimo e scopri cosa ottengono altri Mac sullo stesso chip — nel terminale o sul web.

$ asiai leaderboard

Cosa scoprirai?

Domande reali da r/LocalLLaMA, risposte con un comando.

“Quale motore è il più veloce?”

Confronto diretto — la domanda n°1 su r/LocalLLaMA.

“Monitorare uno sciame multi-agente”

LLM in esecuzione 24/7 per agenti IA — monitora VRAM, temperatura e prestazioni.

“Confrontare l'efficienza energetica”

tok/s per watt tra motori. Critico per homelab Mac Mini 24/7.

“Rilevare regressioni dopo aggiornamenti”

L'aggiornamento Ollama o macOS ha peggiorato le prestazioni? Rilevamento automatico via SQLite.

“Testare il supporto contesto lungo”

Benchmark --context-size 64k. Il tuo modello sopravvive a 256k di contesto?

“Il mio Mac fa throttling termico?”

Rilevamento deriva termica tra le esecuzioni. Unico in asiai.

“Benchmark riproducibili”

Metodologia MLPerf/SPEC. Warmup, mediana, decodifica greedy. Condividi con fiducia.

“Diagnostica in un comando”

asiai doctor diagnostica sistema, motori e database con suggerimenti di correzione.

“Dashboard visuale”

Dashboard web dark/light con grafici live, avanzamento SSE e controlli benchmark.

“Confrontare LLM testa a testa”

Stesso motore, modelli diversi. Quale quantizzazione vince?

“Monitoraggio Prometheus + Grafana”

Esponi /metrics, scrape con Prometheus, visualizza in Grafana. Osservabilità production-grade.

“Monitorare l'inferenza degli agenti IA”

Attività GPU, connessioni TCP, cache KV — sappi quando i tuoi agenti pensano, sono inattivi o sovraccarichi. API pronta per orchestratori di swarm.

Operativo in 60 secondi

Tre comandi. Tutto qui.

1

Installare

$ brew install druide67/tap/asiai
# or: pip install asiai
2

Rilevare

$ asiai detect
ollama (11434)
lmstudio (1234)
mlx-lm (8080)
→ 3 motori trovati
3

Benchmark

$ asiai bench -m qwen3.5
ENGINETOK/STTFT
lmstudio71.242ms
ollama54.861ms
mlx-lm30.138ms

Scoperte reali

Numeri da benchmark reali su Apple Silicon.

2.3×

MLX vs llama.cpp

MLX è 2,3x più veloce per architetture MoE (Qwen3.5-35B-A3B) su Apple Silicon.

Flat

VRAM: 64k → 256k

La VRAM resta costante da 64k a 256k di contesto con DeltaNet — non documentato altrove.

30 vs 71

Motore > Modello

Stesso modello, stesso Mac: 30 tok/s su un motore, 71 tok/s su un altro. Il motore conta di più.

Cosa misuriamo

8 metriche, metodologia coerente, ogni esecuzione.

tok/s

Velocità di generazione (token/sec)

TTFT

Tempo al primo token

Power (W)

Consumo GPU in watt

tok/s/W

Efficienza energetica

Stability

Varianza tra esecuzioni

VRAM

Footprint memoria GPU

Thermal

Stato di throttling

Context

Scaling contesto lungo

I più veloci della community

Dati live da Mac reali, finestra di 90 giorni. Anonimo by design.

Classifica completa →
01 llama-3.2-3b-instruct-4bit mlxlm Apple M4 Max · 64 GB 228.0 88 ms
02 qwen3.6:35b-a3b-nvfp4 ollama Apple M5 Max · 128 GB 124.9 39 ms
03 gemma-4-31b-it ollama Apple M5 Max · 128 GB 115.8 64 ms
Contribuisci con il tuo: asiai bench --share

Un comando. Una scheda condivisibile.

Ogni tipo di bench genera un'immagine 1200×630 — modello, chip, mediane misurate, gate di onestà. Fatto per Reddit, X e Discord.

asiai bench --card
asiai throughput card — mtplx-qwen36-27b-optimized-speed on mlx-lm at 48.2 tok/s median (±1 CI95, n=5), Apple M5 Max
asiai agentic card — prefix-cache reuse fraction 0.80 across cold, warm and prefix phases, Qwen3.6-27B on llama.cpp asiai code-quality card — tool_call, recovery and thinking suites at 100%, deterministic grading, Qwen3.6-27B on llama.cpp