Lo speedtest dei LLM locali su Apple Silicon.Dai ai tuoi agenti IA
visibilità sull'inferenza
Confronta Ollama, LM Studio, mlx-lm, llama.cpp e altri cinque motori testa a testa — tok/s, TTFT, potenza e termica, con un comando.L'API REST di asiai consente ai tuoi agenti IA di monitorare, diagnosticare e ottimizzare l'infrastruttura LLM locale in autonomia.
{
"chip": "Apple M4 Pro",
"ram_gb": 64.0,
"memory_pressure": "normal",
"gpu_utilization_percent": 45.2,
"engines": {
"ollama": { "running": true, "models_loaded": 2 },
"lmstudio": { "running": true, "models_loaded": 1 }
}
}
{
"system": {
"chip": "Apple M4 Pro",
"gpu_cores": 20,
"gpu_utilization_percent": 45.2,
"thermal_state": "nominal"
},
"engines": [{
"name": "ollama",
"models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
}]
}
Il problema dei LLM locali
Ti suona familiare?
Frammentato
Ollama, LM Studio, mlx-lm — ognuno con il proprio CLI, formati e metriche. Nessun terreno comune.
Alla cieca
Nessun monitoraggio VRAM in tempo reale, nessun tracking energetico, nessun allarme termico. Voli alla cieca.
Manuale
Benchmark significa script curl, copiare numeri e confrontare nei fogli di calcolo.
Una CLI. Quattro superfici.
Tutto si installa con il binario — niente plugin, niente file di configurazione per iniziare.
Benchmark di qualsiasi motore
7 tipi di bench — throughput, burst, agentic, qualità, contesto, energia, versioni. Stile MLPerf: warmup, mediana, decodifica greedy, CI95.
$ asiai bench
Dashboard live
GPU, VRAM, potenza e termica in tempo reale tramite IOReport passivo — gauge live, sparkline, controlli benchmark.
$ asiai web
Cockpit della flotta
Tutti i Mac della tua rete su uno schermo — motori, modelli caricati, cache KV, potenza e avvisi, con controlli operatore.
$ asiai fleetClassifica community
Condividi benchmark in modo anonimo e scopri cosa ottengono altri Mac sullo stesso chip — nel terminale o sul web.
$ asiai leaderboardCosa scoprirai?
Domande reali da r/LocalLLaMA, risposte con un comando.
“Quale motore è il più veloce?”
Confronto diretto — la domanda n°1 su r/LocalLLaMA.
“Monitorare uno sciame multi-agente”
LLM in esecuzione 24/7 per agenti IA — monitora VRAM, temperatura e prestazioni.
“Confrontare l'efficienza energetica”
tok/s per watt tra motori. Critico per homelab Mac Mini 24/7.
“Rilevare regressioni dopo aggiornamenti”
L'aggiornamento Ollama o macOS ha peggiorato le prestazioni? Rilevamento automatico via SQLite.
“Testare il supporto contesto lungo”
Benchmark --context-size 64k. Il tuo modello sopravvive a 256k di contesto?
“Il mio Mac fa throttling termico?”
Rilevamento deriva termica tra le esecuzioni. Unico in asiai.
“Benchmark riproducibili”
Metodologia MLPerf/SPEC. Warmup, mediana, decodifica greedy. Condividi con fiducia.
“Diagnostica in un comando”
asiai doctor diagnostica sistema, motori e database con suggerimenti di correzione.
“Dashboard visuale”
Dashboard web dark/light con grafici live, avanzamento SSE e controlli benchmark.
“Confrontare LLM testa a testa”
Stesso motore, modelli diversi. Quale quantizzazione vince?
“Monitoraggio Prometheus + Grafana”
Esponi /metrics, scrape con Prometheus, visualizza in Grafana. Osservabilità production-grade.
“Monitorare l'inferenza degli agenti IA”
Attività GPU, connessioni TCP, cache KV — sappi quando i tuoi agenti pensano, sono inattivi o sovraccarichi. API pronta per orchestratori di swarm.
Operativo in 60 secondi
Tre comandi. Tutto qui.
Installare
Rilevare
Benchmark
Scoperte reali
Numeri da benchmark reali su Apple Silicon.
MLX vs llama.cpp
MLX è 2,3x più veloce per architetture MoE (Qwen3.5-35B-A3B) su Apple Silicon.
VRAM: 64k → 256k
La VRAM resta costante da 64k a 256k di contesto con DeltaNet — non documentato altrove.
Motore > Modello
Stesso modello, stesso Mac: 30 tok/s su un motore, 71 tok/s su un altro. Il motore conta di più.
Motori supportati
Rilevamento automatico, zero configurazione.
La porta 8000 è condivisa da oMLX, vllm-mlx, vMLX e Rapid-MLX — asiai li distingue tramite /v1/models.
Cosa misuriamo
8 metriche, metodologia coerente, ogni esecuzione.
tok/s
Velocità di generazione (token/sec)
TTFT
Tempo al primo token
Power (W)
Consumo GPU in watt
tok/s/W
Efficienza energetica
Stability
Varianza tra esecuzioni
VRAM
Footprint memoria GPU
Thermal
Stato di throttling
Context
Scaling contesto lungo
I più veloci della community
Dati live da Mac reali, finestra di 90 giorni. Anonimo by design.
Un comando. Una scheda condivisibile.
Ogni tipo di bench genera un'immagine 1200×630 — modello, chip, mediane misurate, gate di onestà. Fatto per Reddit, X e Discord.