asiai speedometer logo Open source · Apache 2.0 · Zero dependencies

Le speedtest des LLM locaux sur Apple Silicon.Donnez à vos agents IA
la vision sur l'inférence

Benchmarkez Ollama, LM Studio, mlx-lm, llama.cpp et cinq autres moteurs face-à-face — tok/s, TTFT, puissance et thermique, en une commande.L'API REST d'asiai permet à vos agents IA de monitorer, diagnostiquer et optimiser l'infrastructure LLM locale de façon autonome.

$pip install asiai
$asiai bench# 15s → your first comparison
Python 3.11+ · stdlib only · 9 engines auto-detected · agent-ready API
GET /api/status ≤ 500ms
{
  "chip": "Apple M4 Pro",
  "ram_gb": 64.0,
  "memory_pressure": "normal",
  "gpu_utilization_percent": 45.2,
  "engines": {
    "ollama": { "running": true, "models_loaded": 2 },
    "lmstudio": { "running": true, "models_loaded": 1 }
  }
}
GET /api/snapshot Full state
{
  "system": {
    "chip": "Apple M4 Pro",
    "gpu_cores": 20,
    "gpu_utilization_percent": 45.2,
    "thermal_state": "nominal"
  },
  "engines": [{
    "name": "ollama",
    "models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
  }]
}

Le problème des LLM locaux

Ça vous dit quelque chose ?

01

Fragmenté

Ollama, LM Studio, mlx-lm — chacun avec son CLI, ses formats et ses métriques. Aucun terrain commun.

02

À l'aveugle

Pas de monitoring VRAM temps réel, pas de suivi de puissance, pas d'alertes thermiques. Vous volez à l'aveugle.

03

Manuel

Benchmarker = scripts curl, copier-coller des chiffres, comparer dans des tableurs.

Un CLI. Quatre surfaces.

Tout s'installe avec le binaire — pas de plugins, pas de fichiers de config pour démarrer.

asiai Benchmark screen — one-click Quick Bench with live progress

Benchmarkez n'importe quel moteur

7 types de bench — throughput, burst, agentic, qualité, contexte, énergie, versions. Style MLPerf : warmup, médiane, décodage greedy, CI95.

$ asiai bench
asiai live web dashboard — CPU load, memory, GPU power and loaded models

Dashboard en direct

GPU, VRAM, puissance et thermique en temps réel via IOReport passif — jauges live, sparklines, contrôles de benchmark.

$ asiai web
asiai fleet cockpit — engines, models, KV cache and power across every Mac on the network

Cockpit de flotte

Tous les Mac de votre réseau sur un écran — moteurs, modèles chargés, cache KV, puissance et alertes, avec contrôles opérateur.

$ asiai fleet

Classement communautaire

Partagez vos benchmarks anonymement et voyez ce que d'autres Mac obtiennent sur la même puce — dans le terminal ou sur le web.

$ asiai leaderboard

Qu'allez-vous découvrir ?

Les vraies questions de r/LocalLLaMA, une commande suffit.

“Quel moteur est le plus rapide ?”

Comparaison face-à-face — la question n°1 sur r/LocalLLaMA.

“Monitorer un essaim multi-agents”

LLMs tournant 24/7 pour des agents IA — suivez VRAM, thermique et performances.

“Comparer l'efficacité énergétique”

tok/s par watt entre moteurs. Essentiel pour les homelabs Mac Mini 24/7.

“Détecter les régressions après mise à jour”

La mise à jour Ollama ou macOS a cassé vos performances ? Détection auto via SQLite.

“Tester le support long contexte”

Benchmarks --context-size 64k. Votre modèle survit-il à 256k de contexte ?

“Mon Mac est-il en throttling thermique ?”

Détection de dérive thermique entre les runs. Unique à asiai.

“Benchmarks reproductibles”

Méthodologie MLPerf/SPEC. Warmup, médiane, décodage greedy. Partagez en confiance.

“Diagnostic en une commande”

asiai doctor diagnostique système, moteurs et base de données avec suggestions de corrections.

“Dashboard visuel”

Dashboard web dark/light avec graphiques en direct, progression SSE, contrôles de benchmark.

“Comparer les LLMs face-à-face”

Même moteur, différents modèles. Quelle quantification gagne ?

“Monitoring Prometheus + Grafana”

Exposez /metrics, scrapez avec Prometheus, visualisez dans Grafana. Observabilité production-ready.

“Suivre l'inférence des agents IA”

Activité GPU, connexions TCP, cache KV — sachez quand vos agents réfléchissent, sont inactifs ou surchargés. API prête pour les orchestrateurs de swarm.

Opérationnel en 60 secondes

Trois commandes. C'est tout.

1

Installer

$ brew install druide67/tap/asiai
# or: pip install asiai
2

Détecter

$ asiai detect
ollama (11434)
lmstudio (1234)
mlx-lm (8080)
→ 3 moteurs trouvés
3

Benchmarker

$ asiai bench -m qwen3.5
ENGINETOK/STTFT
lmstudio71.242ms
ollama54.861ms
mlx-lm30.138ms

Découvertes réelles

Chiffres issus de vrais benchmarks sur Apple Silicon.

2.3×

MLX vs llama.cpp

MLX est 2,3x plus rapide pour les architectures MoE (Qwen3.5-35B-A3B) sur Apple Silicon.

Flat

VRAM : 64k → 256k

La VRAM reste constante de 64k à 256k de contexte avec DeltaNet — non documenté ailleurs.

30 vs 71

Moteur > Modèle

Même modèle, même Mac : 30 tok/s sur un moteur, 71 tok/s sur un autre. Le moteur compte plus.

Ce qu'on mesure

8 métriques, méthodologie constante, à chaque run.

tok/s

Vitesse de génération (tokens/sec)

TTFT

Temps au premier token

Power (W)

Consommation GPU en watts

tok/s/W

Efficacité énergétique

Stability

Variance inter-runs

VRAM

Empreinte mémoire GPU

Thermal

État de throttling

Context

Scaling perf long contexte

Les plus rapides de la communauté

Données live de vrais Mac, fenêtre de 90 jours. Anonyme par conception.

Classement complet →
01 llama-3.2-3b-instruct-4bit mlxlm Apple M4 Max · 64 GB 228.0 88 ms
02 qwen3.6:35b-a3b-nvfp4 ollama Apple M5 Max · 128 GB 124.9 39 ms
03 gemma-4-31b-it ollama Apple M5 Max · 128 GB 115.8 64 ms
Ajoutez le vôtre : asiai bench --share

Une commande. Une carte partageable.

Chaque type de bench génère une image 1200×630 — modèle, puce, médianes mesurées, gates d'honnêteté. Fait pour Reddit, X et Discord.

asiai bench --card
asiai throughput card — mtplx-qwen36-27b-optimized-speed on mlx-lm at 48.2 tok/s median (±1 CI95, n=5), Apple M5 Max
asiai agentic card — prefix-cache reuse fraction 0.80 across cold, warm and prefix phases, Qwen3.6-27B on llama.cpp asiai code-quality card — tool_call, recovery and thinking suites at 100%, deterministic grading, Qwen3.6-27B on llama.cpp