Le speedtest des LLM locaux sur Apple Silicon.Donnez à vos agents IA
la vision sur l'inférence
Benchmarkez Ollama, LM Studio, mlx-lm, llama.cpp et cinq autres moteurs face-à-face — tok/s, TTFT, puissance et thermique, en une commande.L'API REST d'asiai permet à vos agents IA de monitorer, diagnostiquer et optimiser l'infrastructure LLM locale de façon autonome.
{
"chip": "Apple M4 Pro",
"ram_gb": 64.0,
"memory_pressure": "normal",
"gpu_utilization_percent": 45.2,
"engines": {
"ollama": { "running": true, "models_loaded": 2 },
"lmstudio": { "running": true, "models_loaded": 1 }
}
}
{
"system": {
"chip": "Apple M4 Pro",
"gpu_cores": 20,
"gpu_utilization_percent": 45.2,
"thermal_state": "nominal"
},
"engines": [{
"name": "ollama",
"models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
}]
}
Le problème des LLM locaux
Ça vous dit quelque chose ?
Fragmenté
Ollama, LM Studio, mlx-lm — chacun avec son CLI, ses formats et ses métriques. Aucun terrain commun.
À l'aveugle
Pas de monitoring VRAM temps réel, pas de suivi de puissance, pas d'alertes thermiques. Vous volez à l'aveugle.
Manuel
Benchmarker = scripts curl, copier-coller des chiffres, comparer dans des tableurs.
Un CLI. Quatre surfaces.
Tout s'installe avec le binaire — pas de plugins, pas de fichiers de config pour démarrer.
Benchmarkez n'importe quel moteur
7 types de bench — throughput, burst, agentic, qualité, contexte, énergie, versions. Style MLPerf : warmup, médiane, décodage greedy, CI95.
$ asiai bench
Dashboard en direct
GPU, VRAM, puissance et thermique en temps réel via IOReport passif — jauges live, sparklines, contrôles de benchmark.
$ asiai web
Cockpit de flotte
Tous les Mac de votre réseau sur un écran — moteurs, modèles chargés, cache KV, puissance et alertes, avec contrôles opérateur.
$ asiai fleetClassement communautaire
Partagez vos benchmarks anonymement et voyez ce que d'autres Mac obtiennent sur la même puce — dans le terminal ou sur le web.
$ asiai leaderboardQu'allez-vous découvrir ?
Les vraies questions de r/LocalLLaMA, une commande suffit.
“Quel moteur est le plus rapide ?”
Comparaison face-à-face — la question n°1 sur r/LocalLLaMA.
“Monitorer un essaim multi-agents”
LLMs tournant 24/7 pour des agents IA — suivez VRAM, thermique et performances.
“Comparer l'efficacité énergétique”
tok/s par watt entre moteurs. Essentiel pour les homelabs Mac Mini 24/7.
“Détecter les régressions après mise à jour”
La mise à jour Ollama ou macOS a cassé vos performances ? Détection auto via SQLite.
“Tester le support long contexte”
Benchmarks --context-size 64k. Votre modèle survit-il à 256k de contexte ?
“Mon Mac est-il en throttling thermique ?”
Détection de dérive thermique entre les runs. Unique à asiai.
“Benchmarks reproductibles”
Méthodologie MLPerf/SPEC. Warmup, médiane, décodage greedy. Partagez en confiance.
“Diagnostic en une commande”
asiai doctor diagnostique système, moteurs et base de données avec suggestions de corrections.
“Dashboard visuel”
Dashboard web dark/light avec graphiques en direct, progression SSE, contrôles de benchmark.
“Comparer les LLMs face-à-face”
Même moteur, différents modèles. Quelle quantification gagne ?
“Monitoring Prometheus + Grafana”
Exposez /metrics, scrapez avec Prometheus, visualisez dans Grafana. Observabilité production-ready.
“Suivre l'inférence des agents IA”
Activité GPU, connexions TCP, cache KV — sachez quand vos agents réfléchissent, sont inactifs ou surchargés. API prête pour les orchestrateurs de swarm.
Opérationnel en 60 secondes
Trois commandes. C'est tout.
Installer
Détecter
Benchmarker
Découvertes réelles
Chiffres issus de vrais benchmarks sur Apple Silicon.
MLX vs llama.cpp
MLX est 2,3x plus rapide pour les architectures MoE (Qwen3.5-35B-A3B) sur Apple Silicon.
VRAM : 64k → 256k
La VRAM reste constante de 64k à 256k de contexte avec DeltaNet — non documenté ailleurs.
Moteur > Modèle
Même modèle, même Mac : 30 tok/s sur un moteur, 71 tok/s sur un autre. Le moteur compte plus.
Moteurs supportés
Détection automatique, zéro configuration.
Le port 8000 est partagé par oMLX, vllm-mlx, vMLX et Rapid-MLX — asiai les distingue via /v1/models.
Ce qu'on mesure
8 métriques, méthodologie constante, à chaque run.
tok/s
Vitesse de génération (tokens/sec)
TTFT
Temps au premier token
Power (W)
Consommation GPU en watts
tok/s/W
Efficacité énergétique
Stability
Variance inter-runs
VRAM
Empreinte mémoire GPU
Thermal
État de throttling
Context
Scaling perf long contexte
Les plus rapides de la communauté
Données live de vrais Mac, fenêtre de 90 jours. Anonyme par conception.
Une commande. Une carte partageable.
Chaque type de bench génère une image 1200×630 — modèle, puce, médianes mesurées, gates d'honnêteté. Fait pour Reddit, X et Discord.