Der Speedtest für lokale LLMs auf Apple Silicon.Geben Sie Ihren KI-Agenten
Einblick in die Inferenz
Benchmarken Sie Ollama, LM Studio, mlx-lm, llama.cpp und fünf weitere Engines im Direktvergleich — tok/s, TTFT, Leistung und Thermik, mit einem Befehl.Die REST-API von asiai ermöglicht Ihren KI-Agenten, lokale LLM-Infrastruktur autonom zu überwachen, zu diagnostizieren und zu optimieren.
{
"chip": "Apple M4 Pro",
"ram_gb": 64.0,
"memory_pressure": "normal",
"gpu_utilization_percent": 45.2,
"engines": {
"ollama": { "running": true, "models_loaded": 2 },
"lmstudio": { "running": true, "models_loaded": 1 }
}
}
{
"system": {
"chip": "Apple M4 Pro",
"gpu_cores": 20,
"gpu_utilization_percent": 45.2,
"thermal_state": "nominal"
},
"engines": [{
"name": "ollama",
"models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
}]
}
Das Problem lokaler LLMs
Kommt Ihnen das bekannt vor?
Fragmentiert
Ollama, LM Studio, mlx-lm — jede mit eigenem CLI, Formaten und Metriken. Kein gemeinsamer Nenner.
Blind
Kein Echtzeit-VRAM-Monitoring, kein Stromverbrauch-Tracking, keine Thermal-Warnungen. Sie fliegen blind.
Manuell
Benchmarking bedeutet curl-Skripte, Zahlen kopieren und in Tabellen vergleichen.
Ein CLI. Vier Oberflächen.
Alles wird mit der Binary installiert — keine Plugins, keine Konfigurationsdateien zum Start.
Jede Engine benchmarken
7 Bench-Typen — Throughput, Burst, Agentic, Qualität, Kontext, Energie, Versionen. MLPerf-Stil: Warmup, Median, Greedy-Dekodierung, CI95.
$ asiai bench
Live-Dashboard
GPU, VRAM, Leistung und Thermik in Echtzeit via passivem IOReport — Live-Gauges, Sparklines, Benchmark-Steuerung.
$ asiai web
Flotten-Cockpit
Jeder Mac in Ihrem Netzwerk auf einem Bildschirm — Engines, geladene Modelle, KV-Cache, Leistung und Alerts, mit Operator-Steuerung.
$ asiai fleetCommunity-Rangliste
Teilen Sie Benchmarks anonym und sehen Sie, was andere Macs auf dem gleichen Chip erreichen — im Terminal oder im Web.
$ asiai leaderboardWas werden Sie entdecken?
Echte Fragen von r/LocalLLaMA, mit einem Befehl beantwortet.
“Welche Engine ist am schnellsten?”
Direktvergleich — die Frage Nr. 1 auf r/LocalLLaMA.
“Multi-Agent-Schwarm überwachen”
LLMs laufen 24/7 für KI-Agenten — VRAM, Temperatur und Leistung verfolgen.
“Energieeffizienz vergleichen”
tok/s pro Watt zwischen Engines. Kritisch für 24/7 Mac Mini Homelabs.
“Regressionen nach Updates erkennen”
Hat das Ollama- oder macOS-Update Ihre Leistung verschlechtert? Automatische Erkennung via SQLite.
“Langkontext-Unterstützung testen”
--context-size 64k Benchmarks. Übersteht Ihr Modell 256k Kontext?
“Drosselt mein Mac thermisch?”
Drift-Erkennung über Benchmark-Läufe hinweg. Einzigartig bei asiai.
“Reproduzierbare Benchmarks”
MLPerf/SPEC-Methodik. Warmup, Median, Greedy-Dekodierung. Mit Vertrauen teilen.
“Gesundheitscheck mit einem Befehl”
asiai doctor diagnostiziert System, Engines und Datenbank mit Lösungsvorschlägen.
“Visuelles Dashboard”
Dark/Light Web-Dashboard mit Live-Charts, SSE-Fortschritt und Benchmark-Steuerung.
“LLMs direkt vergleichen”
Gleiche Engine, verschiedene Modelle. Welche Quantisierung gewinnt?
“Prometheus + Grafana Monitoring”
Exponieren Sie /metrics, scrapen mit Prometheus, visualisieren in Grafana. Produktionsreife Observability.
“KI-Agent-Inferenz verfolgen”
GPU-Aktivität, TCP-Verbindungen, KV-Cache — wissen, wann Ihre Agenten denken, idle oder überlastet sind. API-bereit für Schwarm-Orchestratoren.
In 60 Sekunden startklar
Drei Befehle. Das war's.
Installieren
Erkennen
Benchmarken
Echte Entdeckungen
Zahlen aus echten Benchmarks auf Apple Silicon.
MLX vs llama.cpp
MLX ist 2,3x schneller für MoE-Architekturen (Qwen3.5-35B-A3B) auf Apple Silicon.
VRAM: 64k → 256k
VRAM bleibt konstant von 64k bis 256k Kontext mit DeltaNet — nirgendwo anders dokumentiert.
Engine > Modell
Gleiches Modell, gleicher Mac: 30 tok/s auf einer Engine, 71 tok/s auf einer anderen. Die Engine zählt mehr.
Unterstützte Engines
Automatisch erkannt, keine Konfiguration nötig.
Port 8000 wird von oMLX, vllm-mlx, vMLX und Rapid-MLX geteilt — asiai unterscheidet sie über /v1/models.
Was wir messen
8 Metriken, konsistente Methodik, bei jedem Lauf.
tok/s
Generierungsgeschwindigkeit (Tokens/Sek.)
TTFT
Zeit bis zum ersten Token
Power (W)
GPU-Leistungsaufnahme in Watt
tok/s/W
Energieeffizienz
Stability
Lauf-zu-Lauf-Varianz
VRAM
GPU-Speicherbedarf
Thermal
Throttling-Status
Context
Langkontext-Performance
Die Schnellsten der Community
Live-Daten von echten Macs, 90-Tage-Fenster. Anonym by Design.
Ein Befehl. Eine teilbare Karte.
Jeder Bench-Typ rendert ein 1200×630-Bild — Modell, Chip, gemessene Mediane, Ehrlichkeits-Gates. Gemacht für Reddit, X und Discord.