asiai speedometer logo Open source · Apache 2.0 · Zero dependencies

Der Speedtest für lokale LLMs auf Apple Silicon.Geben Sie Ihren KI-Agenten
Einblick in die Inferenz

Benchmarken Sie Ollama, LM Studio, mlx-lm, llama.cpp und fünf weitere Engines im Direktvergleich — tok/s, TTFT, Leistung und Thermik, mit einem Befehl.Die REST-API von asiai ermöglicht Ihren KI-Agenten, lokale LLM-Infrastruktur autonom zu überwachen, zu diagnostizieren und zu optimieren.

$pip install asiai
$asiai bench# 15s → your first comparison
Python 3.11+ · stdlib only · 9 engines auto-detected · agent-ready API
GET /api/status ≤ 500ms
{
  "chip": "Apple M4 Pro",
  "ram_gb": 64.0,
  "memory_pressure": "normal",
  "gpu_utilization_percent": 45.2,
  "engines": {
    "ollama": { "running": true, "models_loaded": 2 },
    "lmstudio": { "running": true, "models_loaded": 1 }
  }
}
GET /api/snapshot Full state
{
  "system": {
    "chip": "Apple M4 Pro",
    "gpu_cores": 20,
    "gpu_utilization_percent": 45.2,
    "thermal_state": "nominal"
  },
  "engines": [{
    "name": "ollama",
    "models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
  }]
}

Das Problem lokaler LLMs

Kommt Ihnen das bekannt vor?

01

Fragmentiert

Ollama, LM Studio, mlx-lm — jede mit eigenem CLI, Formaten und Metriken. Kein gemeinsamer Nenner.

02

Blind

Kein Echtzeit-VRAM-Monitoring, kein Stromverbrauch-Tracking, keine Thermal-Warnungen. Sie fliegen blind.

03

Manuell

Benchmarking bedeutet curl-Skripte, Zahlen kopieren und in Tabellen vergleichen.

Ein CLI. Vier Oberflächen.

Alles wird mit der Binary installiert — keine Plugins, keine Konfigurationsdateien zum Start.

asiai Benchmark screen — one-click Quick Bench with live progress

Jede Engine benchmarken

7 Bench-Typen — Throughput, Burst, Agentic, Qualität, Kontext, Energie, Versionen. MLPerf-Stil: Warmup, Median, Greedy-Dekodierung, CI95.

$ asiai bench
asiai live web dashboard — CPU load, memory, GPU power and loaded models

Live-Dashboard

GPU, VRAM, Leistung und Thermik in Echtzeit via passivem IOReport — Live-Gauges, Sparklines, Benchmark-Steuerung.

$ asiai web
asiai fleet cockpit — engines, models, KV cache and power across every Mac on the network

Flotten-Cockpit

Jeder Mac in Ihrem Netzwerk auf einem Bildschirm — Engines, geladene Modelle, KV-Cache, Leistung und Alerts, mit Operator-Steuerung.

$ asiai fleet

Community-Rangliste

Teilen Sie Benchmarks anonym und sehen Sie, was andere Macs auf dem gleichen Chip erreichen — im Terminal oder im Web.

$ asiai leaderboard

Was werden Sie entdecken?

Echte Fragen von r/LocalLLaMA, mit einem Befehl beantwortet.

“Welche Engine ist am schnellsten?”

Direktvergleich — die Frage Nr. 1 auf r/LocalLLaMA.

“Multi-Agent-Schwarm überwachen”

LLMs laufen 24/7 für KI-Agenten — VRAM, Temperatur und Leistung verfolgen.

“Energieeffizienz vergleichen”

tok/s pro Watt zwischen Engines. Kritisch für 24/7 Mac Mini Homelabs.

“Regressionen nach Updates erkennen”

Hat das Ollama- oder macOS-Update Ihre Leistung verschlechtert? Automatische Erkennung via SQLite.

“Langkontext-Unterstützung testen”

--context-size 64k Benchmarks. Übersteht Ihr Modell 256k Kontext?

“Drosselt mein Mac thermisch?”

Drift-Erkennung über Benchmark-Läufe hinweg. Einzigartig bei asiai.

“Reproduzierbare Benchmarks”

MLPerf/SPEC-Methodik. Warmup, Median, Greedy-Dekodierung. Mit Vertrauen teilen.

“Gesundheitscheck mit einem Befehl”

asiai doctor diagnostiziert System, Engines und Datenbank mit Lösungsvorschlägen.

“Visuelles Dashboard”

Dark/Light Web-Dashboard mit Live-Charts, SSE-Fortschritt und Benchmark-Steuerung.

“LLMs direkt vergleichen”

Gleiche Engine, verschiedene Modelle. Welche Quantisierung gewinnt?

“Prometheus + Grafana Monitoring”

Exponieren Sie /metrics, scrapen mit Prometheus, visualisieren in Grafana. Produktionsreife Observability.

“KI-Agent-Inferenz verfolgen”

GPU-Aktivität, TCP-Verbindungen, KV-Cache — wissen, wann Ihre Agenten denken, idle oder überlastet sind. API-bereit für Schwarm-Orchestratoren.

In 60 Sekunden startklar

Drei Befehle. Das war's.

1

Installieren

$ brew install druide67/tap/asiai
# or: pip install asiai
2

Erkennen

$ asiai detect
ollama (11434)
lmstudio (1234)
mlx-lm (8080)
→ 3 Engines gefunden
3

Benchmarken

$ asiai bench -m qwen3.5
ENGINETOK/STTFT
lmstudio71.242ms
ollama54.861ms
mlx-lm30.138ms

Echte Entdeckungen

Zahlen aus echten Benchmarks auf Apple Silicon.

2.3×

MLX vs llama.cpp

MLX ist 2,3x schneller für MoE-Architekturen (Qwen3.5-35B-A3B) auf Apple Silicon.

Flat

VRAM: 64k → 256k

VRAM bleibt konstant von 64k bis 256k Kontext mit DeltaNet — nirgendwo anders dokumentiert.

30 vs 71

Engine > Modell

Gleiches Modell, gleicher Mac: 30 tok/s auf einer Engine, 71 tok/s auf einer anderen. Die Engine zählt mehr.

Was wir messen

8 Metriken, konsistente Methodik, bei jedem Lauf.

tok/s

Generierungsgeschwindigkeit (Tokens/Sek.)

TTFT

Zeit bis zum ersten Token

Power (W)

GPU-Leistungsaufnahme in Watt

tok/s/W

Energieeffizienz

Stability

Lauf-zu-Lauf-Varianz

VRAM

GPU-Speicherbedarf

Thermal

Throttling-Status

Context

Langkontext-Performance

Die Schnellsten der Community

Live-Daten von echten Macs, 90-Tage-Fenster. Anonym by Design.

Komplette Rangliste →
01 llama-3.2-3b-instruct-4bit mlxlm Apple M4 Max · 64 GB 228.0 88 ms
02 qwen3.6:35b-a3b-nvfp4 ollama Apple M5 Max · 128 GB 124.9 39 ms
03 gemma-4-31b-it ollama Apple M5 Max · 128 GB 115.8 64 ms
Steuern Sie Ihren bei: asiai bench --share

Ein Befehl. Eine teilbare Karte.

Jeder Bench-Typ rendert ein 1200×630-Bild — Modell, Chip, gemessene Mediane, Ehrlichkeits-Gates. Gemacht für Reddit, X und Discord.

asiai bench --card
asiai throughput card — mtplx-qwen36-27b-optimized-speed on mlx-lm at 48.2 tok/s median (±1 CI95, n=5), Apple M5 Max
asiai agentic card — prefix-cache reuse fraction 0.80 across cold, warm and prefix phases, Qwen3.6-27B on llama.cpp asiai code-quality card — tool_call, recovery and thinking suites at 100%, deterministic grading, Qwen3.6-27B on llama.cpp