asiai speedometer logo Open source · Apache 2.0 · Zero dependencies

El speedtest de los LLM locales en Apple Silicon.Dale a tus agentes IA
visión sobre la inferencia

Compara Ollama, LM Studio, mlx-lm, llama.cpp y cinco motores más cara a cara — tok/s, TTFT, consumo y térmica, con un comando.La API REST de asiai permite a tus agentes IA monitorear, diagnosticar y optimizar la infraestructura LLM local de forma autónoma.

$pip install asiai
$asiai bench# 15s → your first comparison
Python 3.11+ · stdlib only · 9 engines auto-detected · agent-ready API
GET /api/status ≤ 500ms
{
  "chip": "Apple M4 Pro",
  "ram_gb": 64.0,
  "memory_pressure": "normal",
  "gpu_utilization_percent": 45.2,
  "engines": {
    "ollama": { "running": true, "models_loaded": 2 },
    "lmstudio": { "running": true, "models_loaded": 1 }
  }
}
GET /api/snapshot Full state
{
  "system": {
    "chip": "Apple M4 Pro",
    "gpu_cores": 20,
    "gpu_utilization_percent": 45.2,
    "thermal_state": "nominal"
  },
  "engines": [{
    "name": "ollama",
    "models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
  }]
}

El problema de los LLM locales

¿Te suena?

01

Fragmentado

Ollama, LM Studio, mlx-lm — cada uno con su CLI, formatos y métricas. Sin terreno común.

02

A ciegas

Sin monitoreo VRAM en tiempo real, sin seguimiento de consumo, sin alertas térmicas. Vuelas a ciegas.

03

Manual

Benchmarking significa scripts curl, copiar números y comparar en hojas de cálculo.

Un CLI. Cuatro superficies.

Todo se instala con el binario — sin plugins, sin archivos de configuración para empezar.

asiai Benchmark screen — one-click Quick Bench with live progress

Haz bench de cualquier motor

7 tipos de bench — throughput, burst, agentic, calidad, contexto, energía, versiones. Estilo MLPerf: warmup, mediana, decodificación greedy, CI95.

$ asiai bench
asiai live web dashboard — CPU load, memory, GPU power and loaded models

Dashboard en vivo

GPU, VRAM, consumo y térmica en tiempo real vía IOReport pasivo — gauges en vivo, sparklines, controles de benchmark.

$ asiai web
asiai fleet cockpit — engines, models, KV cache and power across every Mac on the network

Cockpit de flota

Todos los Mac de tu red en una pantalla — motores, modelos cargados, caché KV, consumo y alertas, con controles de operador.

$ asiai fleet

Clasificación comunitaria

Comparte benchmarks anónimamente y mira lo que otros Mac logran con el mismo chip — en la terminal o en la web.

$ asiai leaderboard

¿Qué vas a descubrir?

Preguntas reales de r/LocalLLaMA, respondidas con un comando.

“¿Cuál motor es el más rápido?”

Comparación directa — la pregunta n°1 en r/LocalLLaMA.

“Monitorear un enjambre multi-agente”

LLMs ejecutándose 24/7 para agentes IA — monitorea VRAM, temperatura y rendimiento.

“Comparar eficiencia energética”

tok/s por vatio entre motores. Crítico para homelabs Mac Mini 24/7.

“Detectar regresiones tras actualizaciones”

¿La actualización de Ollama o macOS rompió tu rendimiento? Detección automática via SQLite.

“Probar soporte de contexto largo”

Benchmarks --context-size 64k. Sobrevive tu modelo a 256k de contexto?

“¿Mi Mac tiene throttling térmico?”

Detección de deriva térmica entre ejecuciones. Único en asiai.

“Benchmarks reproducibles”

Metodología MLPerf/SPEC. Warmup, mediana, decodificación greedy. Comparte con confianza.

“Diagnóstico en un comando”

asiai doctor diagnostica sistema, motores y base de datos con sugerencias de solución.

“Dashboard visual”

Dashboard web dark/light con gráficos en vivo, progreso SSE y controles de benchmark.

“Comparar LLMs cara a cara”

Mismo motor, diferentes modelos. ¿Qué cuantización gana?

“Monitoreo Prometheus + Grafana”

Expone /metrics, scrape con Prometheus, visualiza en Grafana. Observabilidad de nivel producción.

“Rastrear inferencia de agentes IA”

Actividad GPU, conexiones TCP, caché KV — sabe cuándo tus agentes piensan, están inactivos o sobrecargados. API lista para orquestadores de swarm.

Funcionando en 60 segundos

Tres comandos. Eso es todo.

1

Instalar

$ brew install druide67/tap/asiai
# or: pip install asiai
2

Detectar

$ asiai detect
ollama (11434)
lmstudio (1234)
mlx-lm (8080)
→ 3 motores encontrados
3

Benchmark

$ asiai bench -m qwen3.5
ENGINETOK/STTFT
lmstudio71.242ms
ollama54.861ms
mlx-lm30.138ms

Descubrimientos reales

Números de benchmarks reales en Apple Silicon.

2.3×

MLX vs llama.cpp

MLX es 2,3x más rápido para arquitecturas MoE (Qwen3.5-35B-A3B) en Apple Silicon.

Flat

VRAM: 64k → 256k

La VRAM se mantiene constante de 64k a 256k con DeltaNet — no documentado en ningún otro lugar.

30 vs 71

Motor > Modelo

Mismo modelo, mismo Mac: 30 tok/s en un motor, 71 tok/s en otro. El motor importa más.

Qué medimos

8 métricas, metodología consistente, cada ejecución.

tok/s

Velocidad de generación (tokens/seg)

TTFT

Tiempo al primer token

Power (W)

Consumo GPU en vatios

tok/s/W

Eficiencia energética

Stability

Varianza entre ejecuciones

VRAM

Huella de memoria GPU

Thermal

Estado de throttling

Context

Escalado contexto largo

Los más rápidos de la comunidad

Datos en vivo de Macs reales, ventana de 90 días. Anónimo por diseño.

Clasificación completa →
01 llama-3.2-3b-instruct-4bit mlxlm Apple M4 Max · 64 GB 228.0 88 ms
02 qwen3.6:35b-a3b-nvfp4 ollama Apple M5 Max · 128 GB 124.9 39 ms
03 gemma-4-31b-it ollama Apple M5 Max · 128 GB 115.8 64 ms
Aporta el tuyo: asiai bench --share

Un comando. Una tarjeta compartible.

Cada tipo de bench genera una imagen de 1200×630 — modelo, chip, medianas medidas, gates de honestidad. Hecho para Reddit, X y Discord.

asiai bench --card
asiai throughput card — mtplx-qwen36-27b-optimized-speed on mlx-lm at 48.2 tok/s median (±1 CI95, n=5), Apple M5 Max
asiai agentic card — prefix-cache reuse fraction 0.80 across cold, warm and prefix phases, Qwen3.6-27B on llama.cpp asiai code-quality card — tool_call, recovery and thinking suites at 100%, deterministic grading, Qwen3.6-27B on llama.cpp