El speedtest de los LLM locales en Apple Silicon.Dale a tus agentes IA
visión sobre la inferencia
Compara Ollama, LM Studio, mlx-lm, llama.cpp y cinco motores más cara a cara — tok/s, TTFT, consumo y térmica, con un comando.La API REST de asiai permite a tus agentes IA monitorear, diagnosticar y optimizar la infraestructura LLM local de forma autónoma.
{
"chip": "Apple M4 Pro",
"ram_gb": 64.0,
"memory_pressure": "normal",
"gpu_utilization_percent": 45.2,
"engines": {
"ollama": { "running": true, "models_loaded": 2 },
"lmstudio": { "running": true, "models_loaded": 1 }
}
}
{
"system": {
"chip": "Apple M4 Pro",
"gpu_cores": 20,
"gpu_utilization_percent": 45.2,
"thermal_state": "nominal"
},
"engines": [{
"name": "ollama",
"models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
}]
}
El problema de los LLM locales
¿Te suena?
Fragmentado
Ollama, LM Studio, mlx-lm — cada uno con su CLI, formatos y métricas. Sin terreno común.
A ciegas
Sin monitoreo VRAM en tiempo real, sin seguimiento de consumo, sin alertas térmicas. Vuelas a ciegas.
Manual
Benchmarking significa scripts curl, copiar números y comparar en hojas de cálculo.
Un CLI. Cuatro superficies.
Todo se instala con el binario — sin plugins, sin archivos de configuración para empezar.
Haz bench de cualquier motor
7 tipos de bench — throughput, burst, agentic, calidad, contexto, energía, versiones. Estilo MLPerf: warmup, mediana, decodificación greedy, CI95.
$ asiai bench
Dashboard en vivo
GPU, VRAM, consumo y térmica en tiempo real vía IOReport pasivo — gauges en vivo, sparklines, controles de benchmark.
$ asiai web
Cockpit de flota
Todos los Mac de tu red en una pantalla — motores, modelos cargados, caché KV, consumo y alertas, con controles de operador.
$ asiai fleetClasificación comunitaria
Comparte benchmarks anónimamente y mira lo que otros Mac logran con el mismo chip — en la terminal o en la web.
$ asiai leaderboard¿Qué vas a descubrir?
Preguntas reales de r/LocalLLaMA, respondidas con un comando.
“¿Cuál motor es el más rápido?”
Comparación directa — la pregunta n°1 en r/LocalLLaMA.
“Monitorear un enjambre multi-agente”
LLMs ejecutándose 24/7 para agentes IA — monitorea VRAM, temperatura y rendimiento.
“Comparar eficiencia energética”
tok/s por vatio entre motores. Crítico para homelabs Mac Mini 24/7.
“Detectar regresiones tras actualizaciones”
¿La actualización de Ollama o macOS rompió tu rendimiento? Detección automática via SQLite.
“Probar soporte de contexto largo”
Benchmarks --context-size 64k. Sobrevive tu modelo a 256k de contexto?
“¿Mi Mac tiene throttling térmico?”
Detección de deriva térmica entre ejecuciones. Único en asiai.
“Benchmarks reproducibles”
Metodología MLPerf/SPEC. Warmup, mediana, decodificación greedy. Comparte con confianza.
“Diagnóstico en un comando”
asiai doctor diagnostica sistema, motores y base de datos con sugerencias de solución.
“Dashboard visual”
Dashboard web dark/light con gráficos en vivo, progreso SSE y controles de benchmark.
“Comparar LLMs cara a cara”
Mismo motor, diferentes modelos. ¿Qué cuantización gana?
“Monitoreo Prometheus + Grafana”
Expone /metrics, scrape con Prometheus, visualiza en Grafana. Observabilidad de nivel producción.
“Rastrear inferencia de agentes IA”
Actividad GPU, conexiones TCP, caché KV — sabe cuándo tus agentes piensan, están inactivos o sobrecargados. API lista para orquestadores de swarm.
Funcionando en 60 segundos
Tres comandos. Eso es todo.
Instalar
Detectar
Benchmark
Descubrimientos reales
Números de benchmarks reales en Apple Silicon.
MLX vs llama.cpp
MLX es 2,3x más rápido para arquitecturas MoE (Qwen3.5-35B-A3B) en Apple Silicon.
VRAM: 64k → 256k
La VRAM se mantiene constante de 64k a 256k con DeltaNet — no documentado en ningún otro lugar.
Motor > Modelo
Mismo modelo, mismo Mac: 30 tok/s en un motor, 71 tok/s en otro. El motor importa más.
Motores soportados
Detección automática, sin configuración.
El puerto 8000 es compartido por oMLX, vllm-mlx, vMLX y Rapid-MLX — asiai los distingue vía /v1/models.
Qué medimos
8 métricas, metodología consistente, cada ejecución.
tok/s
Velocidad de generación (tokens/seg)
TTFT
Tiempo al primer token
Power (W)
Consumo GPU en vatios
tok/s/W
Eficiencia energética
Stability
Varianza entre ejecuciones
VRAM
Huella de memoria GPU
Thermal
Estado de throttling
Context
Escalado contexto largo
Los más rápidos de la comunidad
Datos en vivo de Macs reales, ventana de 90 días. Anónimo por diseño.
Un comando. Una tarjeta compartible.
Cada tipo de bench genera una imagen de 1200×630 — modelo, chip, medianas medidas, gates de honestidad. Hecho para Reddit, X y Discord.