Omlx AI

Servidor de inferencia de LLM local para Mac con caché en SSD: ejecuta agentes de programación como Claude Code o Cursor con respuestas en 5 s.

Verificada API disponible Plan gratuito
Datos rápidos
Qué es Servidor de inferencia de LLM local para Mac con caché en SSD: ejecuta agentes de programación como Claude Code o Cursor con respuestas en 5 s.
Precios Freemium
Plan gratuito
Plataforma Desktop Application
API
Ideal para running coding agents locally, testing LLMs on Mac
Dominio registrado 2025

Datos actualizados 20 de agosto de 2026

¿Qué hace Omlx AI?

Omlx AI es un servidor de inferencia de LLM local creado específicamente para Macs con Apple Silicon. Utiliza el framework MLX para ejecutar modelos de lenguaje extensos directamente en tu máquina, centrándose en una baja latencia y un alto rendimiento para agentes de programación como Claude Code, OpenClaw y Cursor. En lugar de esperar entre 30 y 90 segundos por una respuesta, Omlx AI promete un tiempo hasta el primer token inferior a 5 segundos en el segundo turno, gracias al almacenamiento en caché persistente en SSD.

La innovación clave es el paged SSD KV caching. Las herramientas de inferencia local tradicionales, como Ollama y LM Studio, almacenan la caché de clave-valor en la memoria, la cual se invalida cuando el contexto cambia a mitad de una sesión. Omlx AI guarda cada bloque de caché en el disco, por lo que, cuando un agente de programación regresa a un contexto anterior, los datos almacenados en caché se restauran desde el SSD en milisegundos. Esto reduce drásticamente el recálculo. La herramienta también es compatible con el continuous batching, gestionando múltiples solicitudes concurrentes con una aceleración de hasta 4,14× con una concurrencia de 8×. Funciona como una aplicación nativa de la barra de menús de macOS (no es Electron) con un panel web para gestionar modelos, monitorizar el rendimiento y generar comandos de configuración de API.

Omlx AI es compatible con los formatos de API de OpenAI y Anthropic, por lo que funciona como un backend sustituible para cualquier cliente que soporte esos estándares. Puede servir múltiples tipos de modelos simultáneamente —LLMs, VLMs, modelos de embedding y rerankers— e incluye soporte de tool calling para JSON, Qwen, Gemma, GLM, MiniMax y MCP. El público objetivo son desarrolladores e investigadores de IA que quieran ejecutar modelos grandes localmente en un Mac sin los largos tiempos de espera típicos del almacenamiento en caché solo en memoria. Resulta especialmente útil para cualquier persona que utilice agentes de programación que requieran cambios de contexto frecuentes, como ingenieros de software que experimenten con la programación autónoma o investigadores que prueben modelos de razonamiento como DeepSeek y Qwen. La instalación es sencilla: descarga el DMG o instala desde el código fuente, y la herramienta lee automáticamente tu caché existente de Hugging Face, por lo que no es necesario volver a descargar los modelos.

Características principales

Qué la hace destacar
01
Almacenamiento en caché KV de Paged SSD: persiste los bloques de caché en el disco, lo que permite restaurar prefijos en milisegundos en lugar de tener que recalcularlos desde cero.
02
Continuous batching: gestiona múltiples solicitudes simultáneas con una aceleración de hasta 4,14× con una concurrencia de 8×.
03
Aplicación nativa para la barra de menús de macOS: permite iniciar, detener y monitorear el servidor desde la barra de menús; incluye un panel de control web.
04
Servicio multimodelo: permite cargar simultáneamente modelos LLM, VLM, de embedding y de reranker.
05
API de sustitución directa para OpenAI + Anthropic — compatible con Claude Code, OpenClaw, Cursor y cualquier cliente compatible con OpenAI.

¿Para quién es Omlx AI?

Quién saca más provecho de esta herramienta
running coding agents locally
testing LLMs on Mac
building AI-powered applications with local inference

Confianza y presencia

Dominio Dominio registrado en 2025

Alternativas en Inferencia de IA

vLLM Verificada Inferencia de IA

Motor de inferencia de LLM de alto rendimiento para un servicio de modelos de IA rápido y eficiente en memoria.

Sitio Top 100k
Lemonade AI Verificada Inferencia de IA

Entorno de ejecución de IA local para texto, imagen y voz: ejecuta modelos en tu propio hardware, gratis y de forma privada

Oxlo.ai Verificada Inferencia de IA

Stack de inferencia de IA priorizando la privacidad: ejecuta más de 45 modelos de código abierto con precio mensual fijo y cero retención de datos

Entrim AI Verificada Inferencia de IA

API para ejecutar LLM de código abierto: hasta un 80 % más barata que la competencia, con alto rendimiento y prioridad en la privacidad.

Boxgpt Verificada Inferencia de IA

Servidor de IA local plug-and-play: ejecuta LLM y generación de imágenes en tu propio hardware con total privacidad de datos.

Inferless Verificada Inferencia de IA

Plataforma de GPU serverless para desplegar modelos de aprendizaje automático en minutos, con autoescalado y precios de pago por uso.

Groq Verificada Inferencia de IA

API de inferencia de IA de alta velocidad y bajo coste para ejecutar modelos de lenguaje extensos con una latencia mínima.

zapier · make+2 Sitio Top 100k
local.ai Verificada Inferencia de IA

Aplicación de escritorio para ejecutar modelos de IA sin conexión: descarga, verifica y usa modelos sin internet ni GPU.

Compartir X LinkedIn Telegram
Omlx AI Visitar