IA local para tu PyME: resultados medibles, sin mensualidades de API
Evaluamos 3 modelos de lenguaje corriendo en TU servidor — los mismos resultados que ves acá son los que instalamos en tu negocio: 100% de clasificación correcta, $0 por consulta y cero datos enviados a terceros.
Qué recibes al contratar la IA local de MR.COM
Todo lo que documentamos abajo no es un experimento: es el sistema que instalamos, configuramos y dejamos funcionando en tu infraestructura.
Instalación llave en mano
Montamos router ATLAS + 3 modelos en tu servidor (o te recomendamos el hardware). Operativo en días, no meses.
$0 por consulta
Sin APIs externas ni cobro por token. El servidor es tuyo: usá la IA las veces que quieras al costo fijo de tu electricidad.
Datos que nunca salen
100% on-premises — cumplimiento Ley 21.719 sin workarounds. Ideal para PYMEs con información sensible.
Resumen ejecutivo (Abstract)
Este documento describe la puesta en operación y la evaluación de tres modelos de lenguaje locales (Qwen3.5-2B, Qwen3-0.6B y Gemma 4 E2B) corriendo con llama.cpp en Docker sobre un único servidor Ubuntu 24.04 con CPU Intel i5-4440, 16 GB de RAM y una GPU GTX 1050 con 2 GB de VRAM. Todos los modelos usan cuantización Q4_K_M.
Las consultas pasan por un router determinista (ATLAS) que aplica reglas por expresión regular y un clasificador IA de 0,6B entrenado en contexto con 16 ejemplos few-shot, seguido de una matriz de cuatro rutas y un guard anti-alucinación (JEV) que intercepta antes del modelo cualquier consulta de precio o costo sin dato verificado.
Resultados en el entorno de producción, octubre 2026: 40/40 consultas clasificadas correctamente (100%, desde un 65% inicial), 20/20 pruebas de calidad aprobadas en seis categorías, latencia p50 de clasificación de 1,4 s, $0 de costo por consulta en las rutas locales y cero datos enviados a terceros. Tres modelos comparten un servidor de aproximadamente USD 500, sin mensualidades de API.
Hardware y modelos en ejecución
Todo el sistema vive en un solo equipo. No hay clúster ni nodo dedicado: el mismo servidor atiende el router, los modelos y las aplicaciones de negocio.
2.1 Hardware
| Componente | Especificación |
|---|---|
| Sistema operativo | Ubuntu 24.04 (servidor propio) |
| CPU | Intel i5-4440 — 4 núcleos |
| Memoria | 16 GB RAM |
| GPU | NVIDIA GTX 1050 — 2 GB de VRAM |
| Motor de inferencia | llama.cpp, un contenedor Docker por modelo |
| Costo de referencia del hardware | Aproximadamente USD 500 por el servidor completo |
| Alcance de despliegue | 100% on-premises: los modelos y el router operan dentro de la infraestructura propia |
La inversión de hardware es única: los tres modelos comparten este mismo servidor.
2.2 Modelos locales
| Modelo | Cuantización | Ejecución | Puerto | VRAM | Cuándo corre | Rol y rendimiento |
|---|---|---|---|---|---|---|
| Qwen3.5-2B | Q4_K_M | GPU (GTX 1050) | 11436 | Usa la GPU de 2 GB | Siempre encendido | Núcleo + bot. 30,0 tok/s. Matemática y razonamiento del día a día. |
| Qwen3-0.6B | Q4_K_M | CPU | 11441 | +0 GB | Siempre encendido | Clasificador de consultas. 31,0 tok/s clasificando, 29,9 tok/s generando. Decide la ruta en p50 1,4 s. |
| Gemma 4 E2B | Q4_K_M | CPU | 11437 | +0 GB | Solo bajo demanda | Specialist de calidad. 7,7 tok/s. Análisis, comparaciones y diseño. |
Los puertos son internos de la red local del servidor (loopback, no expuestos a internet). El servicio del router ATLAS (no es un modelo) escucha en el puerto 11445.
Cómo se evaluó
Tres evaluaciones complementarias: una para el enrutamiento, una para la calidad de las respuestas y una para el costo y la latencia. Todas corrieron sobre el servidor de producción, no sobre una máquina de laboratorio.
Criterios de aprobación
- Enrutamiento: la ruta elegida coincide exactamente con la ruta esperada del caso.
- Formato: si el caso pide JSON, lista o tabla, la respuesta cumple ese formato.
- Contenido: la respuesta incluye lo que el caso exige, sin omitirlo.
- Sin datos inventados: no se acepta ninguna cifra, precio o dato verificable que no venga de una fuente.
- Multiturno: la respuesta mantiene el contexto de los mensajes anteriores.
- Herramientas: la llamada de función se emite con los parámetros correctos.
Una prueba se aprueba solo si cumple todos los criterios declarados para ese caso. No hay puntaje parcial.
Ruta de una consulta: de la entrada al modelo
El router ATLAS es un servicio independiente que decide, antes de generar cualquier texto, qué componente debe responder. Cinco etapas, en este orden.
Matriz de rutas
| Ruta | Cuándo se usa | Destino | Costo por consulta |
|---|---|---|---|
| direct | Saludos, despedidas, hora y respuestas de plantilla (regex) | Plantilla local, sin generación de tokens | $0 |
| core | Consultas del día a día: matemática, razonamiento, soporte | Qwen3.5-2B en GPU (siempre encendido) | $0 |
| specialist | Tareas complejas: análisis, comparaciones, diseño | Gemma 4 E2B en CPU, se enciende bajo demanda | $0 |
| expert | Casos que requieren el mayor nivel de respuesta | Modelo de nube vía API, siempre con el guard activo | Según el proveedor externo |
Las tres rutas locales (direct, core, specialist) no dependen de internet ni de claves de API de pago.
Por qué el guard va antes del modelo. Un filtro posterior deja pasar el texto generado y solo corrige después; el guard JEV interrumpe la consulta cuando aún no existe respuesta: no hay manera de que el modelo invente un precio porque nunca llega a generarlo. Si hay un dato verificado disponible, se responde con ese dato.
Resultados de la evaluación
Mediciones internas realizadas en nuestro servidor de producción, octubre de 2026.
5.1 Enrutamiento (suite gold-label, 40 casos)
| Casos | Clasificados correctamente | Precisión | Evolución |
|---|---|---|---|
| 40 | 40 | 100% | 65% en la primera pasada hasta 100%, iterando con la suite gold-label |
Cada caso tiene una única ruta esperada. El 100% corresponde a 40 aciertos sobre 40 consultas.
5.2 Calidad (suite avanzada, 6 categorías)
| Categoría | Pruebas | Aprobadas | Resultado |
|---|---|---|---|
| Razonamiento | 6 | 6 | Aprobado |
| Formato estructurado | 4 | 4 | Aprobado |
| Tools / function-calling | 3 | 3 | Aprobado |
| Contexto | 2 | 2 | Aprobado |
| Conversación multiturno | 3 | 3 | Aprobado |
| Instrucciones | 2 | 2 | Aprobado |
| Total | 20 | 20 | 20/20 = 100% |
Cada prueba se aprueba solo si cumple todos sus criterios de aceptación.
5.3 Rendimiento, latencia y costo
| Indicador | Valor | Condición |
|---|---|---|
| Qwen3.5-2B (núcleo) | 30,0 tok/s | GPU GTX 1050, Q4_K_M, siempre encendido |
| Qwen3-0.6B generación | 29,9 tok/s | CPU, 0 GB de VRAM |
| Qwen3-0.6B clasificación | 31,0 tok/s | CPU, 0 GB de VRAM, siempre encendido |
| Gemma 4 E2B (specialist) | 7,7 tok/s | CPU, encendido solo bajo demanda |
| Latencia p50 de clasificación | 1,4 s | Decisión de ruta en el servidor |
| Costo por consulta (rutas locales) | $0 | Sin API de pago por uso |
| Datos enviados a terceros | 0 | 100% on-premises en las rutas locales |
| Costo de hardware | ~USD 500 | Un servidor compartido por los 3 modelos |
Mediciones internas en el servidor de producción (octubre 2026), con el asistente en uso real: atención de soporte, asistente interno por Telegram e integración con la plataforma de cámaras ATLAS.
Limitaciones conocidas
Publicar solo los aciertos no sirve. Estas son las restricciones reales del sistema y cómo las manejamos.
El modelo pequeño falla en matemática compleja
Un modelo de 2B resuelve bien la matemática del día a día, pero se equivoca en operaciones más exigentes. Por eso la aritmética no se le delega al modelo: se resuelve en código. Las operaciones determinísticas se calculan fuera del modelo y el modelo solo redacta el resultado.
VRAM limitada a 2 GB
La GTX 1050 tiene 2 GB, suficientes para un solo modelo en GPU. El clasificador y el specialist corren en CPU, por lo que su velocidad depende de los 4 núcleos del i5-4440. Con más VRAM se podrían paralelizar más rutas locales.
Temperatura baja: menos varianza, menos variedad
Se opera con temperaturas bajas (0,1 en el specialist y 0 en el clasificador). Eso reduce la varianza entre ejecuciones —lo que buscamos en clasificación y respuestas operativas— a costa de respuestas más repetitivas en tareas creativas.
El specialist es lento en CPU
A 7,7 tok/s, una respuesta larga de análisis toma notablemente más que una del núcleo. Es el costo de mantener el specialist bajo demanda en CPU en lugar de ocupar la VRAM que necesita el núcleo.
La ruta expert depende de internet
Las rutas locales funcionan sin conexión externa; la ruta expert requiere un proveedor de nube y está sujeta a sus condiciones. El guard JEV permanece activo también en esa ruta.
Alcance de las mediciones
Los resultados corresponden a mediciones internas sobre un solo servidor, en un entorno de producción, sin evaluación externa ciega ni réplica independiente. Son evidencia de funcionamiento real, no un estudio comparativo entre fabricantes.
Conclusión
Un servidor de aproximadamente USD 500, tres modelos cuantizados Q4_K_M y un router con guard de precios alcanzan para operar una IA privada en un negocio: 100% de precisión de enrutamiento en 40 consultas de referencia, 20/20 pruebas de calidad, 1,4 s de latencia p50 y $0 por consulta en las rutas locales. No reemplaza a un modelo enorme de nube en toda tarea, pero resuelve el trabajo diario de una pyme sin enviar datos a terceros y sin mensualidades por uso.
¿Quieres revisar el sistema en tu propio negocio?
Hablamos de tu caso, te decimos qué hardware necesitas y qué se puede automatizar. MR.COM Soluciones: sitios web, ciberseguridad, cámaras de vigilancia, redes, hardware, soporte e IA local.