IA para tu empresa Caso de éxito Paper técnico WhatsApp
Paper técnico · MR.COM Soluciones · Castro, Chiloé

IA local para tu PyME: resultados medibles, sin mensualidades de API

Evaluamos 3 modelos de lenguaje corriendo en TU servidor — los mismos resultados que ves acá son los que instalamos en tu negocio: 100% de clasificación correcta, $0 por consulta y cero datos enviados a terceros.

Octubre 2026 Entorno de producción 3 modelos · 1 servidor 100% on-premises
La oferta

Qué recibes al contratar la IA local de MR.COM

Todo lo que documentamos abajo no es un experimento: es el sistema que instalamos, configuramos y dejamos funcionando en tu infraestructura.

Instalación llave en mano

Montamos router ATLAS + 3 modelos en tu servidor (o te recomendamos el hardware). Operativo en días, no meses.

$0 por consulta

Sin APIs externas ni cobro por token. El servidor es tuyo: usá la IA las veces que quieras al costo fijo de tu electricidad.

Datos que nunca salen

100% on-premises — cumplimiento Ley 21.719 sin workarounds. Ideal para PYMEs con información sensible.

1. Resumen

Resumen ejecutivo (Abstract)

Este documento describe la puesta en operación y la evaluación de tres modelos de lenguaje locales (Qwen3.5-2B, Qwen3-0.6B y Gemma 4 E2B) corriendo con llama.cpp en Docker sobre un único servidor Ubuntu 24.04 con CPU Intel i5-4440, 16 GB de RAM y una GPU GTX 1050 con 2 GB de VRAM. Todos los modelos usan cuantización Q4_K_M.

Las consultas pasan por un router determinista (ATLAS) que aplica reglas por expresión regular y un clasificador IA de 0,6B entrenado en contexto con 16 ejemplos few-shot, seguido de una matriz de cuatro rutas y un guard anti-alucinación (JEV) que intercepta antes del modelo cualquier consulta de precio o costo sin dato verificado.

Resultados en el entorno de producción, octubre 2026: 40/40 consultas clasificadas correctamente (100%, desde un 65% inicial), 20/20 pruebas de calidad aprobadas en seis categorías, latencia p50 de clasificación de 1,4 s, $0 de costo por consulta en las rutas locales y cero datos enviados a terceros. Tres modelos comparten un servidor de aproximadamente USD 500, sin mensualidades de API.

LLM localPyMEllama.cppQ4_K_M router de consultasanti-alucinaciónon-premisesllamada de funciones
2. Infraestructura

Hardware y modelos en ejecución

Todo el sistema vive en un solo equipo. No hay clúster ni nodo dedicado: el mismo servidor atiende el router, los modelos y las aplicaciones de negocio.

2.1 Hardware

ComponenteEspecificación
Sistema operativoUbuntu 24.04 (servidor propio)
CPUIntel i5-4440 — 4 núcleos
Memoria16 GB RAM
GPUNVIDIA GTX 1050 — 2 GB de VRAM
Motor de inferenciallama.cpp, un contenedor Docker por modelo
Costo de referencia del hardwareAproximadamente USD 500 por el servidor completo
Alcance de despliegue100% on-premises: los modelos y el router operan dentro de la infraestructura propia

La inversión de hardware es única: los tres modelos comparten este mismo servidor.

2.2 Modelos locales

ModeloCuantizaciónEjecuciónPuerto VRAMCuándo correRol y rendimiento
Qwen3.5-2B Q4_K_M GPU (GTX 1050) 11436 Usa la GPU de 2 GB Siempre encendido Núcleo + bot. 30,0 tok/s. Matemática y razonamiento del día a día.
Qwen3-0.6B Q4_K_M CPU 11441 +0 GB Siempre encendido Clasificador de consultas. 31,0 tok/s clasificando, 29,9 tok/s generando. Decide la ruta en p50 1,4 s.
Gemma 4 E2B Q4_K_M CPU 11437 +0 GB Solo bajo demanda Specialist de calidad. 7,7 tok/s. Análisis, comparaciones y diseño.

Los puertos son internos de la red local del servidor (loopback, no expuestos a internet). El servicio del router ATLAS (no es un modelo) escucha en el puerto 11445.

3. Metodología

Cómo se evaluó

Tres evaluaciones complementarias: una para el enrutamiento, una para la calidad de las respuestas y una para el costo y la latencia. Todas corrieron sobre el servidor de producción, no sobre una máquina de laboratorio.

3.1 Suite gold-label: 40 casos
Cuarenta consultas representativas con la ruta esperada escrita de antemano por una persona. Se ejecuta la consulta contra el router y se compara la ruta elegida con la esperada. El criterio es binario: acierto o error. La suite se usa además para iterar: los errores se convierten en casos nuevos hasta estabilizar el sistema.
3.2 Suite avanzada: 20 pruebas
Veinte pruebas de calidad repartidas en seis categorías: razonamiento (6), formato estructurado (4), tools / function-calling (3), contexto (2), conversación multiturno (3) e instrucciones (2). Evalúan qué tan bien responde el modelo, no a qué modelo llegó.
3.3 Rendimiento y costo
Se mide tokens por segundo por modelo sobre el mismo servidor, la latencia p50 de clasificación del router y el costo por consulta en cada ruta (las rutas locales no consumen API de pago).
3.4 Guard anti-alucinación
Se envían consultas de precio y costo sin dato verificado. La prueba pasa solo si el guard responde antes de invocar al modelo y no se genera ningún número inventado.

Criterios de aprobación

Una prueba se aprueba solo si cumple todos los criterios declarados para ese caso. No hay puntaje parcial.

4. Diseño del router

Ruta de una consulta: de la entrada al modelo

El router ATLAS es un servicio independiente que decide, antes de generar cualquier texto, qué componente debe responder. Cinco etapas, en este orden.

1
Reglas por expresión regular
Patrones deterministas resuelven de inmediato los casos fijos: saludos, despedidas, la hora y consultas repetitivas. Si una regla coincide, no se invoca ningún modelo.
regex · ~0 ms
2
Clasificador IA (0,6B)
Si ninguna regla coincide, el modelo Qwen3-0.6B clasifica la consulta con 16 ejemplos few-shot y devuelve la ruta junto con la complejidad y el nivel de riesgo.
Qwen3-0.6B · p50 1,4 s
3
Matriz de rutas
La decisión del clasificador se valida contra la matriz de cuatro destinos: direct, core, specialist y expert. Si el clasificador falla, la consulta cae a la ruta núcleo.
4 destinos
4
Guard JEV (pre-modelo)
Antes de generar, el guard revisa la consulta. Si pide un precio o costo sin dato verificado, se bloquea y responde: "No tengo ese dato verificado" sugiriendo cotizar con MR.COM.
bloqueo previo
5
Proxy de salida
La petición se envía al modelo que corresponda y la respuesta vuelve al cliente con la ruta registrada, para poder medir y auditar cada decisión.
respuesta + trazabilidad

Matriz de rutas

RutaCuándo se usaDestinoCosto por consulta
direct Saludos, despedidas, hora y respuestas de plantilla (regex) Plantilla local, sin generación de tokens $0
core Consultas del día a día: matemática, razonamiento, soporte Qwen3.5-2B en GPU (siempre encendido) $0
specialist Tareas complejas: análisis, comparaciones, diseño Gemma 4 E2B en CPU, se enciende bajo demanda $0
expert Casos que requieren el mayor nivel de respuesta Modelo de nube vía API, siempre con el guard activo Según el proveedor externo

Las tres rutas locales (direct, core, specialist) no dependen de internet ni de claves de API de pago.

Por qué el guard va antes del modelo. Un filtro posterior deja pasar el texto generado y solo corrige después; el guard JEV interrumpe la consulta cuando aún no existe respuesta: no hay manera de que el modelo invente un precio porque nunca llega a generarlo. Si hay un dato verificado disponible, se responde con ese dato.

5. Resultados

Resultados de la evaluación

Mediciones internas realizadas en nuestro servidor de producción, octubre de 2026.

5.1 Enrutamiento (suite gold-label, 40 casos)

CasosClasificados correctamentePrecisiónEvolución
40 40 100% 65% en la primera pasada hasta 100%, iterando con la suite gold-label

Cada caso tiene una única ruta esperada. El 100% corresponde a 40 aciertos sobre 40 consultas.

5.2 Calidad (suite avanzada, 6 categorías)

CategoríaPruebasAprobadasResultado
Razonamiento66 Aprobado
Formato estructurado44 Aprobado
Tools / function-calling33 Aprobado
Contexto22 Aprobado
Conversación multiturno33 Aprobado
Instrucciones22 Aprobado
Total2020 20/20 = 100%

Cada prueba se aprueba solo si cumple todos sus criterios de aceptación.

5.3 Rendimiento, latencia y costo

IndicadorValorCondición
Qwen3.5-2B (núcleo)30,0 tok/sGPU GTX 1050, Q4_K_M, siempre encendido
Qwen3-0.6B generación29,9 tok/sCPU, 0 GB de VRAM
Qwen3-0.6B clasificación31,0 tok/sCPU, 0 GB de VRAM, siempre encendido
Gemma 4 E2B (specialist)7,7 tok/sCPU, encendido solo bajo demanda
Latencia p50 de clasificación1,4 sDecisión de ruta en el servidor
Costo por consulta (rutas locales)$0Sin API de pago por uso
Datos enviados a terceros0100% on-premises en las rutas locales
Costo de hardware~USD 500Un servidor compartido por los 3 modelos

Mediciones internas en el servidor de producción (octubre 2026), con el asistente en uso real: atención de soporte, asistente interno por Telegram e integración con la plataforma de cámaras ATLAS.

6. Discusión

Limitaciones conocidas

Publicar solo los aciertos no sirve. Estas son las restricciones reales del sistema y cómo las manejamos.

01

El modelo pequeño falla en matemática compleja

Un modelo de 2B resuelve bien la matemática del día a día, pero se equivoca en operaciones más exigentes. Por eso la aritmética no se le delega al modelo: se resuelve en código. Las operaciones determinísticas se calculan fuera del modelo y el modelo solo redacta el resultado.

02

VRAM limitada a 2 GB

La GTX 1050 tiene 2 GB, suficientes para un solo modelo en GPU. El clasificador y el specialist corren en CPU, por lo que su velocidad depende de los 4 núcleos del i5-4440. Con más VRAM se podrían paralelizar más rutas locales.

03

Temperatura baja: menos varianza, menos variedad

Se opera con temperaturas bajas (0,1 en el specialist y 0 en el clasificador). Eso reduce la varianza entre ejecuciones —lo que buscamos en clasificación y respuestas operativas— a costa de respuestas más repetitivas en tareas creativas.

04

El specialist es lento en CPU

A 7,7 tok/s, una respuesta larga de análisis toma notablemente más que una del núcleo. Es el costo de mantener el specialist bajo demanda en CPU en lugar de ocupar la VRAM que necesita el núcleo.

05

La ruta expert depende de internet

Las rutas locales funcionan sin conexión externa; la ruta expert requiere un proveedor de nube y está sujeta a sus condiciones. El guard JEV permanece activo también en esa ruta.

06

Alcance de las mediciones

Los resultados corresponden a mediciones internas sobre un solo servidor, en un entorno de producción, sin evaluación externa ciega ni réplica independiente. Son evidencia de funcionamiento real, no un estudio comparativo entre fabricantes.

7. Conclusión

Conclusión

Un servidor de aproximadamente USD 500, tres modelos cuantizados Q4_K_M y un router con guard de precios alcanzan para operar una IA privada en un negocio: 100% de precisión de enrutamiento en 40 consultas de referencia, 20/20 pruebas de calidad, 1,4 s de latencia p50 y $0 por consulta en las rutas locales. No reemplaza a un modelo enorme de nube en toda tarea, pero resuelve el trabajo diario de una pyme sin enviar datos a terceros y sin mensualidades por uso.

Contacto

¿Quieres revisar el sistema en tu propio negocio?

Hablamos de tu caso, te decimos qué hardware necesitas y qué se puede automatizar. MR.COM Soluciones: sitios web, ciberseguridad, cámaras de vigilancia, redes, hardware, soporte e IA local.

Tel / WhatsApp +56 9 7517 7638 falegria@mrcomsoluciones.cl Castro, Chiloé
Caso de éxito: IA local en operación
La versión ejecutiva de este trabajo: el problema de negocio, los tres modelos en lenguaje simple, las métricas destacadas y qué significa para una pyme chilena.
Ver caso de éxito