IA para tu empresa Caso de éxito Paper técnico WhatsApp
Caso de éxito · Mediciones internas en servidor de producción · octubre 2026

IA local en operación:
100% de precisión y $0 por consulta.

Tres modelos de inteligencia artificial corriendo en un solo servidor propio en Castro, Chiloé. Sin mensualidades de API, sin enviar datos a terceros. Estos son los resultados que medimos en nuestro propio entorno de producción.

100% on-premises: cero datos enviados a terceros.

100%
Precisión del enrutamiento
40/40 consultas clasificadas bien
20/20
Pruebas de calidad aprobadas
6 categorías evaluadas
$0
Costo por consulta
Sin API de pago por uso
1,4 s
Latencia p50 de clasificación
Decisión de ruta en el servidor
El punto de partida

La IA por API resuelve rápido, pero cobra por cada paso

Antes de instalar nada propio, probamos el camino obvio: pagar por una API de IA. El costo crece con cada consulta y cada pregunta con datos del negocio viaja hacia un proveedor externo. Para una pyme chilena, esos dos puntos son un problema de fondo.

Costo que escala con el uso
Cada consulta factura. Si el asistente se vuelve parte del trabajo diario, la cuenta mensual crece sin que el dueño del negocio pueda predecirla con certeza.
Datos hacia terceros
Para que una IA responda sobre tus productos o clientes, el texto del mensaje sale del negocio y viaja al proveedor. Requiere confianza, contratos y muchas veces no es aceptable por normativa interna.
Dependencia de afuera
Sin internet o sin clave de API válida, la asistente deja de funcionar. Las condiciones, límites y precios del proveedor cambian fuera de tu control.

La pregunta que nos hicimos: ¿se puede tener una IA útil, privada y de costo fijo con hardware que ya podemos instalar en un negocio? La respuesta es este caso de éxito.

La solución

Tres modelos, un solo servidor

En vez de pagar por un modelo gigante que hace todo, montamos un equipo pequeño de modelos especializados corriendo en un mismo servidor Ubuntu 24.04 (Intel i5-4440, 16 GB RAM, GTX 1050 de 2 GB). Cada uno tiene un trabajo claro.

Modelo 1 · Núcleo
Qwen3.5-2B — el que responde
Cuantización Q4_K_M corriendo en la GPU GTX 1050. Es el corazón del asistente: 30,0 tok/s y siempre encendido.
  • Matemática del día a día resuelta sin fallas
  • Razonamiento operativo: soporte, respuestas, redacción
  • Atiende el bot y la operación interna
Modelo 2 · Clasificador
Qwen3-0.6B — el que decide
Pequeño modelo en CPU que no usa VRAM (+0 GB). Lee la consulta y elige la ruta en 1,4 s (p50). Siempre encendido.
  • 31,0 tok/s clasificando, 29,9 tok/s generando
  • Decide si la consulta es simple, técnica o compleja
  • Evita encender modelos grandes para preguntas cortas
Modelo 3 · Specialist
Gemma 4 E2B — el que profundiza
Q4_K_M en CPU. Se enciende solo bajo demanda para tareas que exigen análisis serio. Rendimiento de 7,7 tok/s.
  • Análisis, comparaciones y diseño
  • No consume recursos cuando nadie lo necesita
  • Arranque bajo demanda, no permanente
Router ATLAS: una sola puerta de entrada
Cada consulta pasa por ATLAS antes de tocar un modelo. Combina reglas deterministas (regex) con el clasificador 0.6B (16 ejemplos few-shot) y la matriz de rutas: respuesta directa de plantilla para saludos, núcleo para lo cotidiano, specialist para lo complejo y experto (modelo de nube vía API, con guard) solo cuando hace falta.
Guard JEV: nunca inventa un precio
Antes de que el modelo vea una consulta de precio o costo, el guard revisa si existe un dato verificado. Si no existe, responde "No tengo ese dato verificado" y sugiere cotizar con MR.COM. El modelo no llega a responder: bloqueo previo, no filtro posterior.
Metodología

Cómo lo medimos

Nada de demos preparadas. Tres evaluaciones sobre el mismo servidor que usa el negocio, en octubre de 2026.

Suite de calidad: 20 pruebas
Seis categorías: razonamiento, formato estructurado, uso de herramientas, contexto, conversación multiturno e instrucciones. Cada prueba tiene criterios concretos: aprueba solo si la respuesta los cumple todos.
40 consultas de referencia
Consultas reales con la ruta esperada escrita de antemano (gold-label). Se compara la ruta que eligió el router contra la correcta. Empezamos en 65% e iteramos hasta llegar al resultado.
Guard de precios
Consultas de precio y costo sin fuente verificada deben bloquearse antes de llegar al modelo. Si el modelo responde igual, el test falla. El objetivo es que nunca invente un número.

Todas las cifras de esta página son mediciones internas en nuestro servidor de producción (octubre 2026). No son números de un laboratorio aislado ni de clientes externos: es el mismo equipo que hoy atiende por Telegram, soporte y la plataforma de cámaras ATLAS.

Resultados

Lo que entregó la medición

Números exactos, con su detalle. Donde hubo iteración, también se dice.

MétricaResultadoDetalle
Precisión del router 40/40 = 100% 40 consultas clasificadas correctamente. Se empezó en 65% y se iteró con la suite gold-label hasta 100%.
Suite de calidad 20/20 aprobados Razonamiento 6/6 · estructurado 4/4 · tools y function-calling 3/3 · contexto 2/2 · multiturno 3/3 · instrucciones 2/2.
Latencia de clasificación 1,4 s (p50) Tiempo mediano del clasificador para decidir a qué modelo va la consulta.
Costo por consulta $0 Sin API de pago por uso. El hardware es el único costo, y es fijo.
Privacidad de los datos 100% on-premises Cero datos enviados a terceros en las rutas locales.
Rendimiento núcleo (Qwen3.5-2B) 30,0 tok/s GPU GTX 1050, Q4_K_M. Siempre encendido.
Rendimiento clasificador (Qwen3-0.6B) 31,0 tok/s clasificación 29,9 tok/s en generación. CPU, 0 GB de VRAM. Siempre encendido.
Rendimiento specialist (Gemma 4 E2B) 7,7 tok/s CPU, Q4_K_M. Se enciende solo bajo demanda.
Caso de negocio 3 modelos / 1 servidor Tres modelos comparten un servidor de aproximadamente USD 500. Sin mensualidades de API.

Mediciones internas en nuestro servidor de producción, octubre de 2026. Entorno real, con el asistente en uso diario.

Aplicación

Qué significa para tu negocio

Los resultados técnicos se traducen en tres decisiones simples para quien maneja una pyme.

Privacidad sin letra chica
La información de tus clientes, precios internos y documentos no salen del servidor. Nada viaja a terceros, no se entrena con tus datos y el asistente sigue funcionando aunque caiga internet.
Costo fijo, no variable
Un servidor de aproximadamente USD 500 sostiene los tres modelos. Después de instalarlo, cada consulta cuesta $0: nada de mensualidades de API que crecen con el uso.
Operación sin depender de afuera
Núcleo y clasificador están siempre encendidos en tu infraestructura. El specialist se prende solo cuando lo necesitas. Los saludos ni siquiera invocan a un modelo.
Respuestas que no se inventan
El guard bloquea los precios sin fuente verificada antes de que el modelo responda. Si no hay dato cierto, se dice claro: "No tengo ese dato verificado" y se sugiere cotizar.
Ya está en uso real
El sistema hoy opera como asistente interno por Telegram, en atención de soporte y conectado a la plataforma de cámaras ATLAS. No es un prototipo de laboratorio.
Soporte en tu idioma
Detrás de la IA hay un equipo real en Castro, Chiloé. Sitios web, ciberseguridad, cámaras de vigilancia, redes, hardware y soporte: hablas con personas, no con bots.
Siguiente paso

¿Quieres la misma evidencia para tu negocio?

Te mostramos el sistema funcionando, te decimos qué necesitas instalar y cuánto cuesta, sin letra chica. Cotización directa por WhatsApp.

+56 9 7517 7638 falegria@mrcomsoluciones.cl Castro, Chiloé
Paper técnico: evaluación de modelos LLM locales para PyMEs
La metodología completa, el hardware exacto, los parámetros de cada modelo, el diagrama del router ATLAS y las tablas de resultados por categoría.
Ver paper técnico