IA local en operación:
100% de precisión y $0 por consulta.
Tres modelos de inteligencia artificial corriendo en un solo servidor propio en Castro, Chiloé. Sin mensualidades de API, sin enviar datos a terceros. Estos son los resultados que medimos en nuestro propio entorno de producción.
100% on-premises: cero datos enviados a terceros.
La IA por API resuelve rápido, pero cobra por cada paso
Antes de instalar nada propio, probamos el camino obvio: pagar por una API de IA. El costo crece con cada consulta y cada pregunta con datos del negocio viaja hacia un proveedor externo. Para una pyme chilena, esos dos puntos son un problema de fondo.
La pregunta que nos hicimos: ¿se puede tener una IA útil, privada y de costo fijo con hardware que ya podemos instalar en un negocio? La respuesta es este caso de éxito.
Tres modelos, un solo servidor
En vez de pagar por un modelo gigante que hace todo, montamos un equipo pequeño de modelos especializados corriendo en un mismo servidor Ubuntu 24.04 (Intel i5-4440, 16 GB RAM, GTX 1050 de 2 GB). Cada uno tiene un trabajo claro.
- Matemática del día a día resuelta sin fallas
- Razonamiento operativo: soporte, respuestas, redacción
- Atiende el bot y la operación interna
- 31,0 tok/s clasificando, 29,9 tok/s generando
- Decide si la consulta es simple, técnica o compleja
- Evita encender modelos grandes para preguntas cortas
- Análisis, comparaciones y diseño
- No consume recursos cuando nadie lo necesita
- Arranque bajo demanda, no permanente
Cómo lo medimos
Nada de demos preparadas. Tres evaluaciones sobre el mismo servidor que usa el negocio, en octubre de 2026.
Todas las cifras de esta página son mediciones internas en nuestro servidor de producción (octubre 2026). No son números de un laboratorio aislado ni de clientes externos: es el mismo equipo que hoy atiende por Telegram, soporte y la plataforma de cámaras ATLAS.
Lo que entregó la medición
Números exactos, con su detalle. Donde hubo iteración, también se dice.
| Métrica | Resultado | Detalle |
|---|---|---|
| Precisión del router | 40/40 = 100% | 40 consultas clasificadas correctamente. Se empezó en 65% y se iteró con la suite gold-label hasta 100%. |
| Suite de calidad | 20/20 aprobados | Razonamiento 6/6 · estructurado 4/4 · tools y function-calling 3/3 · contexto 2/2 · multiturno 3/3 · instrucciones 2/2. |
| Latencia de clasificación | 1,4 s (p50) | Tiempo mediano del clasificador para decidir a qué modelo va la consulta. |
| Costo por consulta | $0 | Sin API de pago por uso. El hardware es el único costo, y es fijo. |
| Privacidad de los datos | 100% on-premises | Cero datos enviados a terceros en las rutas locales. |
| Rendimiento núcleo (Qwen3.5-2B) | 30,0 tok/s | GPU GTX 1050, Q4_K_M. Siempre encendido. |
| Rendimiento clasificador (Qwen3-0.6B) | 31,0 tok/s clasificación | 29,9 tok/s en generación. CPU, 0 GB de VRAM. Siempre encendido. |
| Rendimiento specialist (Gemma 4 E2B) | 7,7 tok/s | CPU, Q4_K_M. Se enciende solo bajo demanda. |
| Caso de negocio | 3 modelos / 1 servidor | Tres modelos comparten un servidor de aproximadamente USD 500. Sin mensualidades de API. |
Mediciones internas en nuestro servidor de producción, octubre de 2026. Entorno real, con el asistente en uso diario.
Qué significa para tu negocio
Los resultados técnicos se traducen en tres decisiones simples para quien maneja una pyme.
¿Quieres la misma evidencia para tu negocio?
Te mostramos el sistema funcionando, te decimos qué necesitas instalar y cuánto cuesta, sin letra chica. Cotización directa por WhatsApp.