← SCRAM AI Lab
Conoce la arquitectura técnica de SCRAM AI Lab: 4 chatbots unificados en NestJS, RAG en pgvector, herramientas ERP en tiempo real y resiliencia en producción.
August 19, 2026
69 lecturas

La mayoría del contenido sobre chatbots empresariales lo escriben empresas que venden chatbots. Este artículo es distinto: es la radiografía de nuestro propio sistema en producción — el que atiende scram2k.com, el portal de soporte, la operación interna y WhatsApp. Lo contamos con detalle porque creemos que en Latinoamérica falta exactamente esto: casos reales, con arquitectura real, de equipos que construyen en vez de solo integrar. No compramos una plataforma de chatbots: construimos un cerebro y le pusimos cuatro caras.
Los cuatro agentes viven en un mismo módulo de nuestra API NestJS. La personalidad no se duplica: una función buildSystemPrompt() compone el prompt según el origen de la conversación — el dominio de ventas recibe la identidad comercial, el de soporte la identidad de diagnóstico, el portal interno la identidad administrativa. Cambiar una regla de tono se hace una vez y aplica a todos.
Debajo comparten la misma infraestructura:
La clave consiste en desacoplar el motor de razonamiento de los canales de contacto, centralizando lógica, memoria vectorial y herramientas en una sola API backend. En lugar de desplegar agentes aislados con bases de datos duplicadas, un único orquestador gestiona el contexto e inyecta instrucciones dinámicas según el origen de la interacción comercial o técnica.
Cuando cada canal opera como un silo independiente, el costo de cómputo y mantenimiento se dispara de forma lineal. Unificar la lógica bajo un mismo servicio permite reutilizar conexiones de base de datos, optimizar la caché de embeddings y concentrar la telemetría en un único punto de observación. La siguiente comparativa, basada en métricas internas de SCRAM AI Lab y tarifas estándar del mercado de nube a inicios de 2025, ilustra las diferencias operativas:
| Criterio de evaluación | Plataformas SaaS No-Code | Agentes aislados por canal | Cerebro unificado (SCRAM) |
|---|---|---|---|
| Costo mensual base de plataforma | Medio a alto (cobro por asiento o mensaje) | Alto (múltiples servicios e instancias) | Bajo (reutiliza la infraestructura existente) |
| Consistencia de respuestas entre canales | Baja (bases de conocimiento separadas) | Media (sincronización manual requerida) | Total (mismo repositorio RAG y ERP) |
| Acceso a transacciones en tiempo real | Limitado a webhooks básicos | Variable y difícil de auditar | Nativo mediante herramientas tipadas |
| Tolerancia a fallas de proveedores LLM | Dependiente del proveedor SaaS | Riesgo de fallo dispar entre canales | Centralizada con circuit-breaker propio |
| Riesgo de alucinación en datos contables | Alto si consulta texto desactualizado | Alto si lee vectores en lugar de BD | Cero: delegación a funciones SQL/código |
La lección más cara del proyecto: al principio, el agente interno respondía preguntas de negocio leyendo la base vectorial… y contaba 1,160 facturas donde el ERP real tenía 3,155. Los embeddings son para conocimiento, no para datos. Hoy Scramteca opera con un registro de herramientas tipadas —ventas, cliente, desglose, tendencia, tickets— que consultan las tablas reales del ERP en el momento de la pregunta. El modelo decide qué herramienta usar; la herramienta garantiza que el número sea el verdadero.
De ahí salió nuestra regla madre, la que repetimos en cada diseño: lo que se puede decidir en código no se le pregunta al modelo. Permisos, candados, validaciones de precio, formatos de fecha: todo eso vive en TypeScript, no en el prompt. Cada vez que intentamos resolver un comportamiento con instrucciones al modelo y falló dos veces, lo movimos a código y salió a la primera.
Los agentes que solo leen son fáciles. Los nuestros también escriben: cotizaciones, pedidos, tareas, tickets. Cada acción de escritura usa un patrón de doble confirmación en dos turnos — el agente propone la acción con todos los datos visibles, y solo la ejecuta si el usuario confirma en el turno siguiente. Los montos se calculan con la misma función computeTotals del ERP (no con aritmética del modelo), los permisos se validan por cliente, y la escritura se verifica contando filas después de ejecutar.
¿Cómo sabemos que los bots responden bien sin leer miles de conversaciones? Un juez LLM evalúa turnos de conversación contra criterios editoriales y de negocio, y alimenta un ciclo de aprendizaje. Y como no confiamos a ciegas ni en el juez, lo estamos calibrando contra etiquetas humanas con una muestra de 120 turnos, buscando un acuerdo kappa ≥ 0.60. Medir al que mide: esa es la parte que casi nadie hace.
Nada de esto se construyó a mano alzada. Nuestro equipo desarrolla con agentes de coding y construimos nuestras propias piezas del ecosistema:
El resultado práctico: el mismo estándar que usamos para construir el producto lo usamos para construir las herramientas que construyen el producto.
La pieza más experimental del stack es nuestra instancia propia en español de MiroFish — un Motor de Inteligencia de Enjambre Conciso y Universal. La idea: a partir de un solo documento (un informe, un plan), extrae "semillas de realidad", construye un GraphRAG del entorno, genera perfiles de agentes y simula un mundo paralelo con hasta millones de agentes para ensayar dinámicas de grupo antes de decidir. Un ReportAgent analiza la simulación y puedes conversar con cualquier individuo simulado. Lo operamos en nuestra propia infraestructura, adaptado al español, con simulaciones que cuestan en promedio ~$5. Es la diferencia entre opinar sobre una decisión y ensayarla.
Implementar agentes autónomos en mercados latinoamericanos exige resolver restricciones que los tutoriales internacionales suelen ignorar:
El diseño de agentes autónomos exige anticipar dónde se rompe el flujo determinístico frente a la probabilidad del modelo:
Esto es lo que significa para nosotros integrar IA correctamente desde Latinoamérica: no esperar a que llegue empaquetado, construirlo con ingeniería seria, y contar cómo — con los errores incluidos. Si tu empresa quiere este nivel de integración, así lo aplicamos a operaciones como la tuya.
Artículos relacionados
El EU AI Act ya se aplica: multas de 3% y qué hacer si tu chatbot toca Europa
El EU AI Act impone multas de hasta el 3% global a quienes desplieguen chatbots en Europa. Guía práctica y checklist técnico para empresas de América Latina.
Esta semana en IA #42: la IA entra en su era regulada
El EU AI Act activa sanciones de hasta €15M, Anthropic retira la promo de Sonnet 5 y OpenAI acelera GPT-5.6 Sol 14x. Análisis de impacto y costos en IA.
Esta semana en IA #41: Claude Opus 5, Gemini 3.6 Flash y la batalla del tier de volumen
Analizamos Claude Opus 5, Gemini 3.6 Flash y GPT-5.6 Sol: cómo la batalla por el tier de volumen y costo/capacidad redefine los routers de IA en producción.