Arquitectura de IA, desplegada en producción por un ingeniero senior
Un arquitecto de soluciones de IA diseña cómo un sistema de IA encaja en el stack real de tu empresa y lo lleva a producción: qué modelo y qué patrón usar, cómo lee y escribe tus datos, cómo se protege, se monitorea y se mantiene a un costo razonable, y qué pasa cuando el modelo se equivoca. Es para dueños de empresa y CTO que ya tienen un demo, un piloto o un caso de uso claro y necesitan que funcione todos los días sin sorpresas. Soy Francisco Salazar, ingeniero DevOps senior con más de 10 años de infraestructura en producción y certificaciones CKA y CKAD, así que la IA se construye como infraestructura y no se pega con una herramienta no-code. Un proyecto acotado se entrega en tres semanas, con precio fijo acordado por adelantado, corre en tus propias cuentas y tiene garantía operativa de 60 días.
¿Qué decide un arquitecto de soluciones de IA?
Un arquitecto de soluciones de IA decide cuatro cosas antes de escribir código: qué patrón resuelve el problema (un prompt simple, recuperación de documentos, un agente o fine-tuning), qué modelo corre en cada paso, cómo el sistema lee y escribe los datos de tu empresa, y qué hace cuando falla. Esas decisiones fijan el costo, la precisión y la carga de mantención del sistema por años.
El trabajo parte del proceso de negocio, no del modelo: qué paso consume el tiempo hoy, cuánto cuesta una respuesta equivocada, quién aprueba el resultado y dónde viven los datos. Construyo con la API de Claude, la API de OpenAI y Google Gemini, elijo según tarea y presupuesto, y diseño para cambiar de proveedor sin reescribir todo. Tampoco revendo herramientas: si la respuesta correcta es un script de 40 líneas o una función que tu CRM ya trae, te lo digo en la primera llamada.
- Patrón y modelo según tus datos, tu volumen y tu presupuesto
- Qué puede leer y escribir el sistema, y con qué permisos
- Qué pasa cuando el modelo se equivoca, se demora o no responde
Prompt simple, RAG, agentes o fine-tuning: ¿qué patrón necesita tu problema?
La mayoría de los problemas de negocio necesita el patrón más simple que funcione. Un prompt simple sirve cuando todo lo que el modelo necesita viene en la solicitud. RAG sirve para preguntas que dependen de tus documentos. Los agentes sirven para trabajo de varios pasos con herramientas y decisiones. El fine-tuning sirve para una tarea acotada y estable con muchos ejemplos limpios, y casi nunca es el primer paso.
Los sistemas reales mezclan patrones. La regla que sigo: partir por lo más simple, medirlo con ejemplos reales y subir de complejidad solo cuando la evaluación muestra que lo simple no alcanza.
- Prompt simple: clasificar, extraer, resumir y redactar desde un correo o un formulario. Es lo más barato de operar y de probar. No sirve cuando la respuesta depende de información que el modelo nunca vio.
- RAG (generación aumentada por recuperación): el sistema busca en tus documentos y responde citando los pasajes relevantes. Es lo correcto para políticas, manuales, catálogos y contratos que cambian. La ingeniería está en la recuperación (fragmentación, permisos, actualización), no en el prompt.
- Agentes: el modelo decide qué herramienta usar a continuación. Es lo correcto cuando el camino cambia caso a caso. Cuestan más y fallan de más formas: necesitan límite de pasos, permisos acotados y aprobación humana antes de lo irreversible.
- Fine-tuning: entrenar un modelo con tus ejemplos. Es lo correcto para un formato o tono consistente a alto volumen. No sirve para enseñarle tus datos al modelo, porque los datos cambian y la recuperación se actualiza el mismo día.
¿Qué significa que un sistema de IA esté listo para producción?
Estar listo para producción significa que el sistema puede quedar corriendo sin que alguien lo vigile: las credenciales están bien guardadas, el gasto tiene techo, la calidad se mide con ejemplos reales, cada solicitud deja rastro, una falla termina en algo seguro y una persona aprueba todo lo que no se puede deshacer. Un demo no tiene nada de eso y en pantalla se ve idéntico.
Aquí pesa la experiencia en infraestructura. Una llamada a un modelo es una dependencia de red poco confiable con una cuenta variable, y la trato así: prompts y flujos versionados, respaldos, manejo de errores y logs que alguien pueda leer cuando algo se rompe.
- Secretos: API keys y credenciales en un gestor de secretos, nunca en un prompt ni en un repositorio, y con el permiso mínimo que funcione.
- Control de costos: límites de gasto en el proveedor, tope de pasos en los agentes, caché y el modelo más barato donde la evaluación muestra que alcanza.
- Evaluación: ejemplos reales con su respuesta esperada, que se corren antes de cada cambio de prompt o de modelo.
- Observabilidad: cada solicitud registrada con entradas, fuentes, salida, latencia y costo, más alertas cuando algo sale de lo normal.
- Respaldo ante fallas: reintentos, un segundo proveedor o un camino más simple, y una salida segura como derivar el caso a una persona.
- Aprobación humana: todo lo irreversible (enviar, facturar, borrar) espera a una persona.
¿Cómo es un proyecto de arquitectura de IA de principio a fin?
Un proyecto típico tiene seis partes: un disparador (un correo, un formulario, un mensaje de WhatsApp, un horario), una capa de datos que trae lo que el modelo necesita, una o más llamadas al modelo, controles alrededor, aprobación humana y un despliegue en tus propias cuentas. Un alcance acotado se entrega en tres semanas, y los más grandes toman de tres a cinco.
Piensa en una consulta que hay que responder desde tus documentos. La recuperación busca en una base Postgres con pgvector que guarda tus documentos indexados, filtrando por lo que ese usuario puede ver. Un modelo redacta la respuesta y cita los pasajes que usó. Los controles verifican que haya fuentes y que se respete el límite de costo, y derivan el caso a una persona cuando la búsqueda no encuentra nada relevante. Si la respuesta va a un cliente, espera en una cola de aprobación.
La orquestación vive en n8n o en un servicio en Python y FastAPI. El hosting es Railway o Vercel, o tu entorno GCP, AWS o Kubernetes si ya operas uno. Todo se crea en tus cuentas y con tus API keys.
- Eres dueño del 100% del código, los flujos, los prompts y los datos
- Código y flujos exportados en tu repositorio, con documentación y videos en Loom
¿Consultora, integrador de ERP o arquitecto de IA: quién moderniza tus sistemas y asegura la infraestructura?
En Chile hay cinco tipos de alternativa realistas para modernizar sistemas, adoptar IA y asegurar la infraestructura: una consultora grande, el integrador de tu ERP, una fábrica de software, un freelancer o un ingeniero senior fraccional. Ninguna es mejor en abstracto: depende del tamaño del proyecto, del riesgo regulatorio y de si necesitas un equipo completo o las decisiones de alguien con experiencia.
Asegurar la infraestructura no es un producto que se compra, es una práctica: secretos bien guardados, permisos mínimos, respaldos probados, redes privadas y monitoreo con alertas. Pregúntale a cualquier proveedor dónde vivirán tus datos y credenciales, quién queda como dueño de las cuentas y qué recibes documentado al final. Mi lugar en ese mapa es el último: trabajo desde Chile y facturo en USD o en CLP con factura electrónica del SII.
- Consultora grande: equipo completo y respaldo contractual. Sirve para programas de varios años en empresas grandes o reguladas. La entrada es cara, los plazos son largos y conviene preguntar quién hará el trabajo en la práctica.
- Integrador de ERP: la opción natural si el problema vive dentro del ERP. La IA y la infraestructura en la nube no son su oficio central, y tiende a resolver todo con módulos del mismo fabricante.
- Fábrica de software: capacidad de desarrollo con equipo y jefe de proyecto. Funciona cuando la arquitectura ya está definida. Si nadie de tu lado decide sobre diseño, seguridad y costos, esas decisiones quedan sin dueño.
- Freelancer: rápido y económico para una tarea puntual y bien especificada. El riesgo está en la continuidad, la documentación y en que seguridad y despliegue queden fuera del alcance.
- Ingeniero senior fraccional: una persona con experiencia en producción que diseña, construye y entrega un sistema acotado a precio fijo. Sirve a pymes y empresas medianas. No reemplaza a un equipo cuando el programa es grande.
¿En qué se diferencia de una agencia no-code o de contratar un ingeniero de IA a tiempo completo?
Un ingeniero de IA fraccional es un ingeniero senior que contratas por un alcance definido y no por un sueldo: la misma persona diseña, construye y despliega el sistema a precio fijo, y te deja como dueño de todo. Una agencia no-code vende flujos dentro de una herramienta visual. Contratar a tiempo completo tiene sentido cuando el trabajo de IA es continuo y central para tu producto.
El no-code es una buena decisión para una prueba de concepto y para automatizaciones simples. Los límites aparecen con el volumen, los casos borde, el cumplimiento y todo lo que exige código real o despliegue dentro de tu nube. Un ingeniero senior usa esas herramientas cuando corresponde y baja a Python cuando no.
La realidad de la mayoría de las pymes es uno o dos sistemas que hay que diseñar bien una vez y después mantener con poco esfuerzo. Reclutar un perfil senior es lento, el sueldo corre todo el año y una sola persona rara vez cubre la IA y la infraestructura que la sostiene. La contrapartida es real: trabajo solo, y un programa que necesita un equipo completo debería contratarlo.
¿Cuánto cuesta un arquitecto de soluciones de IA?
No cobro por hora para construir. Cada proyecto es un precio fijo acordado por adelantado después de una llamada de diagnóstico. Las referencias públicas son los tres sistemas con precio de lista en este sitio: Lead Acquisition Engine a USD 4.000 de implementación, AI Intake Agent con base de conocimiento a USD 4.900 y AI Operating System a USD 6.800.
Cada uno tiene una mensualidad opcional para operar e iterar: USD 490, USD 1.200 y USD 1.800 al mes, respectivamente. Una arquitectura a medida se cotiza igual. Lo que mueve el precio es el alcance: cuántos sistemas tiene que leer y escribir la IA, qué tan desordenados están los datos y cuánta evaluación exige el riesgo. El uso de las APIs de modelos y el hosting se facturan a tus propias cuentas, y el proyecto incluye garantía operativa de 60 días.
¿Cuándo NO necesitas un arquitecto de IA?
No necesitas un arquitecto de IA cuando la tarea vive dentro de una sola herramienta, no toca datos sensibles y una respuesta equivocada no cuesta nada. Usar ChatGPT o Claude para redactar correos, activar la función de IA que tu CRM ya incluye o conectar dos aplicaciones con una automatización simple funciona bien sin arquitectura.
Tampoco lo necesitas si el proceso no está definido: la IA no arregla un flujo que nadie puede describir. La arquitectura empieza a pagarse cuando el sistema usa datos reales de la empresa (documentos, CRM, ERP), cuando lo usan clientes o varios equipos, cuando el costo por consulta importa o cuando un error del modelo tiene consecuencias.
Relacionado
- Desarrollo de IA a medidaTodo lo que construyo: agentes, integraciones, chatbots, migraciones.
- Consultor de IA en ChileLa vista completa: qué hace un consultor de IA, precios y proceso.
- Chatbot con documentos de tu empresaEl patrón RAG en detalle: fuentes, permisos y actualización.
- Desarrollo de agentes de IAAgentes que usan herramientas, recuerdan contexto y piden aprobación.
- Consultor n8nCuando la capa de orquestación es n8n, incluido el self-hosting bien hecho.
- Consultor de IA, agencia o equipo internoCómo elegir entre las tres opciones según tu etapa.
- Casos de trabajoSistemas de IA entregados y en producción, anonimizados.
Preguntas frecuentes
¿Construyes solo con un proveedor de IA?
No. La arquitectura elige el modelo que sirve para la tarea y el presupuesto, y se diseña para poder cambiar de proveedor sin reescribir todo. Trabajo con la API de Claude, la API de OpenAI y Google Gemini. Un sistema en producción no debería quedar amarrado a un solo proveedor, porque los precios, los límites y la calidad de los modelos cambian más rápido que tu proceso de negocio.
¿Puedes desplegar en nuestra nube o cluster de Kubernetes?
Sí. Con certificaciones CKA y CKAD y más de 10 años de DevOps en producción, desplegar en tu entorno GCP, AWS o Kubernetes, con manejo de secretos y observabilidad, es la competencia central. Si no operas un cluster, una plataforma administrada como Railway o Vercel suele ser la opción más simple y económica, y te lo voy a decir.
¿Qué es un ingeniero de IA fraccional?
Un ingeniero senior que contratas por un alcance definido en vez de sumarlo a la planilla. Recibes las decisiones de arquitectura, la construcción y el despliegue de una misma persona, a precio fijo, y el resultado es tuyo. Sirve a empresas que necesitan uno o dos sistemas de IA bien hechos, no un equipo permanente.
¿Cómo se cobra?
Un precio fijo acordado por adelantado después de una llamada de diagnóstico, no por hora. Un alcance acotado toma tres semanas y los más grandes de tres a cinco, con garantía operativa de 60 días después de la entrega. Los sistemas con precio de lista del sitio, de USD 4.000 a USD 6.800, son la referencia pública. En Chile facturo en USD o en CLP con factura electrónica del SII.
¿Quién es dueño del código, los prompts y los datos?
Tú, en un 100%. Todo corre en tus propias cuentas e infraestructura: tu nube, tu n8n, tus API keys. La entrega incluye documentación, el código y los flujos exportados en tu repositorio y videos en Loom, para que otro ingeniero pueda hacerse cargo sin depender de mí.
¿Cuándo no soy la opción correcta?
Cuando necesitas un equipo grande, un programa de varios años o un área interna permanente de IA. Trabajo solo y sumo un segundo ingeniero en alcances grandes. Tampoco soy la opción correcta si tu problema se resuelve con una suscripción o con una función que ya pagas, y eso te lo digo en la primera llamada.
¿Trabajas solo con empresas chilenas?
No. Trabajo en remoto desde Chile con empresas de Chile y Latinoamérica, y también de Estados Unidos, Canadá y Europa, en español o en inglés, con horario compatible con el de Estados Unidos.
Conversemos 15 minutos sobre tu operación.
Llamada gratis. Te digo derecho qué se puede automatizar hoy con IA y qué necesita tu infraestructura para que funcione de verdad. Si calza, avanzamos. Si no, te oriento gratis.
