Saltar al contenido

AI Products · Análisis a fondo

Arquitectura de un producto de IA en producción: de los datos a los guardarraíles

Las seis capas que convierten un prototipo en un producto de IA fiable: ingesta gobernada, retrieval medible, orquestación determinista, evals en CI, guardarraíles de extremo a extremo y control de costes y latencia.

Software house — su misura, costruito da noi

PRODUCTO DE IA · ARQUITECTURA DE PRODUCCIÓN

Entra · Petición en bruto + fuentes

Sale · Respuesta que puedes lanzar, trazar y fiar

01

Datos e ingesta (linaje, redacción de PII)

Cada documento entra mediante parsing estructurado, clasificación de sensibilidad y redacción determinista del PII antes de llegar al modelo, y cada chunk conserva su vínculo con el archivo fuente, la versión de política y la run que lo produjo: sin esta capa ninguna respuesta sobrevive a una auditoría.

02

Recuperación (búsqueda híbrida + reordenación)

El retrieval fusiona búsqueda semántica por vectores y búsqueda léxica BM25 vía Reciprocal Rank Fusion, y luego un reranker cross-encoder reordena los candidatos para llevar arriba los pasajes realmente relevantes: aquí se gana o se pierde la fidelidad de la respuesta.

03

Orquestación (agente acotado, llamadas a herramientas)

Un workflow determinista decide dónde estás en el proceso mientras el modelo elige qué hacer dentro de un conjunto acotado de acciones, con llamadas a herramientas sobre protocolos estándar, ejecución durable y human-in-the-loop en las acciones de alto impacto: el agente sigue siendo predecible incluso bajo carga.

04

Evaluación y observabilidad (evals en CI, trazado)

Un dataset golden construido a partir de fallos reales, evaluadores calibrados contra revisores humanos y un gate en CI bloquean las regresiones antes del despliegue, con trazas que siguen convenciones semánticas abiertas (OpenTelemetry GenAI) para mantenerse interoperables e investigables.

05

Salvaguardas y seguridad (entrada/salida, inyección)

Los guardarraíles validan la entrada, el contexto recuperado y la salida de extremo a extremo contra la inyección de prompt — la vulnerabilidad más explotada — clasificando el contexto intermedio no confiable y evaluando cada acción respecto a la intención original del usuario.

06

Coste y latencia (enrutado, caché, TTFT)

El enrutamiento por complejidad, el caché semántico y los presupuestos de tokens mantienen a raya coste y time-to-first-token, con streaming para la latencia percibida, de modo que la factura no explota y la calidad no se degrada cuando el tráfico crece.

El punto

La demo convence, el producto se desmorona

Un prototipo de IA funciona porque corre sobre entradas conocidas, en single-tenant, sin tráfico adverso. La producción reescribe todas las reglas.

  • Respuestas seguras pero erróneas. El modelo cita con tono autoritario los documentos equivocados: el cuello de botella es el retrieval, no la generación.
  • Comportamiento no reproducible. La misma entrada da resultados distintos y nadie sabe por qué, porque no hay trazas ni un dataset de regresión.
  • Costes y latencia fuera de control. Prompts verbosos, sin caché, sin enrutamiento por complejidad: la factura crece y el time-to-first-token empeora bajo carga.
  • Una superficie de ataque abierta. Instrucciones hostiles ocultas en un documento o en la salida de una herramienta secuestran al agente: la inyección de prompt es la vulnerabilidad más explotada.
  • Ninguna trazabilidad. Cuando un usuario reporta un error, no se puede remontar al documento fuente, al chunk y a la run que lo produjeron.

Para equipos que llevan una IA del proof-of-concept a un sistema en producción, con auditorías, SLA y techos de coste.

Las seis capas

Qué hace de un prototipo un producto de verdad

Un producto de IA en producción es un sistema distribuido en el que el modelo es solo el planificador. Seis capas lo sostienen.

Datos e ingesta

Los documentos entran mediante parsing estructurado, clasificación de sensibilidad y redacción determinista del PII antes de llegar al modelo. Cada salida se remonta al archivo fuente, a la versión de política y a la run que la produjo.

Retrieval

La recuperación combina búsqueda semántica (vectores) y búsqueda léxica (BM25), fusionadas vía Reciprocal Rank Fusion, y luego un reranker cross-encoder reordena los candidatos. Aquí se gana o se pierde la fidelidad de la respuesta.

Orquestación y agentes

Un workflow determinista decide dónde estás en el proceso; el modelo decide qué hacer dentro de un conjunto acotado de acciones. Las llamadas a herramientas pasan por protocolos estándar, con ejecución durable y human-in-the-loop en las acciones de alto impacto.

Evaluación y observabilidad

Un dataset golden construido a partir de fallos reales, evaluadores calibrados contra revisores humanos y un gate en CI que bloquea las regresiones antes del despliegue. Las trazas siguen convenciones semánticas abiertas (OpenTelemetry GenAI) para mantenerse interoperables.

Guardarraíles y costes

Los guardarraíles validan la entrada, el contexto recuperado y la salida de extremo a extremo contra la inyección de prompt; el enrutamiento por complejidad, el caché semántico y los presupuestos de tokens mantienen a raya coste y latencia sin degradar la calidad.

Del dato a la respuesta

El recorrido de una sola petición

Qué atraviesa una petición cuando la arquitectura está completa, desde la capa de datos hasta el retorno de la respuesta.

1
Ingesta gobernada

El documento se parsea, se clasifica por sensibilidad, se limpia del PII y se indexa con etiquetas de finalidad; cada chunk conserva su vínculo con la fuente.

2
Retrieval y rerank

Búsqueda híbrida vector + palabra clave, fusión de rangos, y luego reranking cross-encoder para llevar arriba los pasajes realmente relevantes.

3
Orquestación acotada

El orquestador enruta la petición, llama a las herramientas necesarias y detiene al agente en los puntos de decisión críticos; cada invocación queda registrada.

4
Guardarraíles, eval y retorno

Salida validada contra la política y las señales de inyección, evaluada sobre trazas muestreadas, y luego devuelta con caché y streaming para la latencia percibida.

Seis capas atravesadas por petición, cada una medible y trazable de forma independiente.

Prototipo vs producto

Dónde cambia todo

Mismo modelo, mundo distinto. La distancia no está en el prompt: está en las capas que lo rodean.

DimensiónPrototipoProducto en producción
DatosArchivos subidos a manoIngesta gobernada, PII redactado, lineage trazable
RetrievalSolo búsqueda vectorialHíbrida + reranking, fidelidad medida
ControlAgente sin restriccionesWorkflow determinista, herramientas acotadas, human-in-the-loop
CalidadProbada a manoEvals en CI sobre un dataset golden, gate de regresión
Seguridad y costesSin guardarraílesDefensa en profundidad, enrutamiento, caché, presupuestos de tokens
Lo que obtienes

El valor de las seis capas

Esto no es teoría de arquitectura: es lo que te permite poner tu nombre en una respuesta ante un cliente o una auditoría.

01

Respuestas que sobreviven a una auditoría

Cada salida se remonta al documento, al chunk y a la versión de política: explicable, reproducible, defendible.

02

Fiabilidad bajo tráfico real

La orquestación determinista y los guardarraíles de extremo a extremo mantienen el comportamiento predecible incluso con entradas adversas y multi-tenant.

03

Calidad que no regresa

Las evals en CI bloquean los empeoramientos antes del despliegue, no después de la queja de un usuario.

04

Costes y latencia gobernados

El enrutamiento por complejidad, el caché semántico y los presupuestos de tokens mantienen la factura y el time-to-first-token bajo control a escala.

En producción un agente no es un prompt: es un sistema distribuido en el que el modelo es el planificador.

Preguntas directas

Lo que nos preguntan los clientes

¿Por qué la respuesta es segura pero errónea?

Casi siempre el problema está aguas arriba: el retrieval trajo los documentos equivocados y el modelo produjo una respuesta bien formada pero fundada en la fuente errónea. Se arregla con retrieval híbrido, reranking y medida de fidelidad, no con el prompt.

¿Cómo nos defendemos de la inyección de prompt?

Con defensa en profundidad: clasificar la entrada y el contexto recuperado antes del modelo, validar la salida contra la política, y evaluar cada acción del agente respecto a la intención original del usuario, aislando el contexto intermedio no confiable.

¿Qué hace falta más allá de un modelo que pasa las evals?

Un prototipo que pasa las evals es un ingrediente. También hacen falta datasets golden de fallos reales, trazas, gates en CI, canary, rollback y runbooks: se ingenieran, no se dan por sentados.

Casos

Del problema al resultado — anonimizados.

Servicios jurídicos · anonimizado

La cita segura pero errónea

Problema Un asistente documental respondía con tono autoritario citando el contrato equivocado: en la demo funcionaba, ante los clientes se desmoronaba la confianza porque nadie sabía remontar a la fuente.

Método Sustituida la búsqueda solo vectorial por retrieval híbrido (vectores + BM25) fusionado vía Reciprocal Rank Fusion y reranking cross-encoder, añadido lineage chunk-a-fuente y una medida de fidelidad sobre respuestas muestreadas.

Resultado Cada salida se remonta ahora al documento, al chunk y a la versión de política que la fundan; las respuestas no pertinentes se interceptan antes del usuario en lugar de surgir como reclamación.

Servicios financieros · anonimizado

El agente secuestrado por un documento

Problema Un agente con acceso a herramientas ejecutaba instrucciones hostiles ocultas dentro de los documentos subidos y de las salidas de herramientas: una inyección de prompt que abría una superficie de ataque en entorno multi-tenant.

Método Introducida defensa en profundidad — clasificar la entrada y el contexto recuperado antes del modelo, validar la salida contra la política, aislar el contexto intermedio no confiable y añadir human-in-the-loop en las acciones de alto impacto.

Resultado El comportamiento del agente se mantuvo predecible incluso con entradas adversas; cada acción se evalúa respecto a la intención original del usuario y las invocaciones de herramientas quedan registradas y son trazables.

Sanidad · anonimizado

La calidad que regresaba en silencio

Problema La misma entrada daba resultados distintos y los empeoramientos solo emergían tras la queja de un usuario, porque no había trazas ni un dataset de regresión en el que apoyarse.

Método Construido un dataset golden a partir de fallos reales, calibrados los evaluadores contra revisores humanos, añadido un gate de eval en CI con canary y rollback, e instrumentadas trazas conformes a OpenTelemetry GenAI.

Resultado Las regresiones se bloquean antes del despliegue en lugar de después de una reclamación, y el comportamiento del sistema es hoy reproducible e investigable run a run.

Profundiza más

Llevémoslo a tu stack.