Saltar para o conteúdo

AI Products · Aprofundamento

Arquitetura de um produto de IA em produção: dos dados aos guardrails

As seis camadas que transformam um protótipo num produto de IA confiável: ingestão governada, retrieval mensurável, orquestração determinística, evals em CI, guardrails de ponta a ponta e controlo de custos e latência.

Software house — su misura, costruito da noi

PRODUTO DE IA · ARQUITETURA DE PRODUÇÃO

Entra · Pedido bruto + fontes

Sai · Resposta que pode lançar, rastrear e em que confiar

01

Dados e ingestão (linhagem, remoção de PII)

Cada documento entra por parsing estruturado, classificação de sensibilidade e redação determinística do PII antes de chegar ao modelo, e cada chunk conserva a sua ligação ao ficheiro fonte, à versão de política e à run que o produziu: sem esta camada nenhuma resposta sobrevive a uma auditoria.

02

Recuperação (pesquisa híbrida + reranking)

O retrieval funde pesquisa semântica por vetores e pesquisa lexical BM25 via Reciprocal Rank Fusion, e depois um reranker cross-encoder reordena os candidatos para trazer para cima as passagens verdadeiramente relevantes: é aqui que a fidelidade da resposta se ganha ou se perde.

03

Orquestração (agente delimitado, chamadas de ferramentas)

Um workflow determinístico decide onde estás no processo enquanto o modelo escolhe o que fazer dentro de um conjunto limitado de ações, com chamadas a ferramentas sobre protocolos padrão, execução durável e human-in-the-loop nas ações de alto impacto: o agente mantém-se previsível mesmo sob carga.

04

Avaliação e observabilidade (evals em CI, tracing)

Um dataset golden construído a partir de falhas reais, graders calibrados contra revisores humanos e um gate em CI bloqueiam as regressões antes do lançamento, com traces que seguem convenções semânticas abertas (OpenTelemetry GenAI) para se manterem interoperáveis e investigáveis.

05

Guardrails e segurança (input/output, injeção)

Os guardrails validam a entrada, o contexto recuperado e a saída de ponta a ponta contra a injeção de prompt — a vulnerabilidade mais explorada — classificando o contexto intermédio não fiável e avaliando cada ação face à intenção original do utilizador.

06

Custo e latência (routing, caching, TTFT)

O roteamento por complexidade, o caching semântico e os orçamentos de tokens mantêm sob controlo custo e time-to-first-token, com streaming para a latência percebida, de modo que a conta não explode e a qualidade não se degrada quando o tráfego cresce.

O ponto

A demo convence, o produto desmorona

Um protótipo de IA funciona porque corre sobre entradas conhecidas, em single-tenant, sem tráfego adverso. A produção reescreve todas as regras.

  • Respostas seguras mas erradas. O modelo cita com tom autoritário os documentos errados: o gargalo é o retrieval, não a geração.
  • Comportamento não reproduzível. A mesma entrada dá resultados diferentes e ninguém sabe porquê, porque não existem traces nem um dataset de regressão.
  • Custos e latência fora de controlo. Prompts verbosos, sem caching, sem roteamento por complexidade: a conta cresce e o time-to-first-token piora sob carga.
  • Uma superfície de ataque aberta. Instruções hostis escondidas num documento ou na saída de uma ferramenta sequestram o agente: a injeção de prompt é a vulnerabilidade mais explorada.
  • Nenhuma rastreabilidade. Quando um utilizador reporta um erro, não se consegue remontar ao documento fonte, ao chunk e à run que o produziram.

Para equipas que levam uma IA do proof-of-concept a um sistema em produção, com auditorias, SLAs e tetos de custo.

As seis camadas

O que torna um protótipo num produto a sério

Um produto de IA em produção é um sistema distribuído em que o modelo é apenas o planeador. Seis camadas o sustentam.

Dados e ingestão

Os documentos entram por parsing estruturado, classificação de sensibilidade e redação determinística do PII antes de chegarem ao modelo. Cada saída remonta ao ficheiro fonte, à versão de política e à run que a produziu.

Retrieval

A recuperação combina pesquisa semântica (vetores) e pesquisa lexical (BM25), fundidas via Reciprocal Rank Fusion, e depois um reranker cross-encoder reordena os candidatos. É aqui que a fidelidade da resposta se ganha ou se perde.

Orquestração e agentes

Um workflow determinístico decide onde estás no processo; o modelo decide o que fazer dentro de um conjunto limitado de ações. As chamadas a ferramentas passam por protocolos padrão, com execução durável e human-in-the-loop nas ações de alto impacto.

Avaliação e observabilidade

Um dataset golden construído a partir de falhas reais, graders calibrados contra revisores humanos e um gate em CI que bloqueia as regressões antes do lançamento. Os traces seguem convenções semânticas abertas (OpenTelemetry GenAI) para se manterem interoperáveis.

Guardrails e custos

Os guardrails validam a entrada, o contexto recuperado e a saída de ponta a ponta contra a injeção de prompt; o roteamento por complexidade, o caching semântico e os orçamentos de tokens mantêm custo e latência sob controlo sem degradar a qualidade.

Do dado à resposta

O percurso de um único pedido

O que um pedido atravessa quando a arquitetura está completa, da camada de dados até ao retorno da resposta.

1
Ingestão governada

O documento é parseado, classificado por sensibilidade, limpo do PII e indexado com tags de finalidade; cada chunk conserva a sua ligação à fonte.

2
Retrieval e rerank

Pesquisa híbrida vetor + palavra-chave, fusão de ranks, e depois reranking cross-encoder para trazer para cima as passagens verdadeiramente relevantes.

3
Orquestração limitada

O orquestrador encaminha o pedido, chama as ferramentas necessárias e pausa o agente nos pontos de decisão críticos; cada invocação fica registada.

4
Guardrails, eval e retorno

Saída validada contra a política e os sinais de injeção, avaliada sobre traces amostrados, e depois devolvida com caching e streaming para a latência percebida.

Seis camadas atravessadas por pedido, cada uma mensurável e rastreável de forma independente.

Protótipo vs produto

Onde tudo muda

Mesmo modelo, mundo diferente. A distância não está no prompt: está nas camadas que o rodeiam.

DimensãoProtótipoProduto em produção
DadosFicheiros carregados à mãoIngestão governada, PII redigido, lineage rastreável
RetrievalSó pesquisa vetorialHíbrida + reranking, fidelidade medida
ControloAgente sem restriçõesWorkflow determinístico, ferramentas limitadas, human-in-the-loop
QualidadeTestada à mãoEvals em CI sobre um dataset golden, gate de regressão
Segurança e custosSem guardrailsDefesa em profundidade, roteamento, caching, orçamentos de tokens
O que obténs

O valor das seis camadas

Isto não é teoria de arquitetura: é o que te permite pôr o teu nome numa resposta perante um cliente ou uma auditoria.

01

Respostas que sobrevivem a uma auditoria

Cada saída remonta ao documento, ao chunk e à versão de política: explicável, reproduzível, defensável.

02

Fiabilidade sob tráfego real

Orquestração determinística e guardrails de ponta a ponta mantêm o comportamento previsível mesmo com entradas adversas e multi-tenant.

03

Qualidade que não regride

As evals em CI bloqueiam as degradações antes do lançamento, não depois da queixa de um utilizador.

04

Custos e latência governados

O roteamento por complexidade, o caching semântico e os orçamentos de tokens mantêm a conta e o time-to-first-token sob controlo à escala.

Em produção um agente não é um prompt: é um sistema distribuído em que o modelo é o planeador.

Perguntas diretas

O que os clientes nos perguntam

Porque é que a resposta é segura mas errada?

Quase sempre o problema está a montante: o retrieval trouxe os documentos errados e o modelo produziu uma resposta bem formada mas fundada na fonte errada. Corrige-se com retrieval híbrido, reranking e medida de fidelidade, não com o prompt.

Como nos defendemos da injeção de prompt?

Com defesa em profundidade: classificar a entrada e o contexto recuperado antes do modelo, validar a saída contra a política, e avaliar cada ação do agente face à intenção original do utilizador, isolando o contexto intermédio não fiável.

O que é preciso para além de um modelo que passa as evals?

Um protótipo que passa as evals é um ingrediente. São também precisos datasets golden de falhas reais, traces, gates em CI, canary, rollback e runbooks: engenheiram-se, não se dão por garantidos.

Casos

Do problema ao resultado — anônimos.

Serviços jurídicos · anonimizado

A citação segura mas errada

Problema Um assistente documental respondia com tom autoritário citando o contrato errado: na demo funcionava, perante os clientes a confiança desmoronava porque ninguém sabia remontar à fonte.

Método Substituída a pesquisa apenas vetorial por retrieval híbrido (vetores + BM25) fundido via Reciprocal Rank Fusion e reranking cross-encoder, adicionado lineage chunk-a-fonte e uma medida de fidelidade sobre respostas amostradas.

Resultado Cada saída remonta agora ao documento, ao chunk e à versão de política que a fundam; as respostas não pertinentes são intercetadas antes do utilizador em vez de surgirem como reclamação.

Serviços financeiros · anonimizado

O agente sequestrado por um documento

Problema Um agente com acesso a ferramentas executava instruções hostis escondidas dentro dos documentos carregados e das saídas de ferramentas: uma injeção de prompt que abria uma superfície de ataque em ambiente multi-tenant.

Método Introduzida defesa em profundidade — classificar a entrada e o contexto recuperado antes do modelo, validar a saída contra a política, isolar o contexto intermédio não fiável e adicionar human-in-the-loop nas ações de alto impacto.

Resultado O comportamento do agente manteve-se previsível mesmo com entradas adversas; cada ação é avaliada face à intenção original do utilizador e as invocações de ferramentas ficam registadas e rastreáveis.

Saúde · anonimizado

A qualidade que regredia em silêncio

Problema A mesma entrada dava resultados diferentes e as degradações só emergiam após a queixa de um utilizador, porque não existiam traces nem um dataset de regressão em que se apoiar.

Método Construído um dataset golden a partir de falhas reais, calibrados os graders contra revisores humanos, adicionado um gate de eval em CI com canary e rollback, e instrumentados traces conformes a OpenTelemetry GenAI.

Resultado As regressões são bloqueadas antes do lançamento em vez de depois de uma reclamação, e o comportamento do sistema é hoje reproduzível e investigável run a run.

Aprofunde mais

Vamos levá-lo ao seu stack.