Craft AIConsultoria & AssessmentAI Governance Consult

ConsultoriaDelivery

AI Governance Consult

Teto que bloqueia antes da chamada. Dono do custo antes da fatura.

Pedidos
Camada de governança
Modelos

O teto bloqueia antes da chamada. Não alerta depois da fatura.

1Inventáriodono, finalidade e custo
2Teto em camadas
3Roteamento por tarefa
4Reuso de contexto
5Auditoriapadrão anômalo gera ação
Medimos
Teto bloqueia, não alerta
% de chamadas ao modelo de fronteira
Taxa de acerto de cache
Ativos com dono: 100% · custo por resolução
Você se reconhece?
  • Ninguém sabe dizer quem é o dono do custo de IA. A fatura chega semanas depois do gasto.
  • O modelo foi escolhido no dia do protótipo e nunca mais mexido.
  • Alguém pode mudar o prompt em produção hoje e isso não fica registrado.
“A conta de IA dobrou e eu não sei dizer para qual feature.”
O que fazemos
  • Inventário: todo ativo de IA (modelo, prompt, base por RAG, ajuste fino) com dono, finalidade, criticidade e custo.
  • Teto em camadas: por chamada, conversa, usuário por dia, área por mês. Corte antes da chamada.
  • Roteamento por tarefa: cada tipo de tarefa em um alias; o alias aponta para o menor modelo que atende.
  • Reuso de contexto: o que se repete é cacheado; leitura de cache custa uma fração do preço.
  • Auditoria e padrão anômalo: registro de tudo; volume, repetição e tentativa de extrair instruções geram ação.
Gateway · começa open source
LiteLLM como padrão de entrada. Se a casa já roda Bedrock ou Azure APIM, a política vai para lá.

Roteamento é decisão de arquitetura por alias de tarefa, não produto. Sem plataforma nossa, sem lock-in.

Como funciona
  1. Auditoria de fatura de IA: 1 semana.
  2. Camada em produção: 4 a 10 semanas, escopo fechado. Tetos, aliases, cache e trilha.
  3. Camada corporativa: política por área e FinOps de IA no seu time.

Comece pela auditoria de fatura de IA, de 1 semana.

Escopo e prazo definidos antes de assinar. Você vê o resultado do passo anterior antes de decidir o próximo.