e.brain
Motor de IA com roteamento de modelos, RAG e controlo de custos.
- Model routing
- RAG
- Cost tracking
- Prompt cache
- Fallbacks
Visão geral
O e.brain é o motor que executa todos os pedidos de IA da plataforma. Expõe uma API única e decide, por pedido, qual o modelo a usar com base em política, custo, latência e sensibilidade dos dados. Inclui o pipeline de RAG (recuperação, reordenação e montagem de contexto) sobre o e.knowledge, cache de prompts, fallbacks automáticos e contabilização de custo por workspace, equipa e utilizador.
Funcionalidades principais
Roteamento por política
Regras declarativas escolhem o modelo por tipo de tarefa, tamanho do contexto, região e orçamento.
Pipeline RAG configurável
Recuperação híbrida (vetorial + BM25), reordenação e limites de contexto por perfil.
Contabilização de custos
Tokens e euros por pedido, com etiquetas de workspace, app de origem e utilizador.
Fallback e degradação suave
Se um fornecedor falhar ou exceder a latência alvo, o pedido é reencaminhado automaticamente.
Guardrails
Filtros de PII, listas de bloqueio e limites de tokens por pedido e por dia.
Guia de utilização
- 1
Registar fornecedores de modelos
Em Admin → e.brain → Providers, adicione as credenciais. As chaves ficam em segredos do workspace, nunca no código.
- 2
Criar perfis de modelo
Um perfil agrupa modelo primário, fallbacks e limites. As apps referem perfis, nunca modelos concretos.
yamlprofile: balanced primary: gpt-class-mid fallbacks: [claude-class-mid, local-8b] max_input_tokens: 32000 max_output_tokens: 2000 temperature: 0.2 cache: prompt-prefix - 3
Definir regras de roteamento
As regras são avaliadas por ordem; a primeira correspondência ganha.
yamlrules: - when: { data_class: restricted } use: local-only - when: { task: summarize, input_tokens: "<4000" } use: fast - when: { app: e.agent } use: advanced - default: balanced - 4
Ligar o RAG às coleções
Escolha as coleções, o número de fragmentos e o reordenador.
json{ "collections": ["policies", "product-docs"], "retrieval": { "mode": "hybrid", "top_k": 40 }, "rerank": { "model": "reranker-v2", "keep": 8 }, "context_budget_tokens": 6000 } - 5
Chamar a API
Todas as apps usam o mesmo endpoint; o roteamento é transparente.
bashcurl -X POST https://brain.eworks.cloud/v1/completions \ -H "Authorization: Bearer $EWORKS_TOKEN" \ -d '{ "profile": "balanced", "workspace": "acme-prod", "messages": [{"role":"user","content":"Resume a política de férias"}], "grounding": { "collections": ["policies"] } }' - 6
Definir orçamentos
Limites mensais por workspace com alertas a 50%, 80% e 100%, visíveis no e.dash.
Casos de uso comuns
Reduzir custo sem perder qualidade
Tarefas simples vão para modelos baratos; só o que precisa usa o modelo avançado.
Dados sensíveis em modelo local
Regras de classificação forçam execução local para conteúdo restrito.
Resiliência multi-fornecedor
Uma indisponibilidade de fornecedor não interrompe o serviço.
Checklist de configuração
- Credenciais de fornecedores guardadas em segredos
- Pelo menos dois fornecedores configurados para fallback
- Perfis fast / balanced / advanced criados
- Regras de roteamento testadas com pedidos de exemplo
- Orçamento mensal e alertas ativos
- Guardrails de PII ativos nos perfis públicos
- Métricas de custo visíveis no e.dash