e.brain

Motor de IA com roteamento de modelos, RAG e controlo de custos.

  • Model routing
  • RAG
  • Cost tracking
  • Prompt cache
  • Fallbacks

Visão geral

O e.brain é o motor que executa todos os pedidos de IA da plataforma. Expõe uma API única e decide, por pedido, qual o modelo a usar com base em política, custo, latência e sensibilidade dos dados. Inclui o pipeline de RAG (recuperação, reordenação e montagem de contexto) sobre o e.knowledge, cache de prompts, fallbacks automáticos e contabilização de custo por workspace, equipa e utilizador.

Funcionalidades principais

Roteamento por política

Regras declarativas escolhem o modelo por tipo de tarefa, tamanho do contexto, região e orçamento.

Pipeline RAG configurável

Recuperação híbrida (vetorial + BM25), reordenação e limites de contexto por perfil.

Contabilização de custos

Tokens e euros por pedido, com etiquetas de workspace, app de origem e utilizador.

Fallback e degradação suave

Se um fornecedor falhar ou exceder a latência alvo, o pedido é reencaminhado automaticamente.

Guardrails

Filtros de PII, listas de bloqueio e limites de tokens por pedido e por dia.

Guia de utilização

  1. 1

    Registar fornecedores de modelos

    Em Admin → e.brain → Providers, adicione as credenciais. As chaves ficam em segredos do workspace, nunca no código.

  2. 2

    Criar perfis de modelo

    Um perfil agrupa modelo primário, fallbacks e limites. As apps referem perfis, nunca modelos concretos.

    yaml
    profile: balanced
    primary: gpt-class-mid
    fallbacks: [claude-class-mid, local-8b]
    max_input_tokens: 32000
    max_output_tokens: 2000
    temperature: 0.2
    cache: prompt-prefix
  3. 3

    Definir regras de roteamento

    As regras são avaliadas por ordem; a primeira correspondência ganha.

    yaml
    rules:
      - when: { data_class: restricted }
        use: local-only
      - when: { task: summarize, input_tokens: "<4000" }
        use: fast
      - when: { app: e.agent }
        use: advanced
      - default: balanced
  4. 4

    Ligar o RAG às coleções

    Escolha as coleções, o número de fragmentos e o reordenador.

    json
    {
      "collections": ["policies", "product-docs"],
      "retrieval": { "mode": "hybrid", "top_k": 40 },
      "rerank": { "model": "reranker-v2", "keep": 8 },
      "context_budget_tokens": 6000
    }
  5. 5

    Chamar a API

    Todas as apps usam o mesmo endpoint; o roteamento é transparente.

    bash
    curl -X POST https://brain.eworks.cloud/v1/completions \
      -H "Authorization: Bearer $EWORKS_TOKEN" \
      -d '{
        "profile": "balanced",
        "workspace": "acme-prod",
        "messages": [{"role":"user","content":"Resume a política de férias"}],
        "grounding": { "collections": ["policies"] }
      }'
  6. 6

    Definir orçamentos

    Limites mensais por workspace com alertas a 50%, 80% e 100%, visíveis no e.dash.

Casos de uso comuns

Reduzir custo sem perder qualidade

Tarefas simples vão para modelos baratos; só o que precisa usa o modelo avançado.

Dados sensíveis em modelo local

Regras de classificação forçam execução local para conteúdo restrito.

Resiliência multi-fornecedor

Uma indisponibilidade de fornecedor não interrompe o serviço.

Checklist de configuração

  • Credenciais de fornecedores guardadas em segredos
  • Pelo menos dois fornecedores configurados para fallback
  • Perfis fast / balanced / advanced criados
  • Regras de roteamento testadas com pedidos de exemplo
  • Orçamento mensal e alertas ativos
  • Guardrails de PII ativos nos perfis públicos
  • Métricas de custo visíveis no e.dash

Integrações

Perguntas frequentes