Pular para o conteúdo principal
Geo-Hermes Estação GENESIS
Documentação interna · junho de 2026

O painel completo do Geo-Hermes na máquina GENESIS

Cockpit pilota, Hermes executa 24/7. Esta página reúne hardware, modelos de IA locais, roteamento na nuvem, contas isoladas, automações agendadas, fluxogramas, métricas, glossário e perguntas frequentes — tudo em um so lugar.

18
Modelos locais
6
Providers cloud
10
Fluxogramas
24/7
Gateway Hermes
Parte 1

O que é isso?

Para o board

Em 1 minuto

Sem jargão técnico: o que é o GENESIS, em linguagem de negócio, e por que ele economiza dinheiro enquanto trabalha sozinho.

Depender de um único modelo de IA é como ter uma equipe de uma pessoa só: o Opus 4.8 raciocina fundo mas é caro, os modelos locais são gratuitos mas mais rasos, e cada provider externo brilha em uma coisa só. O GENESIS resolve isso como um escritório de IA que não dorme, montado dentro de um único computador: um estagiário local gratuito (os modelos via Ollama) faz triagem, rascunho e trabalho repetitivo sem mandar dado para fora; um consultor sênior premium (Claude Opus 4.8) entra só quando a decisão justifica a conta — arquitetura, copy final, análise estratégica; e um gerente de custos (o orquestrador-roteador) olha cada tarefa e escolhe quem executa, sempre tentando o mais barato primeiro.

O resultado é simples de explicar a um conselho: a maior parte do volume sai de graça no estágio local, a inteligência cara entra apenas onde muda o resultado, e um medidor de orçamento corta o gasto automaticamente se algo sair do padrão. Potência alta onde importa, custo baixo onde não importa. Esta página percorre, na ordem em que as perguntas surgem, o que o GENESIS é, como ele decide qual IA usa cada tarefa, o que já entrega na prática, quanto custa e economiza, e como evolui mantendo a operação segura.

Resumo para o conselho — leitura de 1 minuto

  • O que é. Um “escritório de IA” autônomo dentro de um único PC: triagem e rascunho saem de graça em modelos locais; a inteligência cara entra só quando a decisão justifica. Operação 24/7, controlada pelo Telegram.
  • Por que importa. Custo de IA baixo sem perder qualidade onde importa; na triagem os dados não saem da máquina — vantagem para clientes regulados (financeiro, saúde, jurídico).
  • Quanto economiza. O roteamento “local primeiro, nuvem só quando necessário” reduz tipicamente 45–75% do custo vs. processar tudo na nuvem; cerca de 40–60% das tarefas resolvem no estágio local a custo zero (ver as 3 simulações de FinOps).
  • Decisões-chave. Híbrido local+nuvem; modelo por camada (barato → caro); autonomia com teto de orçamento automático (circuit-breaker, US$5/dia · US$60/mês); contas isoladas (PJ Nuvini × PF Max).
  • Estado e risco (jun/2026). O padrão do bot hoje é o modelo local (qwen3-coder:30b-hermes). O Opus 4.8 via OAuth Max foi usado até 08/06, mas saiu do bot por conformidade com o ToS da Anthropic; o cérebro premium está em migração para GPT-5.5 (via OAuth OpenAI). O roteamento multi-provider (6 APIs) é capacidade montada, ainda em chaves placeholder.
  • Maturidade. Triagem local, gateway 24/7, FinOps com killswitch e observabilidade já operacionais; ativar o cérebro premium e o cloud roteado é o próximo passo.
0 Modelos locais (Ollama)
0 Autônomo, todos os dias
0 Premium em migração (Opus → GPT-5.5)
0 Subsistemas integrados
A jornada de uma tarefa: tenta-se o estágio local grátis primeiro; só o que é complexo sobe para o cérebro premium na nuvem (Opus 4.8 → GPT-5.5).
Você envia a tarefa Triagem local estágio zero · grátis Simples? responde local Complexa? Cérebro premium Resposta entregue

O que é um LLM?

Analogia

Um LLM é como um funcionário que leu praticamente tudo o que já foi escrito e aprendeu a prever a próxima palavra de um texto. Por isso ele consegue redigir, resumir, traduzir e responder perguntas. Ele não "sabe" as coisas como uma pessoa; ele é extremamente bom em continuar um texto de forma plausível — e isso, na prática, resolve a maior parte do trabalho de escritório.

O que faz o orquestrador?

Analogia

O orquestrador é o gerente que recebe cada pedido e decide quem deve atendê-lo: o estagiário local grátis, ou o consultor premium pago. Ele sempre tenta o mais barato primeiro e só escala para a opção cara quando a tarefa realmente exige. É o que mantém a conta do mês sob controle sem você precisar pensar nisso.

Etapa 1

Status do sistema

Estado operacional confirmado dos subsistemas do Geo-Hermes na GENESIS, conforme verificações registradas nas memórias do projeto.

Operacional Gateway Hermes @Caramaschi_bot 24/7 Teste end-to-end retornou OPUS-OAUTH-OK em 08/06/2026 (regime até 08/06; o Opus saiu do bot por conformidade com o ToS).
Confirmado Modelo default do bot qwen3-coder:30b-hermes (local) Atualizado em 09/06/2026 (model.default = qwen3-coder:30b-hermes, provider local). O Claude saiu do Hermes por conformidade com o ToS da Anthropic; o cérebro premium (GPT-5.5 via OAuth) entra em seguida.
Ativo Fallback local qwen3-coder:30b-hermes Aciona em erro 429/529/503 da nuvem; mantido quente por keep-warm.
No ar Ollama local localhost:11434 Modelos em D:\AI\Ollama\models; garantido por ollama-ensure.ps1.
Isolado Contas Claude Max pessoal + Team Hermes em ~/.claude-hermes; interativo em ~/.claude.
Pendente Chaves cloud (orquestrador) Placeholders no .env As 6 APIs externas exigem chaves reais via setkeys antes do escalonamento.
Topologia — regra de ouro
Cockpit pilota (trabalho interativo, decisões, Chrome) e NUNCA roda como servidor. Hermes executa autônomo 24/7, sempre dentro de sandbox. Jobs realmente independentes de hardware vao para as Routines na nuvem.
Parte 2

Como funciona e decide?

Etapa 2

Guia por subsistema

Visão consolidada da infraestrutura local da GENESIS, com tabelas detalhadas e fluxogramas intercalados onde ajudam a entender cada peça.

Hermes operacional — padrão no modelo local
Gateway @Caramaschi_bot confirmado e online 24/7. Até 08/06/2026 o bot respondeu com Opus 4.8 via OAuth Max (teste OPUS-OAUTH-OK); desde 09/06, por conformidade com o ToS da Anthropic, o padrão é o modelo local qwen3-coder:30b-hermes e o cérebro premium está em migração para GPT-5.5 via OAuth OpenAI.
Gotcha critico — Ollama GUI
NUNCA abra o ollama app.exe pela interface grafica: ele ignora OLLAMA_MODELS e forca modelos para C:. Use sempre o script keeper ollama-ensure.ps1 ou o comando serve apontando para D:.
Isolamento de contas Claude Code
Hermes usa CLAUDE_CONFIG_DIR=~/.claude-hermes (conta Max pessoal — alexandre.brt14@gmail.com, via OAuth). O Claude Code interativo usa ~/.claude (conta nuvini, plano Team). As duas contas não se interferem.
Hardware GENESIS
Dell Alienware m16 R1

Estação de trabalho principal do Alexandre. Processador de 24 núcleos, 64 GB de RAM DDR5 e dois SSDs NVMe. Disco D: (2 TB) reservado para projetos e dados.

ComponenteDetalhe
CPUi9-13900HX — 24 núcleos / 32 threads
RAM64 GB DDR5-4800 (2 × 32 GB)
GPURTX 4060 Laptop 8 GB + Intel UHD
Disco D:SSD NVMe Crucial ~2 TB (trabalho)
LLMs Locais — Ollama
localhost:11434

Servidor local de IA rodando sem internet. Atua como estágio zero do roteador: triagem e rascunho local antes de qualquer chamada paga a nuvem.

ModeloUso principal
Qwen3 8BCódigo Python + VS Code Continue
GemmaVisão e tarefas multilíngues
Qwen3Raciocínio complexo
30B (fallback)Fallback do bot Telegram
Hermes — Gateway Telegram
@Caramaschi_bot · local (qwen3-coder:30b-hermes)

Assistente autônomo 24/7 controlado via Telegram. Por padrão usa o modelo local (qwen3-coder:30b-hermes); o Claude foi retirado do bot por conformidade com o ToS da Anthropic, e o cérebro premium passa a ser o GPT-5.5 via OAuth. Reinicia automaticamente até 99 vezes.

ComponenteValor
Modelo padrãoqwen3-coder:30b-hermes (local)
Cérebro premiumGPT-5.5 via OAuth (em ativação)
Config dir~/.claude-hermes (isolado)
Context64 K (65.536) tokens
1. Visão geral — Cockpit pilota, Hermes executa 24/7
Alexandrehumano · decide e revisa
Cockpit (pilota)decisões, copy final, Chrome · nunca roda como servidor
Tarefa interativa?
Sim
Continua no Cockpittrabalho interativo
Não, autônoma
Hermesexecuta 24/7 em sandbox
Sandbox fail-safeperímetro fechado
LLM localOllama :11434
Routines (nuvem)jobs sem hardware

3.1 Hardware GENESIS

Especificações físicas do notebook Alienware m16 R1 (hostname CARAMASCHI-PC), confirmadas via WMI em 01/06/2026.

Analogia: é o "prédio" onde o escritório de IA funciona — processador potente, bastante memória e uma placa de vídeo que acelera os modelos locais. O disco D: é o arquivo-morto de trabalho onde tudo fica guardado.
Ficha técnica completa do hardware (clique para expandir)
Fonte: reference_genesis_hardware — WMI 2026-06-01
ComponenteDetalhe
Fabricante / ModeloDell Alienware m16 R1
Sistema OperacionalWindows 11 Pro 64-bit, build 10.0.26200 (instalado 16/12/2024, licença OEM ativada)
Processador (CPU)Intel Core i9-13900HX — 24 núcleos / 32 threads (8 P-cores + 16 E-cores)
Memória RAM64 GB DDR5-4800 (2 × 32 GB, ambos os slots ocupados — sem espaco para upgrade simples)
Placa de Vídeo (GPU)NVIDIA GeForce RTX 4060 Laptop (8 GB VRAM dedicada) + Intel UHD integrada
Disco C:SSD NVMe KIOXIA ~1 TB — sistema e programas (~639 GB usados; manter abaixo de 80%)
Disco D:SSD NVMe Crucial ~2 TB — disco de trabalho; todos os projetos, exportações e dados devem ficar aqui

3.2 Catálogo de LLMs Locais (Ollama)

Modelos instalados no GENESIS via Ollama (localhost:11434), armazenados em D:\AI\Ollama\models, com seus papeis, tamanhos e janelas de contexto.

Analogia: são os "estagiários da casa" que trabalham de graça. São 7 modelos catalogados, mas só um fica de plantão aquecido por vez; os outros são chamados quando precisa. Eles fazem a triagem antes de incomodar o consultor caro.
Fonte: project_genesis_local_llm_ollama + project_genesis_local_llm_orchestrator — medições 2026-06-01
Modelo (tag Ollama)Tamanho / ArquiteturaUso principalContexto (num_ctx)
qwen2.5-coder:7b / qwen-coder-7b-tuned7 B (denso); 100% GPU (RTX 4060 8 GB); ~50–54 tok/sCódigo Python local; workhorse do VS Code Continue + Aider16 384 tokens
qwen3-coder:30b / qwen3-coder:30b-hermes30,5 B MoE (3 B ativos/token); ~23–27 tok/s (27% GPU / 73% CPU)Agente Hermes (fallback cloud + gateway Telegram); código pesado65 536 tokens (≥ 64 K exigido pelo Hermes)
qwen2.5-coder:1.5b-base1,5 B (denso); residente em VRAMAutocomplete FIM em tempo real no VS Code Continue4 096 tokens (autocomplete)
qwen3:8b / qwen3-8b-nothink8 B (denso); ~40 tok/s na GPUAssistente geral (raciocínio, plano, math); juiz no modo council do orquestrador32 768 tokens (nativo; rejeitado pelo Hermes < 64 K)
gemma3:4b-it-qat4 B (denso); ~90 tok/s (Gemma4-E4B)Tarefa geral e roteamento padrão do orquestrador local8 192 tokens
gemma3:12b-it-qat / gemma412 B (denso); ~20 tok/sVisão / OCR / multilíngue / escrita criativa8 192 tokens
bge-m3 + Qwen3-Embedding-0.6B0,6 B (embedding only)RAG local — embeddings para @codebase e rag_local.pyN/A (embedding, não geração)
2. Roteamento por dificuldade (padrão-alvo): tenta o local primeiro e escala ao cérebro premium na nuvem só quando precisa.
Nova tarefa
Estágio zero: LLM localtriagem
Dificuldade?
Trivial / lote / offline
Resolve localOllama
insuficiente
Volume / refactor
Sonnet
insuficiente
Decisão / arquitetura / copy final
Opus
convergência
Entrega
8. Orquestrador local: escolhe entre rodar um modelo só, vários em conselho ou em cadeia.
Tarefa para o orquestrador
Modo?
Solo
1 modelo por tipo
Tipo de tarefa
Qwen3 8BCódigo
GemmaVisão / multilíngue
Qwen3Raciocínio
Council
Vários modelos votam
Agrega respostas
Pipeline
Modelos em cadeia
Saída vira entrada do próximo
convergência
Escalonar nuvem?
Com permissão
6 APIs na nuvem
Não
Entrega local

3.3 Roteamento Cloud por Provider/Modelo (6 Providers)

O cloud.py do orquestrador escalona para um dos seis providers externos com permissão explicita; chaves reais ainda precisam ser inseridas via setkeys.

Analogia: é a "agenda de consultores externos" que o gerente pode contratar. A lista está montada (seis fornecedores), mas os contratos ainda não foram assinados — as chaves são placeholders. Hoje vale como capacidade futura, não como serviço ligado.
Fonte: project_genesis_local_llm_orchestrator — cloud_catalog.json + cloud.py 2026-06-04
ProviderModelo flagshipRegra de roteamento / uso tipicoFonte da chave (get_key)
Anthropicclaude-opus-4-8 / claude-sonnet-4-6Decisão, arquitetura, copy final (Opus); volume/refactor (Sonnet); flag --provider anthropicANTHROPIC_API_KEY env → geo .env.keys.env
OpenAIGPT-5.5 (flagship vigente)Cérebro premium do Hermes — em ativação (substitui o Opus no bot por conformidade com o ToS); também capacidades exclusivas GPT (visão, geração de imagem, function calling pesado)OPENAI_API_KEY env → geo .env.keys.env
GoogleGemini (flagship)Multilíngue de alta qualidade, contexto longo, pesquisa Google-groundedGOOGLE_API_KEY env → geo .env.keys.env
Perplexitysonar-pro (flagship)Research com citações web em tempo real — NUNCA substituível pelo LLM localPERPLEXITY_API_KEY env → geo .env.keys.env
Groqllama3 / mixtral (inferência rápida)Inferência de baixa latência para tarefas de volume que precisam de velocidade e não de qualidade máximaGROQ_API_KEY env → geo .env.keys.env
xAIGrok (flagship)Acesso a dados X/Twitter em tempo real; raciocínio alternativoXAI_API_KEY env → geo .env.keys.env
6. FinOps: o medidor de orçamento aciona o disjuntor que, no limite, dispara o killswitch.
Gasto da sessão
Budget gaugefinops-guard
Acima de GEO_HERMES_BUDGET_USD?
Não
Segue operando
Aviso
Alerta FinOps
Segue operando
Estouro
Circuit-breaker arma
Killswitchcorta gasto autônomo

3.4 Contas Claude e Isolamento

O GENESIS opera com duas contas Claude completamente separadas para evitar conflitos de autenticação e bloqueios de plano entre o agente autônomo (Hermes) e o trabalho interativo (Claude Code / Overseer).

Analogia: são dois crachás diferentes que nunca se misturam. O crachá pessoal (Max) é o que o robô autônomo usa dia e noite; o crachá da empresa (Team) é o do trabalho manual. Separar os crachás evita que um trave o acesso do outro.
Fonte: project_hermes_telegram_remote_control + project_genesis_hermes_role_applied — doutrina 2 contas consolidada 08/06/2026
ContaPlanoPapelConfig dir (CLAUDE_CONFIG_DIR)
alexandre.brt14@gmail.comMax pessoal (subscriptionType: max)Hermes 24/7 (@Caramaschi_bot) — padrão local (qwen3-coder:30b-hermes); Claude removido do bot por ToS; cérebro GPT-5.5 via OAuth em ativação~/.claude-hermes — injetado em Start-HermesGateway.ps1 (linha 8); credencial OAuth em ~/.claude-hermes/.credentials.json
alexandre@nuvini.aiTeam (org Nuvini) — bloqueia apps de terceiros no plano; ideal para uso first-partyClaude Code interativo, Overseer, trabalho pesado manual; modelo Opus 4.8 / Sonnet 4.6 conforme tarefa~/.claude (padrão do sistema); genesis-overseer.ps1 pina explicitamente CLAUDE_CONFIG_DIR=~/.claude
7. Isolamento de contas: cada perfil usa seu CLAUDE_CONFIG_DIR para não misturar credenciais.
Iniciar sessão
Qual conta?
Conta A
CLAUDE_CONFIG_DIR = perfil-A
Config, auth e histórico A
Conta B
CLAUDE_CONFIG_DIR = perfil-B
Config, auth e histórico B
CLI isoladasem vazamento
3. Ciclo de mensagem do Telegram: do "oi" do usuário até a resposta de volta no chat.
Mensagem no @Caramaschi_botusuário escreve no chat
Gateway 24/7recebe a mensagem
Roteia modeloqual motor responde?
default
Local 30bqwen3-coder:30b-hermes
escala premium
GPT-5.5OAuth OpenAI (em ativação)
convergem
Processa pedidoexecuta a tarefa
Gera respostamonta o texto final
volta ao gateway
Gateway 24/7entrega de volta
Resposta no Telegramaparece no chat do usuário
4. Pipeline Overseer — 7 agentes leem (read-only), só o orquestrador escreve
Orquestradorúnico que escreve · planeja e distribui
distribui leitura read-only
Agente 1estrutura
Agente 2dependências
Agente 3testes
Agente 4qualidade
Agente 5docs
Agente 6ramo roadmap
Agente 7ramo segurança
convergem para síntese
Orquestrador costuraconsolida os 7 relatórios
Escreve só em ./overseer-output/git status limpo no alvo
5. Governança: o hook PreToolUse inspeciona cada ação e bloqueia com exit 2 quando viola a regra.
Subagente tenta Write/Editação de escrita solicitada
Hook PreToolUsereadonly-guard
GEO_HERMES_READONLY=1 e alvo protegido?inspeciona a ação
Sim
exit 2: bloqueia açãoimpede a escrita
Registra tentativagrava no log
Não
Permite (exit 0)libera a ação
Tool executaWrite/Edit aplicado

3.5 Tarefas Agendadas (Windows Task Scheduler)

Tarefas registradas no Agendador do Windows que mantém o GENESIS operante 24/7, todas em RunLevel Limited (sem elevação), registráveis sem admin.

Analogia: são os "relógios-ponto" do escritório. A cada poucos minutos eles conferem se tudo está de pé, religam o que caiu e mantêm o consultor de plantão aquecido — tudo sem precisar de alguém apertando botões.
Fonte: project_genesis_control_plane_obs_finops + project_hermes_telegram_remote_control + project_genesis_local_llm_ollama — 2026-06-04/06-08
Tarefa (nome no Task Scheduler)Intervalo / GatilhoFunção
HermesTelegramGatewayLogon do usuário; StartWhenAvailable=True; reinicio automático a cada 1 min (RestartCount=99)Sobe o gateway Hermes (hermes gateway --accept-hooks run) via Start-HermesGateway.ps1; mantém o bot @Caramaschi_bot online 24/7 (padrão no modelo local qwen3-coder:30b-hermes; cérebro premium em migração para GPT-5.5)
Genesis-Observability-HeartbeatA cada 5 minutosExecuta genesis-heartbeat.ps1; grava snapshot de saúde em D:\AI\Ollama\observability\heartbeat.jsonl para observabilidade continua
Genesis-Circuit-BreakerA cada 10 minutosExecuta genesis-circuit-breaker.ps1; lê o ledger FinOps e, se o gasto real ultrapassar o budget (finops-budget.json: US$5/dia, US$60/mês), arma o killswitch que bloqueia todas as chamadas cloud pagas
Ollama-Ensure-LocalLogon do usuário + a cada 30 minutosExecuta ollama-ensure.ps1; garante que o servidor Ollama está no ar apontando para D:\AI\Ollama\models (evita o bug do app GUI que forçaria modelos para C:)
Ollama-KeepWarm-TelegramA cada 25 minutosExecuta D:\AI\Ollama\keep-warm.ps1; faz ping no modelo qwen3-coder:30b-hermes para mante-lo residente na RAM e evitar cold-load de 27–108 s na primeira mensagem do bot
9. Auto-melhoria: o skill-curator avalia, consolida e poda skills a cada 7 dias sem nunca apagar.
Ciclo de 7 diasgatilho periódico
skill-curator rodainicia avaliação
Lê ledger de usohistórico de cada skill
Avalia cada skilldecide o destino
Útil e usada
Mantémpermanece ativa
Redundante
Consolidafunde com outra
Obsoleta
Arquivanunca apaga
trilha paralela de promoção
Tarefa complexa (≥ 5 tool-calls)candidata a virar skill
Gera skill-doc candidatodocumenta o padrão
Promove a skill permanenteentra no catálogo
tudo converge
Relatório do cicloresumo de manter/consolidar/arquivar/promover
10. Operação 24/7: tarefas agendadas, keep-warm do modelo e heartbeat mantém o Hermes vivo e saudável.
Tarefas agendadas (5/10 min)Task Scheduler
Keep-warm Ollamaping periódico no modelo
genesis-heartbeatsnapshot de saúde
Modelo quente e prontosem cold-load
Sistema saudável?verifica o heartbeat
Sim
Observabilidade + FinOpsregistra métricas e gasto
Não
ollama-ensure / restartreliga o que caiu
religa e converge
Atende pedidos 24/7realimenta o agendador (loop)
Apêndice técnico — Comandos do operador (PowerShell) (o board pode pular; clique para expandir)

3.6 Comandos de referência

Analogia: é o "molho de chaves" do operador. Cada comando abre uma porta específica — ligar os modelos no disco certo, reiniciar o robô ou conferir qual crachá está ativo. Útil para a equipe técnica; o board pode pular esta parte.
PowerShell
# Iniciar Ollama apontando para D: (jeito correto)
$env:OLLAMA_MODELS = "D:\AI\Ollama\models"
ollama serve

# NUNCA usar (ignora OLLAMA_MODELS, forca C:)
# & "C:\Program Files\Ollama\ollama app.exe"
PowerShell
# Reiniciar gateway Hermes manualmente (apos queda)
Stop-ScheduledTask -TaskName "HermesTelegramGateway"
Get-Process | Where-Object { $_.CommandLine -match "gateway" } | Stop-Process -Force
Remove-Item "$HOME\.hermes\gateway.pid","$HOME\.hermes\gateway.lock","$HOME\.hermes\gateway_state.json" -ErrorAction SilentlyContinue
Start-ScheduledTask -TaskName "HermesTelegramGateway"
PowerShell
# Verificar isolamento de contas Claude Code
$env:CLAUDE_CONFIG_DIR = "$HOME\.claude-hermes"   # conta Max pessoal (Hermes, via OAuth)
# Para o Claude Code interativo/Overseer: usar ~/.claude (padrao, sem variavel)

# Confirmar qual conta esta ativa
claude --version
claude config get model
Na prática

Casos de uso (contextualizados ao Brasil)

Sete maneiras reais de extrair valor do GENESIS — todas viáveis com o que a máquina já tem hoje: estágio local grátis (Ollama) e o cérebro premium na nuvem sob demanda (hoje em transição de Opus 4.8 para GPT-5.5). Pensado para o board, em linguagem de negócio.

Estas ideias adaptam ao Brasil um roteiro público de uso de desktops de IA (no estilo dos walkthroughs de Alex Finn e Greg Eisenberg) ao que o GENESIS realmente executa. A lógica é sempre a mesma: o estágio local faz o volume de graça, e a inteligência cara entra só onde muda o resultado.

1. Caçador de oportunidades 24/7

Local · custo zero

Um cron usando o modelo local (Qwen, grátis) lê comunidades — Reddit, X e grupos — a cada 20 a 60 minutos, encontra dores reais de PMEs e empreendedores brasileiros, cruza com o perfil do dono (Brasil GEO, consultoria) e sugere por que ele resolve aquilo, qual o primeiro passo e, quando faz sentido, monta um protótipo. Como roda no estágio local, o custo é zero — pode trabalhar o dia inteiro sem pesar na conta.

Lê comunidades Reddit, X, grupos · a cada 20–60 min
Filtra dores queixas de PMEs e empreendedores
Cruza com seu perfil Brasil GEO, consultoria, GEO
Sugere o 1º passo por que você resolve + abordagem
Protótipo rascunho de solução, quando vale
Por rodar no modelo local, o cron pode varrer comunidades o dia todo sem gerar custo de API. É um vendedor de prospecção que nunca dorme e nunca manda fatura.

2. Brief matinal por reverse prompting

Telegram · 7h

A técnica é brain dump + reverse prompt: em vez de escrever o pedido perfeito, você despeja seu contexto (CEO, interesses, metas) e pergunta ao agente qual seria o melhor prompt para isto. A super-inteligência escreve um prompt melhor do que você escreveria — e esse prompt vira um cron das 7h que entrega no Telegram um brief diário: notícias de IA e GEO das últimas 24 horas, mercado (Ibovespa, dólar) e novidades de clientes, bem formatado e em português.

Prompt ingênuo
"me dá as notícias de IA de hoje"

Resultado genérico, sem foco no negócio, sem mercado nem clientes, em qualquer formato.

Prompt reverso (escrito pela IA)
"Aja como meu chefe de gabinete. Todo dia às 7h, resuma em português, em blocos: (1) IA e GEO das últimas 24h relevantes para uma consultoria brasileira; (2) mercado — Ibovespa e dólar com a leitura do dia; (3) movimentos de clientes da carteira. Seja direto, priorize o que muda decisão."

Brief acionável, focado no negócio, formatado e pronto para a reunião.

No GENESIS isso vira mais uma tarefa agendada que entrega no @Caramaschi_bot, no mesmo padrão das automações já operacionais.

Notas de organização do trabalho — perfis por modelo, sessões e sub-agentes (detalhe operacional; clique para expandir)

3. Perfis por modelo, não por papel

Menos custo

Em vez de criar cinquenta personas (PM, designer, redator, analista…), organize o trabalho por modelo, conforme a força de cada um. O resultado é contexto enxuto e o modelo certo para cada tarefa — ou seja, menos custo sem perder qualidade onde ela importa. Passe o mouse em cada cartão para ver um exemplo.

Cérebro premium

Estratégia · decisão · copy final

O consultor sênior. Entra nas decisões de arquitetura, na análise estratégica e no texto que vai para cliente ou board.

Premium — só onde muda o resultado
Exemplo: revisar a proposta comercial final de um contrato GEO antes de enviar.

Sonnet / GPT

Volume · código

O time de execução. Refatoração, geração de código e tarefas de volume em que velocidade e custo importam mais que a última gota de qualidade.

Intermediário — paga-se pelo volume
Exemplo: gerar cinco variações de uma página e ajustar o HTML em lote.

Qwen local

Pesquisa · triagem

O estagiário da casa. Triagem, classificação em lote, rascunho e leitura de comunidades — tudo no PC, sem mandar dado para fora.

Grátis — roda o dia todo
Exemplo: ler 200 posts e separar só os que descrevem uma dor de PME.

4. Sessões e contexto = dinheiro

Disciplina FinOps

Não use um único mono-thread para tudo. Separe sessões por cliente ou projeto: assim o contexto fica enxuto e a conta menor, porque você não paga para reenviar conversa irrelevante a cada mensagem. Use o indicador de contexto e abra uma sessão nova (/new) ao trocar de assunto.

Mono-thread (tudo junto)
92%
Sessões separadas
34%

Contexto ocupado em uma conversa típica: quanto mais enxuto, menos tokens repetidos você paga a cada turno. Separar por projeto é o jeito mais simples de cortar custo sem perder histórico.

5. Sub-agentes vs perfis

Paralelo

Dois conceitos que parecem iguais e não são:

Sub-agentes

Mesmo tipo · em paralelo

São cópias do mesmo agente trabalhando ao mesmo tempo no mesmo tipo de tarefa. Servem para ganhar velocidade por paralelismo.

Exemplo: construir cinco funcionalidades de uma landing page de GEO simultaneamente.

Perfis

Skills diferentes · em cadeia

São especialistas diferentes, cada um com sua habilidade, que se passam o trabalho.

Exemplo: pesquisa local (Qwen) → texto final (cérebro premium) → arte. Cada etapa, o perfil certo.

6. Segundo cérebro

Artifacts

Jogue links, PDFs e materiais de clientes e concorrentes no agente e tenha tudo organizado e buscável (artifacts). Um perfil "bibliotecário" cuida de catalogar e recuperar o que você precisa, na hora da reunião ou da proposta.

Proposta comercial de cliente Artigo de concorrente sobre GEO PDF de contrato (Dialetto, Stone) Benchmark de visibilidade em IA Deck de board anterior Tudo buscável por tema

7. Controle pelo bolso

Operacional

Dispare e acompanhe tudo pelo Telegram (@Caramaschi_bot), já operacional 24/7. O mesmo gateway, hoje com padrão no modelo local (qwen3-coder:30b-hermes) e escalonamento ao cérebro premium quando necessário, já está em produção, disponível agora.

24/7
Gateway sempre no ar
0
Portas abertas (long polling)
99
Reinícios automáticos

A tese, em uma frase

A melhor forma de ganhar dinheiro é achar a dor dos outros e resolver — e agora você tem um funcionário de IA fazendo essa busca o tempo todo, de graça, no estágio local.

Por isso o custo do GENESIS funciona como investimento com retorno, e não como uma assinatura tipo streaming que você consome e some: o estágio local roda grátis o dia inteiro, e o o cérebro premium na nuvem entra sob demanda só quando uma decisão vale mais do que custa. Potência onde importa, custo baixo onde não importa.

Demonstração passo a passo — “Veja uma tarefa sendo executada” (clique para expandir)

Veja uma tarefa sendo executada

Toda requisição entra pela triagem local. O que é trivial morre ali, de graça. O que decide o futuro do negócio escala para o cérebro premium na nuvem. Aperte rodar simulação e acompanhe o token percorrer o caminho, os estados acenderem e o custo subir em tempo real. (Fluxo ilustrativo; o tier premium aparece como Opus 4.8, em migração para GPT-5.5; valores demonstrativos.)

● Resolvido local · custo zero

Pergunta simples

"Qual o comando para listar branches?" — a triagem classifica como trivial e o LLM local responde sem tocar em nenhuma API paga.

Vocêpergunta TriagemLLM local · :11434 trivial? Respostagrátis · <1s
custo estimadoUS$ 0,0000
Pronto para rodar.
▲ Escalou para o cérebro premium

Decisão estratégica

"Vale entrar nesse mercado e como posicionar a marca?" — a triagem detecta alto risco, recusa resolver local e escala para o modelo de arquitetura.

Vocêdecisão Triagemavalia risco complexa? Premiumraciocínio Plano estratégicocopy final · decisão
custo estimadoUS$ 0,0000
Pronto para rodar.
Overseer · leitura paralela

Overseer lendo um repositório

O orquestrador divide o repo entre vários subagentes read-only que rodam ao mesmo tempo. Cada um varre uma fatia, todos convergem e só o orquestrador escreve o relatório.

Repositóriogit · read-only Overseerorquestradorúnico que escreve agente · /srcvarrendo… agente · /testsvarrendo… agente · /docsvarrendo… agente · /infravarrendo… merge overseer-output/report
4 agentes · progresso de leitura0 / 4 prontos
Pronto para rodar.
Geo-Hermes · Satélite-Roteador

Roteador inteligente ao vivo

Escolha o tipo de tarefa. A triagem local (Ollama :11434) é o estágio zero — só escala para modelo pago quando vale a pena.

Você Triagem local · Ollama Resolve local (Qwen3 8B) custo zero · offline Escala → Sonnet 4.6 volume · refactor Escala → cérebro premium decisão · arquitetura Escala → Perplexity / Grok fontes ao vivo
Modelo escolhido Qwen3 8B (local)
Custo estimado US$ 0,0000
Latência ~ 0,4 s

Triagem manteve a pergunta trivial no LLM local — nenhuma chamada paga.

Aprofundamento técnico — Modo conselho (council) (clique para expandir)
Geo-Hermes · Modo Council

Modo conselho (council)

Vários modelos respondem em paralelo. Os votos se acumulam e o orquestrador sintetiza a resposta final.

Pergunta Cérebro premium raciocínio profundo Sonnet 4.6 equilíbrio Qwen3 local estágio zero Grok fontes ao vivo Síntese orquestrador
  • Opus 4.80
  • Sonnet 4.60
  • Qwen3 local0
  • Grok0

Aguardando rodada do conselho…

Geo-Hermes · Overseer read-only

Overseer: 7 agentes lendo um repo

Pipeline paralelo. Invariante: subagentes só leem; o orquestrador escreve apenas em ./overseer-output/. O alvo nunca é mutado.

Repo-alvo READ-ONLY 1 · Estrutura & deps 2 · Segurança 3 · Testes & cobertura 4 · Performance 5 · Documentação 6 · Dívida técnica 7 · Licenças Orquestrador ./overseer-output/
Agentes concluídos
0 / 7
$ git status --porcelain  (rode a simulação)
Aula de roteamento

Tarefa simples ou complexa? Qual modelo chamar

Antes de digitar o prompt, faça uma pergunta de uma linha: qual é o menor modelo que ainda entrega o resultado certo? Trate o modelo como ferramenta dimensionada para o trabalho, e dimensione sempre pela tarefa que está na frente. Nesta seção você aprende a classificar a tarefa de 1 a 5, mandar o trivial para o LLM local ou Haiku, reservar o cérebro premium na nuvem para decisão e raciocínio profundo, e quebrar uma tarefa grande em subtarefas roteadas como os sete agentes do Overseer. No padrão satélite-roteador, o LLM local (Ollama na porta 11434) é sempre o estágio zero: triagem, classificação em lote e rascunho antes de qualquer chamada paga.

Bloco A

O classificador de complexidade 1 a 5 e o destino

Toda tarefa entra por um único funil. Você atribui uma nota de complexidade e, antes disso, checa dois desvios de rota: se a tarefa exige pesquisa na web com fontes, vai para a Perplexity; se exige tempo real / agora (notícia, tendência, redes), vai para o Grok. Sem desvio, a nota manda: 1 a 2 fica no local, 3 vai para a faixa de volume (Sonnet / GPT / Gemini), 4 a 5 sobe para o cérebro premium na nuvem.

Clique nos chips para simular cada tipo de entrada
Tarefa chega
Precisa de pesquisa na web com fontes?
Sim
Perplexitypesquisa + citações
Não
Precisa de informação em tempo real / agora?
Sim
Groktempo real / redes
Não
Classifique a complexidade de 1 a 5
1 a 2 · trivial
Nível 1 a 2LLM local Ollama
3 · volume
Nível 3Sonnet / GPT / Gemini
4 a 5 · difícil
Nível 4 a 5Opus 4.8
Destino sugerido aguardando entrada Custo relativo
1
Trivial

Padrão mecânico, resposta curta, zero ambiguidade.

2
Simples

Rotina previsível, uma transformação bem definida.

3
Média

Vários passos, algum julgamento, volume alto.

4
Difícil

Raciocínio encadeado, trade-offs, risco real de erro.

5
Crítica

Decisão, arquitetura, copy final, irreversível.

Bloco B

Rotina simples vai para o LOCAL ou Haiku — nunca para o Opus

Estas tarefas têm volume e baixa ambiguidade. Rodar Opus aqui é queimar orçamento sem ganho de qualidade: o resultado seria idêntico. Resolva no LLM local (Ollama) quando puder ficar offline e em lote; use Haiku quando precisar de qualidade de nuvem barata e rápida. O ganho de mandar 1000 linhas para classificar no local em vez do Opus é enorme, e a saída é a mesma.

Ler e extrair PDF
Resumir documento longo
Classificar 1000 linhas
Traduzir texto
Autocompletar código
Etiquetar / extrair campos
Volume alto + baixa ambiguidadea qualidade não muda com modelo maior
offline / lote
LLM localOllama :11434 · custo zero
nuvem barata
Haikurápido e barato
proibido
Opus 4.8superdimensionado aqui
Bloco C

Tarefa complexa vai para o Opus 4.8

Aqui o erro é caro e a qualidade do raciocínio muda o resultado de verdade. São decisões estratégicas, arquitetura de sistema, copy final que vai para o board ou para o cliente, e raciocínio profundo com vários trade-offs. Nesses casos, economizar no modelo custa mais caro do que o próprio modelo: um retrabalho ou uma decisão errada paga muitos meses de Opus.

Arquitetar um sistema
Decisão estratégica
Copy finalboard / cliente
Raciocínio profundo
Resolver ambiguidade alta
Revisão crítica de plano
Erro é caro + qualidade muda tudoeconomizar no modelo sai mais caro
Opus 4.8a ferramenta certa
Bloco D

Decompor uma tarefa complexa e rotear cada subtarefa

O segredo do custo baixo com qualidade alta: não mande a tarefa inteira para o Opus. Quebre-a em subtarefas e roteie cada uma para o modelo certo, como fazem os sete agentes do Overseer. O orquestrador (Opus) só decide e costura; o trabalho de volume desce para o local e para a faixa média; a pesquisa e o tempo real saem para Perplexity e Grok. O Opus aparece duas vezes: no plano e na síntese final, que é onde o julgamento importa.

Tarefa complexarelatório estratégico (nível 5)
Agente 1 · OrquestradorOpus 4.8 · planeja e decompõe
roteia cada subtarefa ao modelo certo
Agente 2 · Coletorlocal · lê e extrai PDFs
Agente 3 · PesquisadorPerplexity · fontes citadas
Agente 4 · RadarGrok · sinais em tempo real
Agente 5 · ClassificadorHaiku · triagem em lote
Agente 6 · RedatorSonnet · seções de volume
convergem
Agente 7 · SintetizadorOpus 4.8 · decide e costura
Entrega finalcom julgamento · só 2 das 7 etapas usam Opus

Repare na economia: das sete etapas, cinco rodam em modelos baratos ou gratuitos e só duas usam Opus. A tarefa continua sendo de nível 5, mas o custo total cai porque cada subtarefa foi reclassificada no seu próprio nível.

Parte 3

O que já entrega?

Resultados

Métricas e desempenho

Comparativos de velocidade, custo e distribuição de tarefas entre os modelos locais e na nuvem, além do catálogo de modelos locais por janela de contexto.

Velocidade e custo relativo por modelo de inferência (Local 30B vs Sonnet 4.6 vs Opus 4.8)
Distribuição de tarefas por destino de roteamento (percentual estimado por camada)
Janela de contexto (num_ctx) por modelo local instalado no Ollama
Parte 4

Quanto custa e quanto economiza?

FinOps: o que cada tarefa custa

Comparativo entre a arquitetura ingênua (tudo no Opus, sem roteamento) e a arquitetura roteada (triagem local gratuita + Sonnet no volume + Opus só no julgamento final). Fonte de preços: Anthropic Pricing, consultado em 08/06/2026.

Tabela de preços por modelo (USD por 1 M de tokens)

Modelo Entrada (USD/1M) Saída (USD/1M) Perfil de uso
Claude Opus 4.8 $5,00 $25,00 Decisão, arquitetura, copy final
Claude Sonnet 4.6 $3,00 $15,00 Volume, refactor, análise
Claude Haiku 4.5 $1,00 $5,00 Triagem, classificação simples
OpenAI GPT-5.5 $5,00 $30,00 Cérebro premium do Hermes (via OAuth), raciocínio alternativo
DeepSeek V4 $0,14 $0,28 Volume barato, orquestração e chamadas de ferramenta; reserva gratuita na NVIDIA NIM
LLM Local (Ollama) $0,00 $0,00 Triagem offline, rascunho, filtro

* Preços conforme Anthropic API Pricing e tabelas públicas dos provedores, consultados em 08/06/2026. Verificar atualizações em platform.claude.ai.

O que está roteado hoje: a família Claude (Opus/Sonnet/Haiku) + o modelo local. GPT-5.5 (cérebro premium, em ativação) e DeepSeek V4 (reserva) entram com a migração — por isso as 3 simulações abaixo modelam apenas a família Claude, que é o que roteia hoje.

3 Simulações de custo por tarefa

Simulação 1

Brief matinal diário

Resumo de 5 fontes + 1 parágrafo executivo — rodado 365×/ano.

ECONOMIA 44%

Ingênuo (tudo Opus)

  • 5 fontes × 800 tok entrada → 4.000 tok
  • Contexto acumulado: +3.000 tok
  • Saída: 600 tok
  • Total/dia: 7.600 tok entrada + 600 tok saída

Custo/dia: $0,053

Custo/ano: $19,40

Roteado (Local + Sonnet + Opus)

  • Triagem/extração: LLM local — $0
  • Síntese das 5 fontes: Sonnet 4.6 — 4.000 tok entrada + 500 tok saída
  • Parágrafo final: Opus 4.8 — 500 tok entrada + 300 tok saída
  • Total pago: 4.500 tok entrada + 800 tok saída

Custo/dia: $0,030

Custo/ano: $10,77

Custo relativo (ano) Opus ingênuo vs roteado
Ingênuo: $19,40/ano Roteado: $10,77/ano
Simulação 2

Compreender 1 repositório médio

Análise de 50 arquivos (~120K tokens de código) com resumo executivo e mapa de dependências.

ECONOMIA 71%

Ingênuo (tudo Opus, mono-thread)

  • 120K tok código em um único contexto inchado
  • Contexto médio com histórico: +20K tok
  • Saída (resumo + mapa): 4.000 tok
  • Total: 140K tok entrada + 4K tok saída

Custo: $0,80

Roteado (Local → Haiku → Sonnet → Opus)

  • Mapeamento de arquivos: LLM local — $0
  • Leitura/indexação em lote: Haiku 4.5 × 50 arq. — 60K tok
  • Síntese de módulos: Sonnet 4.6 — 30K tok entrada + 2K saída
  • Resumo executivo final: Opus 4.8 — 5K tok entrada + 1K saída

Custo: $0,23

Custo relativo (por execução) Opus ingênuo vs roteado
Ingênuo: $0,80 Roteado: $0,23
Simulação 3

Lote de 50 classificações

Classificar 50 itens de conteúdo (leads, tickets ou artigos) com categoria + confiança. Rodado 20×/mês.

ECONOMIA 76%

Ingênuo (Opus por item, contexto acumulado)

  • 50 itens × 400 tok + 2K contexto = 30K tok entrada
  • 50 respostas × 80 tok = 4K tok saída
  • Total/lote: 30K entrada + 4K saída no Opus
  • 20 lotes/mês: 600K entrada + 80K saída

Custo/mês: $5,00

Roteado (Local filtra → Haiku classifica → Opus revisa outliers)

  • Pré-filtragem/deduplicação: LLM local — $0
  • Classificação em lote: Haiku 4.5 × 50 itens — 20K entrada + 4K saída por lote
  • Revisão de outliers (~10%): Opus 4.8 × 5 itens — 2K entrada + 400 saída por lote
  • 20 lotes/mês: Haiku 400K entrada + 80K saída; Opus 40K entrada + 8K saída

Custo/mês: $1,20

Pior caso — se os outliers ao premium saltam de ~10% para 40%: ~$2,40/mês (Haiku $0,80 + premium $1,60), economia cai para ~52%, ainda positiva.

Custo relativo (mês) Opus ingênuo vs roteado
Ingênuo: $5,00/mês Roteado: $1,20/mês

Lições FinOps para o board

  • Opus é caro — use só no julgamento final. Reservar Opus para decisões e copy final reduz tipicamente 44-76% do custo sem perda de qualidade percebida (ver as 3 simulações acima).
  • Contexto inchado é o maior vilão. Cada token de histórico carregado no Opus custa 5-25x mais do que o mesmo token no Haiku ou local. Comprimir/sumarizar antes de escalar é obrigatório.
  • LLM local entrega custo zero e latência zero para triagem. Ollama com Qwen3 8B ou Gemma resolve 40-60% das tarefas antes de qualquer chamada paga.
  • Lotes com Haiku custam menos que 1/3 do Sonnet e menos de 1/5 do Opus para classificação. O impacto de qualidade é mensurável só em casos ambíguos — que devem ir ao Opus por design.
  • A arquitetura roteada exige disciplina, mais do que complexidade. Um router de 3 linhas (local → Sonnet → Opus) entrega 44-76% de economia sem mudar a interface do produto.
  • O teto de sessão autônoma (GEO_HERMES_BUDGET_USD) pertence ao domínio de finops, e não ao de engenharia. O circuit-breaker do GENESIS já implementa isso — revise o teto por tipo de tarefa, e não globalmente.

Tradeoffs: o que se ganha e do que se abre mão

Visão executiva — decisões de arquitetura Geo-Hermes para C-level

Matriz de decisão consolidada

Uma linha por eixo de decisão: o padrão recomendado, o gatilho que muda a escolha, o custo relativo, o risco principal com a mitigação e o que já está ativo hoje. As tabelas detalhadas adiante são o aprofundamento de cada linha.

Eixo Padrão recomendado Gatilho de desvio Custo relativo Risco principal → mitigação Status
InfraestruturaHíbrido (local absorve volume)Dado não-sensível 24/7 ou pico de carga → nuvemLocal US$0 / nuvem US$ por requisiçãoHardware ou energia cai → fallback na nuvemLocal ATIVO · nuvem PARCIAL
Escolha de modeloLocal → Sonnet → premium, por camadaComplexidade ≥ 4 ou erro caro → modelo premiumUS$0 → US$3/US$15 → US$5/US$25 (por 1 M tok)Modelo barato em tarefa crítica → regra “ambíguo vai ao premium”ATIVO
Autonomia × controleHíbrido supervisionado (Telegram)Decisão de alto impacto → Cockpit humano aprovaBaixo (autônomo) vs. tempo do CEOLoop de gasto → killswitch (US$5/dia · US$60/mês)ATIVO
Custo × qualidade × velocidadeEquilíbrio (Sonnet + cache)Entregável a cliente → máxima qualidadeMédioAcima de US$200/mês → revisar o perfil de usoATIVO
Contas (compliance)PJ Nuvini para tudo faturávelUso pessoal/protótipo → PF MaxPF custo fixo / PJ por usoContaminação PF ↔ PJ → nunca misturar credenciaisATIVO
Cérebro & cloud roteadoLocal-first hoje (qwen3-coder:30b-hermes)Conformidade + permissão → ativar premiumUS$0 hoje / variável depoisOpus saiu do bot por ToS; chaves placeholder → fallback localLocal ATIVO · GPT-5.5 EM ATIVAÇÃO · 6 APIs PLACEHOLDER

1. Infraestrutura: Local vs Nuvem

Opção Ganho Custo / Risco Quando escolher
Local — Ollama + GENESIS Custo marginal zero por inferência; dados não saem da máquina; latência mínima; opera offline Qualidade de modelo inferior; hardware indisponível = zero serviço; manutenção manual Triagem em lote, rascunho, classificação, trabalho offline, dados hipersensíveis
Nuvem — Routines / Fly.io Alta disponibilidade 24/7; sem dependência de PC físico; escala horizontal Custo por requisição; dados em infraestrutura de terceiro; latência de cold-start Webhooks, crons independentes de hardware, jobs de longa duração sem supervisão humana
Híbrido (padrão Geo-Hermes) Melhor custo-benefício; local absorve volume, nuvem absorve picos e disponibilidade Complexidade operacional maior; dois ambientes para monitorar Arquitetura padrão do Geo-Hermes — preferir sempre que possível

2. Escolha de Modelo: Opus vs Sonnet vs Haiku vs Local

Modelo Ganho Custo / Risco Quando escolher
Opus Máxima qualidade de raciocínio; melhor para arquitetura, copy final, decisões complexas e revisão jurídica Custo por token mais elevado; latência maior; acima de US$200/mês programático exige revisão Decisões de arquitetura, copy final aprovado, análise estratégica, contratos
Sonnet Equilíbrio ótimo qualidade/custo; volume de refactor, código, pesquisa intermediária Perde para Opus em raciocínio profundo; deprecation Sonnet 4→4.6 até 15/06 — migrar agora Volume de código, refactor, agentes autônomos de médio porte, relatórios em lote
Haiku Custo mínimo; latência baixa; adequado para tarefas triviais e classificação rápida Qualidade reduzida; não usar para decisões ou código crítico Triagem, roteamento de intenção, resumos simples, notificações
Local (Ollama) Custo zero por chamada; privacidade total; funciona offline; estágio zero do roteador Qualidade inferior aos modelos cloud; contexto limitado (rejeita <64K); dependência de hardware Rascunho, classificação em lote, trabalho offline, dados hipersensíveis, antes de qualquer chamada paga

3. Autonomia (Hermes 24/7) vs Controle (Cockpit humano)

Opção Ganho Custo / Risco Quando escolher
Hermes autônomo (24/7) Execução sem interrupção; volume de trabalho enquanto CEO dorme; auto-melhoria com skill-curator Erros se propagam sem supervisão; custo acumula sem guardrail; sandbox obrigatório para conter escopo Crons, webhooks, refactor em lote, pesquisa, tarefas bem definidas com critério de parada claro
Cockpit humano (interativo) Controle total; decisões de alto impacto com contexto humano; acesso a Chrome e ferramentas premium Limitado ao tempo disponível do CEO; não escala para volume Arquitetura, contratos, copy final, decisões estratégicas, debugging crítico
Híbrido supervisionado (Telegram) Autonomia com supervisão assíncrona; CEO aprova escalações sem estar na máquina Depende de conectividade do bot; bot down = sem supervisão remota Operação padrão Geo-Hermes — Hermes executa, CEO aprova via bot quando necessário

4. Triângulo de Ferro: Custo vs Qualidade vs Velocidade

Perfil Ganho Custo / Risco Quando escolher
Máxima qualidade (Opus + cloud) Output premium, decisões confiáveis, menos revisão humana Custo mais alto; latência maior; pode exceder teto de budget Entregáveis para cliente, contratos, arquitetura crítica
Máxima velocidade (Haiku + local) Resposta em milissegundos; custo quase zero; volume ilimitado Qualidade reduzida; exige revisão ou pipeline de validação Triagem, classificação, notificações, rascunhos descartáveis
Mínimo custo (local puro) Zero variável; privacidade máxima; sem dependência de API externa Qualidade e velocidade limitadas pelo hardware; manutenção do stack local Dados sensíveis, offline, lotes noturnos de baixa criticidade
Equilíbrio (Sonnet + caching) Custo-benefício ótimo para o dia a dia; qualidade suficiente para 80% dos casos Não é o melhor em nenhum eixo isolado Operação padrão — refactor, código, pesquisa, agentes de médio porte

5. Contas Isoladas: Nuvini Team vs Pessoal Max

Conta Ganho Custo / Risco Quando usar
Nuvini Team (PJ) Fatura separada por CNPJ; multi-usuário; auditável; adequada para cliente Custo explícito por uso; requer gestão de membros e permissões Entregáveis de cliente, trabalho billable, qualquer atividade da BRGEO LTDA
Pessoal Max (PF) Acesso a modelos premium (Opus, Claude Max) sem API key; custo fixo mensal Não auditável por cliente; misturar com PJ gera risco de compliance Prototipagem pessoal, pesquisa exploratória, uso do CEO fora do contexto de cliente

6. Cloud Roteado: Chaves Placeholder e Roadmap

Estágio Ganho Custo / Risco Ação necessária
Roteador local ativo Zero custo variável; privacidade; funciona hoje Sem fallback cloud; qualidade limitada ao hardware disponível Nenhuma — operacional. Manter Ollama serve direto (nunca app.exe)
Chaves placeholder (.env) Arquitetura pronta; ativação pontual por API Falha silenciosa se roteador escalonar sem chave válida Implementar fallback local ao detectar erro de autenticação antes de ativar
Cloud ativo (roadmap) Qualidade máxima on-demand; escalonamento automático; sem limite de hardware Custo variável; requer FinOps guard ativo; lock-in de provedor Ativar finops-guard primeiro; preencher chaves uma a uma com teste de custo; migrar Sonnet 4→4.6 até 15/06
API direta (acima de US$200/mês) Billing granular; sem dependência de OAuth; SLA contratual Gestão de chaves e segredos; custo explícito por token Avaliar quando invoice mensal ultrapassar teto; usar report-filtro-All, nunca cap/forecast
Princípio executor: cada tradeoff acima tem uma decisão padrão no Geo-Hermes. Desviar exige justificativa explícita, fundamentada e além de mera preferência. O CEO decide no cockpit; o Hermes executa no sandbox; o dinheiro é medido em invoice real, nunca em cap ou forecast.
Parte 5

É seguro? Como evolui?

Como o sistema fica mais competente com o tempo

A cada semana o agente resolve mais sozinho — e custa menos. Veja como isso acontece na prática.

Curva de competência ao longo das semanas (ilustrativa — projeção, não telemetria)
100% 75% 50% 25% Sem 1 Sem 2 Sem 3 Sem 4 Sem 5 Sem 6 Sem 7 Sem 8 Início 1ª curadoria Skills ativas Consolidação Platô de autonomia
As três camadas de aprendizado

Memória diária

Cada sessão registra o que foi feito, quais ferramentas foram usadas e o que funcionou. Ponto de partida do aprendizado.

Skills semanais

O skill-curator roda a cada 7 dias: avalia skills existentes, consolida as úteis e arquiva as obsoletas. Toda tarefa com 5 ou mais passos vira rascunho de skill automática.

Consolidação mensal

Skills semelhantes são fundidas, padrões repetidos viram regras gerais. O agente sobe um degrau de autonomia a cada mês.

Como uma tarefa vira conhecimento permanente
Agora — durante a tarefa
Agente executa com 5 ou mais ferramentas
Ex.: pesquisa, abre arquivo, lê código, edita, roda teste. Cada passo é registrado.
Ao terminar — segundos depois
Rascunho de skill gerado em segundo plano
O sistema extrai o padrão da tarefa e salva como candidato a skill — sem interromper o usuário.
Dia seguinte — memória diária
Contexto da sessão consolidado
O que foi aprendido ontem já está disponível hoje, sem precisar re-explicar o histórico.
Semana 2 — curadoria automática
Skill-curator avalia, consolida e poda
Skills usadas frequentemente sobem de prioridade. Skills que nunca foram acionadas são arquivadas (nunca apagadas). A biblioteca fica menor e mais precisa.
Semana 3 em diante — resultado visível
Agente resolve tarefas repetidas sem ajuda
O que antes exigia 10 perguntas ao usuário agora é executado direto, com menos tokens e menos custo por tarefa.

O que isso significa na prática

  • Tarefas que repetiam os mesmos passos toda semana passam a ser resolvidas em segundos
  • Menos prompts necessários — o agente já sabe o contexto e o padrão
  • Custo por tarefa cai porque menos tokens de instrução são enviados à API
  • Skills rodam localmente (Ollama) antes de acionar modelos pagos na nuvem
  • A biblioteca de skills só cresce — nunca é apagada, apenas arquivada
Linha do tempo

Roadmap do que foi construído

Os marcos já entregues do GENESIS, em ordem de construção. Quase tudo está concluído; o único item em andamento depende de inserir chaves reais de API.

Bootstrap do papel Hermes Concluído

Aplicação do framework Geo-Hermes na máquina: definição de papéis (cockpit pilota, Hermes executa), sandbox fail-safe e modelo Opus 4.8 fixado como prioritário.

LLM local + Ollama afinado Concluído

Instalação dos modelos locais no disco D:, ajuste de janelas de contexto e keep-warm, mais o orquestrador que roteia por tipo de tarefa. Estágio zero gratuito operando.

Hermes + gateway Telegram 24/7 Concluído

Controle remoto pelo bot @Caramaschi_bot, sempre online. Por padrão roda no modelo local; o Claude saiu do bot por conformidade (ToS) e o cérebro premium passa a ser o GPT-5.5 via OAuth.

Statusline + medidor FinOps Concluído

Painel de gasto em tempo real e teto de orçamento por sessão, para que nenhuma execução autônoma saia do controle de custo sem aviso.

Governança e hooks Concluído

Guardas automáticos (readonly-guard, finops-guard) que inspecionam cada ação antes de executá-la e bloqueiam o que viola as regras.

Overseer validado Concluído

Auditoria read-only de repositórios funcionando com a invariante "nunca muta o alvo": o repositório analisado termina com git status limpo.

Isolamento de contas Claude Concluído

Isolamento definitivo das duas contas Claude por CLAUDE_CONFIG_DIR. O Opus via OAuth foi validado até 08/06; depois saiu do bot por conformidade (ToS) e o cérebro premium passou a migrar para GPT-5.5.

Orquestrador multi-LLM cloud Em andamento

Roteamento para seis providers cloud já implementado, mas as chaves no .env ainda são placeholders. Falta inserir chaves reais via setkeys para ativar o escalonamento pago.

Próximos passos — comunidade e pesquisa (junho de 2026)

Revisão de arquitetura a partir de feedback da comunidade e de pesquisa em fontes públicas, com o olhar de arquitetura de sistemas de IA. A prioridade número um aqui é de conformidade, e não de desempenho: há um risco de conta a corrigir antes de tudo.

Urgente — retirar o Claude de dentro do Hermes (risco de banimento de conta)

A Anthropic proíbe o uso do login OAuth de assinatura (planos Free, Pro ou Max) em qualquer aplicativo de terceiros, inclusive via Agent SDK. O bloqueio começou em 9 de janeiro de 2026 e a empresa pode suspender a conta sem aviso prévio. O Hermes hoje resolve o token por esse caminho — exatamente o que a política veda. A saída correta é usar chave de API (Anthropic Console) para qualquer uso do Claude no Hermes, ou simplesmente deixar de usar o Claude no bot. O Claude continua liberado apenas dentro do Claude Code, que é uso first-party.

Cérebro do bot: GPT-5.5 via OAuth
OpenAI permite, sem custo de API

Diferente da Anthropic, a OpenAI passou a permitir (março de 2026) que agentes compatíveis usem a assinatura via OAuth. Como a conta aqui é o plano Max, o GPT-5.5 responde com folga e sem consumir crédito de API. Vira o modelo principal de raciocínio do Hermes.

Fallback gratuito e dentro das regras
DeepSeek V4 na NVIDIA NIM, Grok 4.3

O DeepSeek V4 está gratuito na NVIDIA NIM (até 40 chamadas por minuto, 1 milhão de tokens de contexto, forte em orquestração e chamadas de ferramenta), com API compatível com a da OpenAI. Serve como gigante de reserva sem custo e sem violar termos. O Grok 4.3 entra como alternativa, com dados do X em tempo real.

Rebaixar o Qwen Coder; subir duas verticais locais
Gemma 3 (multimodal) e um 9B de raciocínio

A comunidade aponta o Qwen Coder local como fraco. O plano é separar o local em duas frentes. A primeira é multimodal (imagem, vídeo, texto), com o Gemma 3. A segunda é raciocínio local com um modelo de cerca de 9B (por exemplo o Qwen3.5-9B), que cabe nos 8 GB de VRAM e lidera o índice de inteligência abaixo de 10B. O local segue como o estágio zero gratuito de triagem, e não como o cérebro.

Teto de VRAM: 8 GB limita
subir para 16 GB ou mais

A RTX 4060 de 8 GB é o gargalo: modelos de 12B a 14B fazem descarga parcial para a RAM e ficam lentos. Para rodar localmente um substituto real do Sonnet (faixa de 24 a 27B) com fluidez, o caminho é uma placa de 16 GB ou mais. Enquanto isso, o raciocínio pesado permanece na nuvem.

Enxugar o roteador
menos camadas, decisão mais direta

O feedback foi de que o roteador atual adiciona camadas que limitam o uso no dia a dia. A meta é simplificar para uma decisão direta entre local (triagem e multimodal), GPT-5.5 (raciocínio) e DeepSeek (reserva), com menos indireção.

Opus 4.8 só para código
e dentro do Claude Code

O Opus 4.8 deixa de ser o cérebro genérico e passa a ser reservado para tarefas de código, executadas dentro do Claude Code (uso first-party, sem o risco de termos descrito acima).

Fontes consultadas (junho de 2026): política de autenticação e uso de credenciais da Anthropic (The Register); documentação da OpenAI sobre OAuth de assinatura em agentes; benchmarks de LLM local para 8 GB de VRAM (LocalLLM.in); catálogo NVIDIA NIM, DeepSeek V4 gratuito (build.nvidia.com).

Os próximos passos, em fluxograma

Cada próximo passo da revisão de arquitetura, desenhado como um fluxo de decisão de ponta a ponta — da autenticação por API ao isolamento na nuvem, ao confinamento em container, à lógica determinística com o LLM só decidindo, à separação do bot da orquestração e ao local-first com Ollama e vLLM.

Aprofundamento técnico — Próximos passos, em fluxograma (6 fluxos) (clique para expandir)
1. Migrar autenticação: do OAuth Claude para API key / GPT-5.5 via OAuth OpenAI — trocar a sessão OAuth Max por chaves de API versionadas, com fallback local e roteamento por custo.
Estado atualHermes usa OAuth Claude Max (sessão do navegador)
Sessão OAuth confiável para 24/7?
Não: expira, exige re-login, frágil headless
Decisão: migrar para credenciais de serviço
Sim, mas dependente de UI
Decisão: migrar para credenciais de serviço
Provisionar API key Anthropicem cofre (.env / secret manager)
Provisionar OAuth OpenAI + API key GPT-5.5
Camada de abstração de providerLLM client único
Roteador por tarefa e custo
Triagem / lote / offline
Ollama local :11434estágio zero
Decisão / arquitetura / copy
Anthropic APIOpus/Sonnet via key
Tarefa OpenAI-first
GPT-5.5 via OAuth OpenAI
caminho local
Confiança suficiente?
Não: escalar com permissão
Anthropic APIOpus/Sonnet via key
Sim
Resposta local sem custo
convergência
Telemetriatokens, custo, latência
Budget da sessão ok?GEO_HERMES_BUDGET_USD
Estourou
finops-guard / circuit-breakerarma killswitch
Dentro do teto
Hermes autenticado por APIsem login interativo
2. Isolar a app na nuvem (AWS/GCP) com Terraform via Claude Code — sair do notebook como servidor e descrever toda a infra como código, aplicada e versionada pelo agente.
Hoje: Hermes roda no notebook GENESISanti-padrão de topologia
Claude Code gera módulos TerraformIaC
Escolher nuvem
AWS
VPC + subnets privadas + ECS/EC2 + Secrets Manager
GCP
VPC + Cloud Run/GCE + Secret Manager
terraform planrevisão humana do diff
Plan aprovado?
Não: ajustar HCL
Claude Code gera módulos Terraformvolta ao IaC
Sim
terraform applystate remoto em bucket+lock
Rede isoladasó egress controlado, sem porta de servidor no notebook
Secrets injetados via secret managernunca no repo
Observabilidadelogs/métricas centralizados na nuvem
Drift detectado?
Sim
terraform plan recorrente reconcilia
Não
App isolada na nuveminfra reproduzível por código
3. Containerizar com Docker: agente vê apenas gateway e Ollama, 24/7 — confinar o agente numa rede interna onde a única superfície são o gateway e o LLM local.
Objetivo: agente autônomo sempre dentro de sandbox
docker-compose com 3 serviços isolados
gateway
Serviço: gatewayFastAPI / Telegram bridge
ollama
Serviço: ollamaLLM local :11434, modelos em volume
agente
Serviço: agente Hermesloop autônomo
convergem na rede
Rede interna do compose
Agente só alcança: gateway + ollamasem internet aberta
Agente precisa de LLM cloud?
Sim
Pede ao gatewayque aplica política/budget
Não
Resolve com Ollama no container
convergência
restart: unless-stopped + healthcheck
Container saudável?
Não
Docker reinicia o serviçovolta ao healthcheck
Sim
Hermes 24/7blast radius mínimo: só gateway e Ollama
4. Lógica determinística em Python, LLM só decide (CrewAI / LangGraph) — o código executa ações e regras; o modelo escolhe o próximo passo, nunca manipula efeitos colaterais sozinho.
Entrada: tarefa / evento recebido
Código Python valida e normalizadeterminístico
Decisão precisa de julgamento?
Não: regra clara
Executor Python aplica a regra direto
Sim
LangGraph / CrewAI: LLM escolhe a próxima açãosó decisão
Ação escolhida é permitida pela política?
Não
Guardrail rejeita / pede confirmaçãovolta para a decisão do LLM
Sim
Tool Python executa o efeito colateral
Resultado determinístico e auditável
Objetivo atingido?
Não: novo estado
Volta ao passo de decisão
Sim
LLM = cérebro de decisão; Python = mãos e regras
5. Separar o BOT (FastAPI) da orquestração — o bot vira fachada fina de I/O; o cérebro vive num serviço de orquestração desacoplado por fila.
Hoje: bot e orquestração no mesmo processoacoplados
Refatorar em dois serviços
Fachada de I/O
BOT FastAPIrecebe webhook Telegram / WhatsApp, responde rápido
Cérebro
Orquestradoragentes, LLM, ferramentas, estado
BOT publica evento em fila / endpoint interno
Orquestrador disponível?
Não
Fila retém a mensagemsem perder evento; aguarda voltar
Sim
Orquestrador processa e decide
Resultado volta pelo BOT ao usuário
Precisa escalar uma parte?
BOT (picos de I/O)
Escala FastAPI sem mexer no cérebro
Orquestrador (carga de LLM)
Escala workers sem derrubar o bot
BOT e orquestração desacoplados, cada um escala sozinho
6. Servir local com Ollama / vLLM e testar local primeiro — todo fluxo nasce e é validado no LLM local antes de tocar em qualquer API paga.
Nova capacidade / prompt a validar
Subir LLM localOllama (dev) ou vLLM (throughput)
Rodar suíte de testes localgolden prompts + asserts
Qualidade local aceitável?
Não
Ajustar prompt / contexto / modelo localvolta para os testes
Sim
Definir limiar de confiança para escalonar
Caso real: local resolve?
Sim
Servir resposta localcusto zero
Não: abaixo do limiar
Escalar para API paga com permissão
Registrar métricasacerto, latência, tokens
Local cobre cada vez mais casos?
Sim
Aumentar a fatia local, reduzir gasto
Não
Recalibrar o limiar de confiança
Local-first: testar e servir local, nuvem só quando preciso

Cuidados de engenharia — princípios (com a comunidade)

Modelos de linguagem são probabilísticos e experimentais, ao contrário do software determinístico das últimas décadas. Quando o valor do produto vem do próprio modelo, a disciplina importa mais do que a quantidade de recursos. Estes princípios guiam a evolução desta arquitetura.

Fatiar a complexidade
isolar variáveis para saber o porquê

Quando um experimento falha, a pergunta é sempre: foi falta de raciocínio do modelo, foi a máquina que não aguentou, havia muitos programas abertos consumindo memória, ou o caso de uso estava mal definido e faltou regra de negócio? A meta é uma observabilidade que isole cada causa, em vez de empilhar variáveis e ficar sem resposta.

Primeiro o que funciona, depois o barato
baseline com modelos comprovados

Começar com modelos de nuvem altamente qualificados, no provedor original, para estabelecer um teto de qualidade que resolve o problema de verdade. Só depois, com dados reais de uso, vale otimizar custo trazendo trabalho para o local. A ordem é resolver primeiro e baratear depois.

Uma variável por vez
com massa de dados

Depois de acumular eventos, requisições e casos de uso reais, mexe-se em uma variável por vez em busca de eficiência. Trocar modelo, máquina e definição de tarefa ao mesmo tempo torna impossível atribuir causa a um resultado bom ou ruim.

Não otimizar duas coisas difíceis juntas
fasear autonomia e custo

Construir um agente autônomo novo e experimental e, ao mesmo tempo, torná-lo barato com modelos locais num PC pessoal são dois objetivos difíceis que se atrapalham. O plano é fasear: primeiro o agente cumpre as tarefas com modelos fortes, e o barateamento com local vem como uma fase seguinte, medida.

Isolar o que pode quebrar
roteador e estágio local enxutos

O roteador e o estágio local são justamente as partes que mais introduzem variabilidade. A diretriz é mantê-los simples, isolados e com um caminho de fallback claro, para que uma falha numa peça não derrube o conjunto nem esconda a causa real.

Medir capacidade no instante do uso
hardware como variável de primeira classe

Antes de culpar o modelo, é preciso saber se, no momento da execução, a máquina tinha VRAM, memória e processamento livres. O heartbeat de observabilidade do GENESIS registra esse estado, separando um problema de raciocínio de um problema de carga da máquina.

Roadmap de aprimoramento

Segurança e containers

A tese é manter a potência dentro de jaulas: o sistema é poderoso, mas trancado, sem abrir portas a ciberataques. Abaixo, as frentes de blindagem — cada uma explicada em linguagem simples.

A ideia central: um carro de corrida potente que anda só dentro de um autódromo cercado. Toda a força fica disponível, mas o perímetro é fechado — nada de entrada não autorizada vinda da internet.

(a) Sandbox de sistema real

Rodar o trabalho autônomo dentro de uma caixa isolada do sistema operacional (WSL2/Docker). O Hermes já tem backend Docker na ferramenta de terminal: um erro lá dentro não toca o restante da máquina.

(b) Superfície de rede mínima

O Telegram usa long polling — o robô liga para fora, ninguém liga para ele: zero porta de entrada aberta. O webhook do caramaschi mora no Fly.io, e o PC nunca atua como servidor. Adiciona-se filtragem de saída (egress) para limitar para onde os dados podem ir.

(c) Cofre de segredos

Guardar senhas e chaves em um cofre dedicado (Bitwarden — já há a seção secrets.bitwarden na configuração do Hermes) em vez de deixá-las soltas no .env. Chaves ficam fora do ambiente global, reduzindo o risco de vazamento.

(d) Hardening apontado pelo Overseer

Três correções que o próprio Overseer recomendou: tirar a --api-key da linha de comando (usar só variável de ambiente), pôr ferramentas de escrita mcp__* na lista de bloqueio, e cobrir interpretadores alternativos (python -c / node -e) no readonly-guard.

(e) Menor privilégio determinístico

Cada execução recebe só a permissão de que precisa: readonly-guard + modos de permissão + a variável GEO_HERMES_READONLY por execução. Por padrão o agente não pode escrever onde não deve.

(f) FinOps como segurança

Gasto fora do padrão é tratado como incidente: o circuit-breaker e o killswitch cortam automaticamente o gasto e a atividade anômalos, contendo tanto custo descontrolado quanto comportamento suspeito.

(g) Rotação e auditoria

Troca periódica de tokens (token-renew), snapshots criptografados, verificação de segredos antes de cada commit (secret_guard) e uma esteira de CI com gitleaks, pip-audit, bandit e CodeQL caçando vulnerabilidades.

(h) Containerizar o Overseer

Rodar os agentes de auditoria como trabalhadores read-only dentro de um container efêmero, com o repositório-alvo montado apenas para leitura e sem acesso à rede. Acabou a análise, o container some.

Referência

Perguntas e glossário

Etapa 4

Glossário Geo-Hermes

Vinte termos essenciais explicados em português claro, agrupados por categoria: modelos de linguagem, infraestrutura, segurança e operação.

LLMLLM
Large Language Model — modelo de linguagem de grande escala treinado em enormes volumes de texto para gerar, resumir, classificar e raciocinar sobre linguagem natural. Exemplos: Claude, GPT, Qwen.
LLMToken
Unidade básica de texto que o modelo processa — aproximadamente uma palavra ou parte dela (ex.: "computador" pode virar 3 tokens). Preços de API e limites de janela são medidos em tokens.
LLMJanela de contexto
Quantidade máxima de tokens que o modelo consegue "ler" de uma vez — toda a conversa, arquivos e instruções juntos. No Hermes o mínimo exigido é de 64.000 tokens; modelos menores são rejeitados automaticamente.
LLMOpus / Sonnet / Haiku
Três tamanhos da família Claude (Anthropic): Opus é o mais capaz (decisões, arquitetura, copy final); Sonnet é o intermediário (volume, refactor); Haiku é o mais rápido e barato (tarefas triviais). No bot Hermes o padrão hoje é o modelo local (qwen3-coder:30b-hermes); o Opus fica no Claude Code interativo (conta Team) e o cérebro premium do bot migra para GPT-5.5.
LLMMoE
Mixture of Experts — arquitetura de modelo que divide os parâmetros em "especialistas" e ativa apenas um subconjunto deles por token. Resulta em modelos maiores porém mais rápidos e baratos de rodar.
LLMQuantização q4_0
Técnica de compressão que reduz a precisão dos números internos do modelo de 16/32 bits para 4 bits, diminuindo drasticamente o uso de memória (VRAM/RAM) com perda mínima de qualidade. O sufixo q4_0 indica 4 bits sem ajuste extra.
LLMKV cache
Memória interna do modelo que armazena cálculos intermediários (chave/valor da atenção) de tokens já processados, evitando reprocessa-los a cada nova geração. Reduz latência e custo em conversas longas.
LLMTool-calling
Capacidade do modelo de invocar funções externas (busca, escrita de arquivo, API) de forma estruturada durante uma resposta. O modelo emite um "pedido de chamada" e o runtime executa a ferramenta, devolvendo o resultado ao modelo.
LLMEmbeddings / RAG
Embeddings são representações numéricas de textos que capturam significado semântico. RAG (Retrieval-Augmented Generation) é a técnica de buscar trechos relevantes em uma base vetorial e injeta-los no contexto antes de gerar a resposta, reduzindo alucinações.
LLMreasoning_effort
Parâmetro que controla o quanto o modelo "pensa antes de responder" (chain-of-thought interno). No Hermes está definido como high, maximizando a qualidade de raciocínio do modelo premium ao custo de maior latência.
InfraOllama
Programa que instala e serve modelos de IA localmente no computador GENESIS, sem internet. Responde no endereço localhost:11434 e armazena os modelos no disco D: via a variável OLLAMA_MODELS.
InfraSatélite-roteador
Padrão arquitetural do Geo-Hermes: o Ollama local é o "satélite" (estágio zero, gratuito) que trata triagem e rascunho; o Claude cloud é o "roteador" premium acionado só quando necessário. Minimiza custo de API.
InfraGateway
Processo intermediário que recebe comandos externos (ex.: mensagens do Telegram via long polling) e os repassa ao agente local. No Hermes, o gateway conecta o bot @Caramaschi_bot ao runtime sem expor portas na internet.
InfraLong polling
Técnica em que o cliente abre uma requisição HTTP ao servidor e aguarda até que haja dados novos (ou o tempo limite expire), então abre outra. Simula eventos em tempo real sem exigir porta aberta no firewall — usada pelo gateway Telegram do Hermes.
InfraSandbox
Ambiente isolado de execução que impede que um processo acesse ou modifique recursos fora do seu escopo. No Geo-Hermes, subagentes autônomos do Hermes SEMPRE rodam dentro de sandbox para proteger o sistema.
InfraHook
Função ou script registrado para ser executado automaticamente quando um evento ocorre (ex.: antes de um commit git, antes de uma chamada de ferramenta). No Geo-Hermes, hooks como finops-guard e readonly-guard são configurados no settings.json do Claude Code.
SegOAuth
Protocolo de autorização que permite que um aplicativo acesse recursos em nome do usuário sem que ele informe a senha diretamente. O Hermes reutiliza o token OAuth da conta alexandre.brt14@gmail.com (plano Max pessoal) gravado em ~/.claude-hermes/.credentials.json — não usa chave de API.
SegInvariante read-only
Regra de governança do Overseer: o orquestrador é o único agente com permissão de escrita, e apenas na pasta ./overseer-output/. Subagentes são estritamente read-only; o hook readonly-guard bloqueia qualquer tentativa de Write/Edit no repositório-alvo, garantindo git status limpo ao final.
OpsCLAUDE_CONFIG_DIR
Variável de ambiente que diz ao Claude Code qual diretório de configuração usar. No Hermes aponta para ~/.claude-hermes (conta Max pessoal), separando completamente das configurações do Claude Code interativo em ~/.claude (conta nuvini, plano Team), evitando conflito de credenciais.
OpsFinOps
Disciplina de gestão financeira de infraestrutura em nuvem, aplicada aqui ao custo de chamadas de LLM. Inclui monitoramento de uso com /usage e /cost, teto por sessão autônoma via GEO_HERMES_BUDGET_USD, e a regra de usar o Ollama local como estágio zero para minimizar gastos com API.
Etapa 5

Perguntas frequentes

Respostas diretas para quem usa o desktop sem precisar entender código. Clique em qualquer pergunta para expandir.

ConceitoO que é o Hermes e por que ele roda no meu computador?

Hermes é o "assistente autônomo" do framework Geo-Hermes. Ele fica em segundo plano no seu desktop fazendo tarefas que exigem continuidade — processa arquivos, atualiza bases de dados, roda análises — sem que você precise abrir nada.

Ele roda na sua máquina porque precisa de acesso direto a arquivos locais, ao banco de dados interno e a modelos de IA instalados no HD, coisas que um serviço de nuvem não consegue acessar sem você enviar tudo pela internet.

Pense nele como um assistente de escritório que trabalha à noite: quando você chega de manhã, o trabalho já está feito.

ConceitoPor que modelos de IA ficam instalados no meu HD em vez de usar a nuvem direto?

Três razões práticas:

  • Custo zero por consulta: um modelo local processa milhares de textos sem cobrar nada. Modelos na nuvem cobram por token (palavra processada).
  • Velocidade e disponibilidade: funciona mesmo sem internet, e a latência é de milissegundos em vez de segundos.
  • Privacidade: documentos internos, dados de clientes e rascunhos nunca saem do computador na fase de triagem.

A lógica é "filtrar barato antes de consultar caro": o modelo local faz 80% do trabalho rotineiro; so as decisões que realmente precisam de inteligência premium são enviadas ao Claude na nuvem.

CustoQuanto custa usar tudo isso todo mês?

Há duas partes no custo:

  • Modelos locais (Ollama): custo zero em API — você já pagou pelo hardware. O único custo marginal é eletricidade (alguns reais por mês).
  • Modelos em nuvem: o cérebro premium do Hermes passa a ser o GPT-5.5 via OAuth da OpenAI (permitido), com o DeepSeek na NVIDIA NIM (gratuito) de reserva; no orquestrador, providers com chave. O Claude fica restrito ao Claude Code (first-party). O sistema tem um teto configurável (GEO_HERMES_BUDGET_USD) e um alarme automático que avisa antes de ultrapassar o limite.

A disciplina de roteamento — local primeiro, nuvem só quando necessário — mantém a conta mensal muito abaixo do que seria se tudo fosse processado na nuvem. Acima de US$ 200/mês em uso programático, vale avaliar contratos diretos de API com desconto.

SegurançaÉ seguro apontar o Overseer para um repositório de clientes?

Sim, desde que você use o modo padrão. O Overseer segue uma regra chamada invariante read-only:

  • O repositório do cliente nunca é modificado — o git status fica limpo antes e depois da análise.
  • Toda saída vai exclusivamente para a pasta ./overseer-output/ dentro do seu projeto.
  • Os subagentes que analisam o código só leem; quem escreve é o orquestrador, e apenas no diretório de saída.

Quando a variável GEO_HERMES_READONLY=1 está ativa, um "guarda" de hooks bloqueia qualquer tentativa de escrita fora dessa pasta, mesmo que haja um bug de lógica.

Resumindo: o pior que pode acontecer é o Overseer não gerar saída — ele jamais apaga ou altera arquivos do cliente.

InfraestruturaO que acontece se a internet cair enquanto o Hermes está rodando?

O sistema foi desenhado para sobreviver a quedas de conexão:

  • Tarefas que dependem só do modelo local (Ollama) continuam normalmente — elas não precisam de internet.
  • Tarefas que precisam do Claude na nuvem ficam em fila ou falham graciosamente com log de erro, sem corromper dados.
  • O heartbeat (verificação de saúde a cada 5 minutos) detecta que a conexão caiu e para de encaminhar trabalho para a nuvem até a reconexão.

Quando a internet volta, o orquestrador retoma de onde parou. Você não precisa fazer nada manualmente.

UsoPor que existem duas contas do Claude — o que cada uma faz?

As duas contas têm funções distintas e usam diretórios de configuração separados (CLAUDE_CONFIG_DIR) para não misturar credenciais:

  • Conta Max pessoal (alexandre.brt14@gmail.com): usada pelo Hermes autônomo. O acesso é feito por OAuth — o gateway reutiliza o token da assinatura Max pessoal gravado em ~/.claude-hermes/.credentials.json. Até 08/06/2026 rodava o Opus 4.8 via OAuth; por conformidade com o ToS da Anthropic o Opus saiu do bot — hoje o padrão é o modelo local e o cérebro premium migra para GPT-5.5 (via OAuth OpenAI). Para uso interativo (Claude Code) vale a conta Team com API/OAuth first-party.
  • Conta nuvini (alexandre@nuvini.ai, plano Team): usada de forma interativa no Claude Code e no Overseer, em ~/.claude. É o ambiente de trabalho manual e pesado.

Manter as duas separadas evita conflito de autenticação e bloqueios de plano: o agente autônomo nunca interfere na sessão interativa, e vice-versa. Não existe uma "conta de API" separada para o Hermes — ele opera inteiramente sobre o OAuth da conta Max pessoal.

UsoPosso controlar o Hermes pelo celular quando estou fora?

Sim. O controle remoto funciona via Telegram, pelo bot @Caramaschi_bot. Pelo aplicativo do Telegram no celular você consegue:

  • Disparar tarefas e automações agendadas.
  • Consultar o status do sistema (se está rodando, quanto custou hoje).
  • Receber alertas proativos de erros ou quando o orçamento está se aproximando do teto.

O gateway fica ativo 24 horas por dia, 7 dias por semana, mesmo quando o desktop está bloqueado. A única exigência é que o computador esteja ligado e com internet.

ConceitoO que é o Opus 4.8 e quando ele entra em cena?

Opus 4.8 é o modelo mais avançado da Anthropic no portfólio atual — ele raciocina com mais profundidade, escreve melhor e comete menos erros em tarefas complexas do que os modelos menores. Foi o cérebro do bot até 08/06/2026; por conformidade com o ToS da Anthropic saiu do bot — hoje o padrão é o modelo local e o premium migra para GPT-5.5. O Opus segue em uso no Claude Code interativo.

No Geo-Hermes, ele é reservado para situações de alto valor:

  • Decisões de arquitetura — quando um novo sistema está sendo desenhado.
  • Copy final — textos que vao para clientes, decks, contratos.
  • Análises estratégicas — quando a resposta errada custa dinheiro ou reputação.

Para volume, refatoração de código e tarefas repetitivas, o sistema usa o Sonnet (mais rápido e barato). Para tarefas triviais de classificação, usa Haiku ou o modelo local. Isso mantém a qualidade alta onde importa e o custo baixo onde não importa.

SegurançaMeus dados de clientes ficam seguros? Eles saem do meu computador?

A arquitetura minimiza ao máximo o que sai da máquina:

  • A triagem inicial, classificação e rascunhos são feitos pelo modelo local — nenhum byte de dado de cliente vai para a internet nessa fase.
  • Só o resultado refinado (ou um trecho específico, quando necessário) é enviado à nuvem para polimento final, e apenas se você configurou essa etapa.
  • O Overseer, quando analisa repositórios, trabalha 100% localmente.

Para clientes em setores regulados (financeiro, saúde, jurídico), recomenda-se manter o processamento inteiro no modelo local e desativar o encaminhamento para nuvem para aquele projeto específico.

UsoO sistema "aprende" com o tempo? Ele melhora sozinho?

Sim, por meio de um ciclo chamado skill-curator que roda automaticamente a cada 7 dias:

  • Ele analisa as tarefas concluídas e identifica as que foram complexas (cinco ou mais etapas).
  • Documenta o passo a passo como um "skill" — uma receita reutilizável salva em ~/.hermes/skills.
  • Numa próxima tarefa semelhante, o sistema consulta o skill salvo em vez de descobrir tudo do zero, ficando mais rápido e preciso.
  • Skills obsoletos são arquivados (nunca apagados), preservando histórico.

No sentido técnico, o modelo em si não muda — funciona mais como um profissional que anota o que deu certo e consulta essas anotações na próxima vez.

CustoComo eu sei quanto estou gastando em tempo real?

Há três formas de acompanhar:

  • Comando /usage ou /cost no terminal — mostra o consumo da sessão atual imediatamente.
  • Alerta automático — o finops-guard envia uma notificação quando o gasto de qualquer sessão autônoma se aproxima do teto definido em GEO_HERMES_BUDGET_USD.
  • Circuit-breaker — se o teto for ultrapassado, o sistema aciona um killswitch que para novas chamadas a nuvem até a próxima janela de orçamento, sem intervenção manual.

Para o histórico mensal, consulte a fatura diretamente na Anthropic usando o filtro "All" em vez do filtro de previsão — isso mostra o valor real cobrado, não uma estimativa.

InfraestruturaPreciso deixar o computador ligado 24 horas? O que acontece se eu reiniciar?

Para as automações locais funcionarem sem interrupção, sim — o ideal é o computador ficar ligado. Mas o sistema foi preparado para reinicializações:

  • Os serviços principais (Ollama, heartbeat, Telegram gateway) têm scripts de inicialização automática configurados no Windows.
  • Após uma reinicialização, eles sobem sozinhos em alguns minutos, sem ação sua.
  • Tarefas que estavam em andamento no momento do desligamento são retomadas na próxima execução do ciclo agendado.

Para tarefas que precisam rodar independentemente de o desktop estar ligado — por exemplo, relatórios noturnos pesados — existe a camada de Routines na nuvem, que roda em servidores externos e não depende do seu hardware.