- LLMLLM
- Large Language Model — modelo de linguagem de grande escala treinado em enormes volumes de texto para gerar, resumir, classificar e raciocinar sobre linguagem natural. Exemplos: Claude, GPT, Qwen.
- LLMToken
- Unidade básica de texto que o modelo processa — aproximadamente uma palavra ou parte dela (ex.: "computador" pode virar 3 tokens). Preços de API e limites de janela são medidos em tokens.
- LLMJanela de contexto
- Quantidade máxima de tokens que o modelo consegue "ler" de uma vez — toda a conversa, arquivos e instruções juntos. No Hermes o mínimo exigido é de 64.000 tokens; modelos menores são rejeitados automaticamente.
- LLMOpus / Sonnet / Haiku
- Três tamanhos da família Claude (Anthropic): Opus é o mais capaz (decisões, arquitetura, copy final); Sonnet é o intermediário (volume, refactor); Haiku é o mais rápido e barato (tarefas triviais). No bot Hermes o padrão hoje é o modelo local (
qwen3-coder:30b-hermes); o Opus fica no Claude Code interativo (conta Team) e o cérebro premium do bot migra para GPT-5.5.
- LLMMoE
- Mixture of Experts — arquitetura de modelo que divide os parâmetros em "especialistas" e ativa apenas um subconjunto deles por token. Resulta em modelos maiores porém mais rápidos e baratos de rodar.
- LLMQuantização q4_0
- Técnica de compressão que reduz a precisão dos números internos do modelo de 16/32 bits para 4 bits, diminuindo drasticamente o uso de memória (VRAM/RAM) com perda mínima de qualidade. O sufixo
q4_0 indica 4 bits sem ajuste extra.
- LLMKV cache
- Memória interna do modelo que armazena cálculos intermediários (chave/valor da atenção) de tokens já processados, evitando reprocessa-los a cada nova geração. Reduz latência e custo em conversas longas.
- LLMTool-calling
- Capacidade do modelo de invocar funções externas (busca, escrita de arquivo, API) de forma estruturada durante uma resposta. O modelo emite um "pedido de chamada" e o runtime executa a ferramenta, devolvendo o resultado ao modelo.
- LLMEmbeddings / RAG
- Embeddings são representações numéricas de textos que capturam significado semântico. RAG (Retrieval-Augmented Generation) é a técnica de buscar trechos relevantes em uma base vetorial e injeta-los no contexto antes de gerar a resposta, reduzindo alucinações.
- LLMreasoning_effort
- Parâmetro que controla o quanto o modelo "pensa antes de responder" (chain-of-thought interno). No Hermes está definido como
high, maximizando a qualidade de raciocínio do modelo premium ao custo de maior latência.
- InfraOllama
- Programa que instala e serve modelos de IA localmente no computador GENESIS, sem internet. Responde no endereço
localhost:11434 e armazena os modelos no disco D: via a variável OLLAMA_MODELS.
- InfraSatélite-roteador
- Padrão arquitetural do Geo-Hermes: o Ollama local é o "satélite" (estágio zero, gratuito) que trata triagem e rascunho; o Claude cloud é o "roteador" premium acionado só quando necessário. Minimiza custo de API.
- InfraGateway
- Processo intermediário que recebe comandos externos (ex.: mensagens do Telegram via long polling) e os repassa ao agente local. No Hermes, o gateway conecta o bot
@Caramaschi_bot ao runtime sem expor portas na internet.
- InfraLong polling
- Técnica em que o cliente abre uma requisição HTTP ao servidor e aguarda até que haja dados novos (ou o tempo limite expire), então abre outra. Simula eventos em tempo real sem exigir porta aberta no firewall — usada pelo gateway Telegram do Hermes.
- InfraSandbox
- Ambiente isolado de execução que impede que um processo acesse ou modifique recursos fora do seu escopo. No Geo-Hermes, subagentes autônomos do Hermes SEMPRE rodam dentro de sandbox para proteger o sistema.
- InfraHook
- Função ou script registrado para ser executado automaticamente quando um evento ocorre (ex.: antes de um commit git, antes de uma chamada de ferramenta). No Geo-Hermes, hooks como
finops-guard e readonly-guard são configurados no settings.json do Claude Code.
- SegOAuth
- Protocolo de autorização que permite que um aplicativo acesse recursos em nome do usuário sem que ele informe a senha diretamente. O Hermes reutiliza o token OAuth da conta
alexandre.brt14@gmail.com (plano Max pessoal) gravado em ~/.claude-hermes/.credentials.json — não usa chave de API.
- SegInvariante read-only
- Regra de governança do Overseer: o orquestrador é o único agente com permissão de escrita, e apenas na pasta
./overseer-output/. Subagentes são estritamente read-only; o hook readonly-guard bloqueia qualquer tentativa de Write/Edit no repositório-alvo, garantindo git status limpo ao final.
- OpsCLAUDE_CONFIG_DIR
- Variável de ambiente que diz ao Claude Code qual diretório de configuração usar. No Hermes aponta para
~/.claude-hermes (conta Max pessoal), separando completamente das configurações do Claude Code interativo em ~/.claude (conta nuvini, plano Team), evitando conflito de credenciais.
- OpsFinOps
- Disciplina de gestão financeira de infraestrutura em nuvem, aplicada aqui ao custo de chamadas de LLM. Inclui monitoramento de uso com
/usage e /cost, teto por sessão autônoma via GEO_HERMES_BUDGET_USD, e a regra de usar o Ollama local como estágio zero para minimizar gastos com API.