Quero rodar a compressão num modelo mais barato pra não queimar meu modelo principal. Tem risco?
Hermes Agent v0.19.0, eixo memoria, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como confirmada. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-memoria-quero-rodar-compressao-num-modelo-mais-barato.
Em uma frase: Dá, via auxiliary.compression.provider e auxiliary.compression.model, e o risco é sério e silencioso: o modelo sumarizador precisa ter janela de contexto igual ou maior que a do seu modelo principal. O compressor manda a seção do meio inteira da conversa para ele; se a janela for menor, a chamada falha com erro de context length e os turnos do meio são descartados sem sumário, perdendo contexto em silêncio.
A mesma pergunta, dita de outras formas
- como configurar um modelo barato pra sumarizar contexto no Hermes
- auxiliary.compression.model, como usar
- posso usar Gemini Flash pra comprimir contexto no Hermes?
- perdi contexto depois de trocar o modelo de compressão, o que houve
A armadilha desta pergunta
Se você já opera isso: Escolher o sumarizador por preço, sem checar a janela. Um Flash de 128K sumarizando um agente principal de 1M produz perda silenciosa de contexto: sem exceção, sem log de erro visível ao usuário, só um buraco no meio da conversa. Segunda armadilha: tutoriais N3/N4 ainda ensinam compression.summary_model, que foi movido para auxiliary.compression.* na config versão 17 (a migração é automática, mas a chave antiga não é mais a canônica).
O comando colável
auxiliary:
compression:
model: "google/gemini-3-flash-preview" # vazio = usa o modelo de chat principal
provider: "openrouter" # "auto", "openrouter", "nous", "codex", "main"...
base_url: null # endpoint OpenAI-compatible custom
hermes config set auxiliary.compression.provider openrouter
hermes config set auxiliary.compression.model "google/gemini-3-flash-preview"
hermes config get auxiliary.compression.model
auxiliary:
compression:
reasoning_effort: low
Como confirmar na sua instalação
Se você nunca viu isso antes: este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta.
hermes config get auxiliary.compression.model && hermes config get model.context_length # a janela do sumarizador precisa ser >= esta
Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa.
Quem operou o Hermes Agent neste documento
Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão.
Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuration
O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-memoria-quero-rodar-compressao-num-modelo-mais-barato. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram.
Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20.
Tamo junto.