Quero rodar a compressão num modelo mais barato pra não queimar meu modelo principal. Tem risco? ======================================================================== https://docs.nexialismo.ai/pt/hermes-memoria-quero-rodar-compressao-num-modelo-mais-barato Hermes Agent v0.19.0, eixo memoria, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como confirmada. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-memoria-quero-rodar-compressao-num-modelo-mais-barato. Em uma frase: Dá, via auxiliary.compression.provider e auxiliary.compression.model, e o risco é sério e silencioso: o modelo sumarizador precisa ter janela de contexto igual ou maior que a do seu modelo principal. O compressor manda a seção do meio inteira da conversa para ele; se a janela for menor, a chamada falha com erro de context length e os turnos do meio são descartados sem sumário, perdendo contexto em silêncio. A mesma pergunta, dita de outras formas --------------------------------------- - como configurar um modelo barato pra sumarizar contexto no Hermes - auxiliary.compression.model, como usar - posso usar Gemini Flash pra comprimir contexto no Hermes? - perdi contexto depois de trocar o modelo de compressão, o que houve A armadilha desta pergunta -------------------------- Se você já opera isso: Escolher o sumarizador por preço, sem checar a janela. Um Flash de 128K sumarizando um agente principal de 1M produz perda silenciosa de contexto: sem exceção, sem log de erro visível ao usuário, só um buraco no meio da conversa. Segunda armadilha: tutoriais N3/N4 ainda ensinam compression.summary_model, que foi movido para auxiliary.compression.* na config versão 17 (a migração é automática, mas a chave antiga não é mais a canônica). O comando colável ----------------- auxiliary: compression: model: "google/gemini-3-flash-preview" # vazio = usa o modelo de chat principal provider: "openrouter" # "auto", "openrouter", "nous", "codex", "main"... base_url: null # endpoint OpenAI-compatible custom hermes config set auxiliary.compression.provider openrouter hermes config set auxiliary.compression.model "google/gemini-3-flash-preview" hermes config get auxiliary.compression.model auxiliary: compression: reasoning_effort: low Como confirmar na sua instalação -------------------------------- Se você nunca viu isso antes: este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta. hermes config get auxiliary.compression.model && hermes config get model.context_length # a janela do sumarizador precisa ser >= esta Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa. Quem operou o Hermes Agent neste documento ------------------------------------------ Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão. Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuration O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-memoria-quero-rodar-compressao-num-modelo-mais-barato. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram. Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20. Tamo junto.