# Quero rodar a compressão num modelo mais barato pra não queimar meu modelo principal. Tem risco?

Hermes Agent v0.19.0, eixo memoria, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como confirmada. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-memoria-quero-rodar-compressao-num-modelo-mais-barato.

**Em uma frase:** Dá, via `auxiliary.compression.provider` e `auxiliary.compression.model`, e o risco é sério e silencioso: o modelo sumarizador **precisa** ter janela de contexto igual ou maior que a do seu modelo principal. O compressor manda a seção do meio inteira da conversa para ele; se a janela for menor, a chamada falha com erro de context length e os turnos do meio são **descartados sem sumário**, perdendo contexto em silêncio.

## A mesma pergunta, dita de outras formas

- como configurar um modelo barato pra sumarizar contexto no Hermes
- auxiliary.compression.model, como usar
- posso usar Gemini Flash pra comprimir contexto no Hermes?
- perdi contexto depois de trocar o modelo de compressão, o que houve

## A armadilha desta pergunta

**Se você já opera isso:** Escolher o sumarizador por preço, sem checar a janela. Um Flash de 128K sumarizando um agente principal de 1M produz perda silenciosa de contexto: sem exceção, sem log de erro visível ao usuário, só um buraco no meio da conversa. Segunda armadilha: tutoriais N3/N4 ainda ensinam `compression.summary_model`, que foi movido para `auxiliary.compression.*` na config versão 17 (a migração é automática, mas a chave antiga não é mais a canônica).

## O comando colável

```bash
auxiliary:
  compression:
    model: "google/gemini-3-flash-preview"   # vazio = usa o modelo de chat principal
    provider: "openrouter"                    # "auto", "openrouter", "nous", "codex", "main"...
    base_url: null                            # endpoint OpenAI-compatible custom
```

```bash
hermes config set auxiliary.compression.provider openrouter
hermes config set auxiliary.compression.model "google/gemini-3-flash-preview"
hermes config get auxiliary.compression.model
```

```bash
auxiliary:
  compression:
    reasoning_effort: low
```

## Como confirmar na sua instalação

**Se você nunca viu isso antes:** este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta.

```bash
hermes config get auxiliary.compression.model && hermes config get model.context_length   # a janela do sumarizador precisa ser >= esta
```

Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa.

## Quem operou o Hermes Agent neste documento

Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão.

Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuration

O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-memoria-quero-rodar-compressao-num-modelo-mais-barato. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram.

Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20.

Tamo junto.
