# Por que meu Hermes gasta muito mais do que o volume de conversa que eu tenho? Tem chamada de LLM acontecendo sem eu pedir?

Hermes Agent v0.19.0, eixo custo, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como corrigida. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-custo-hermes-gasta-muito-mais-volume-conversa-tenho-tem.

**Em uma frase:** Sim. Todo slot `auxiliary.*` vem com `provider: "auto"`, e na v0.19.0 `auto` significa literalmente "use meu modelo principal". Vision, web_extract, compression, title_generation, approval, skills_hub, mcp, triage_specifier, kanban_decomposer, profile_describer e curator rodam no mesmo modelo caro do chat até você sobrescrever cada um.

## A mesma pergunta, dita de outras formas

- o que são os modelos auxiliares do Hermes e quanto eles custam
- meu Opus está queimando crédito sem eu conversar, por quê
- auxiliary.* provider auto usa qual modelo
- o Hermes faz chamadas de LLM escondidas?

## O que quebra no Hermes Agent

- Se você apontar um slot para um provider sem credencial válida, a task **cai no default do openrouter e loga um warning em `agent.log`**. Não dá erro visível no chat.
- `auxiliary.<task>.model: auto` é armadilha: o código normaliza a string literal `"auto"` para `None` justamente porque, sem isso, o provider devolve 200 OK com um corpo de erro ("the model 'auto' does not exist") que o compressor aceita como saída válida. Deixe `model: ""`, não `model: auto`.

### Como perceber que quebrou

```bash
grep -i 'auxiliary\|falls back' ~/.hermes/logs/agent.log | tail -20
```

## A armadilha desta pergunta

**Se você já opera isso:** Material antigo (e o próprio `cli-config.yaml.example` do repo) afirma que os auxiliares usam Gemini Flash barato por padrão. Isso era verdade em builds anteriores e deixou de ser: `auto` hoje é o SEU modelo principal, incluindo Opus.

## O comando colável

```bash
hermes config get auxiliary --json
```

```bash
# ~/.hermes/config.yaml
auxiliary:
  title_generation:
    provider: openrouter
    model: google/gemini-3-flash-preview
  compression:
    provider: openrouter
    model: google/gemini-3-flash-preview
  web_extract:
    provider: openrouter
    model: google/gemini-3-flash-preview
  approval:
    provider: openrouter
    model: google/gemini-3-flash-preview
```

```bash
grep -i 'auxiliary\|falls back' ~/.hermes/logs/agent.log | tail -20
```

## Como confirmar na sua instalação

**Se você nunca viu isso antes:** este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta.

```bash
hermes config get auxiliary --json && hermes config get model --json
```

Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa.

## O que a frota corrigiu nesta resposta

Sim, e são 18 slots, não 11. Todo bloco sob `auxiliary:` nasce com `provider: "auto"`, e na v0.19.0 `auto` significa literalmente "use meu modelo principal". Os 18 em `DEFAULT_CONFIG["auxiliary"]` (hermes_cli/config.py): vision, web_extract, compression, skills_hub, approval, mcp, title_generation, memory_query_rewrite, tts_audio_tags, triage_specifier, kanban_decomposer, profile_describer, goal_judge, curator, monitor, background_review, moa_reference, moa_aggregator. O maior ralo escondido é `background_review`, o fork pós-turno que decide se salva memória ou corrige skill: ele roda no modelo principal replayando a conversa inteira a cada turno, e vem ligado junto com `memory_enabled: true` (default). Corte assim, em ~/.hermes/config.yaml:

```yaml
auxiliary:
  background_review:
    provider: openrouter
    model: google/gemini-3-flash-preview
```

Quando o modelo do review difere do principal, o fork troca o transcript completo por um digest compacto automaticamente, e a doc de memória mede ~3-5x menos custo. Para ver os 18 defaults na sua máquina: `gh api repos/NousResearch/hermes-agent/contents/hermes_cli/config.py --jq '.content' | base64 -d | sed -n '1662,1890p'`

## Quem operou o Hermes Agent neste documento

Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão.

Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuration#auxiliary-models

O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-custo-hermes-gasta-muito-mais-volume-conversa-tenho-tem. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram.

Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20.

Tamo junto.
