Por que meu Hermes gasta muito mais do que o volume de conversa que eu tenho? Tem chamada de LLM acontecendo sem eu pedir?
Hermes Agent v0.19.0, eixo custo, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como corrigida. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-custo-hermes-gasta-muito-mais-volume-conversa-tenho-tem.
Em uma frase: Sim. Todo slot auxiliary.* vem com provider: "auto", e na v0.19.0 auto significa literalmente "use meu modelo principal". Vision, web_extract, compression, title_generation, approval, skills_hub, mcp, triage_specifier, kanban_decomposer, profile_describer e curator rodam no mesmo modelo caro do chat até você sobrescrever cada um.
A mesma pergunta, dita de outras formas
- o que são os modelos auxiliares do Hermes e quanto eles custam
- meu Opus está queimando crédito sem eu conversar, por quê
- auxiliary.* provider auto usa qual modelo
- o Hermes faz chamadas de LLM escondidas?
O que quebra no Hermes Agent
- Se você apontar um slot para um provider sem credencial válida, a task cai no default do openrouter e loga um warning em agent.log. Não dá erro visível no chat.
- auxiliary.<task>.model: auto é armadilha: o código normaliza a string literal "auto" para None justamente porque, sem isso, o provider devolve 200 OK com um corpo de erro ("the model 'auto' does not exist") que o compressor aceita como saída válida. Deixe model: "", não model: auto.
### Como perceber que quebrou
``bash
grep -i 'auxiliary\|falls back' ~/.hermes/logs/agent.log | tail -20
``
A armadilha desta pergunta
Se você já opera isso: Material antigo (e o próprio cli-config.yaml.example do repo) afirma que os auxiliares usam Gemini Flash barato por padrão. Isso era verdade em builds anteriores e deixou de ser: auto hoje é o SEU modelo principal, incluindo Opus.
O comando colável
hermes config get auxiliary --json
# ~/.hermes/config.yaml
auxiliary:
title_generation:
provider: openrouter
model: google/gemini-3-flash-preview
compression:
provider: openrouter
model: google/gemini-3-flash-preview
web_extract:
provider: openrouter
model: google/gemini-3-flash-preview
approval:
provider: openrouter
model: google/gemini-3-flash-preview
grep -i 'auxiliary\|falls back' ~/.hermes/logs/agent.log | tail -20
Como confirmar na sua instalação
Se você nunca viu isso antes: este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta.
hermes config get auxiliary --json && hermes config get model --json
Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa.
O que a frota corrigiu nesta resposta
Sim, e são 18 slots, não 11. Todo bloco sob auxiliary: nasce com provider: "auto", e na v0.19.0 auto significa literalmente "use meu modelo principal". Os 18 em DEFAULT_CONFIG["auxiliary"] (hermes_cli/config.py): vision, web_extract, compression, skills_hub, approval, mcp, title_generation, memory_query_rewrite, tts_audio_tags, triage_specifier, kanban_decomposer, profile_describer, goal_judge, curator, monitor, background_review, moa_reference, moa_aggregator. O maior ralo escondido é background_review, o fork pós-turno que decide se salva memória ou corrige skill: ele roda no modelo principal replayando a conversa inteira a cada turno, e vem ligado junto com memory_enabled: true (default). Corte assim, em ~/.hermes/config.yaml:
``yaml
auxiliary:
background_review:
provider: openrouter
model: google/gemini-3-flash-preview
`
Quando o modelo do review difere do principal, o fork troca o transcript completo por um digest compacto automaticamente, e a doc de memória mede ~3-5x menos custo. Para ver os 18 defaults na sua máquina: gh api repos/NousResearch/hermes-agent/contents/hermes_cli/config.py --jq '.content' | base64 -d | sed -n '1662,1890p'`
Quem operou o Hermes Agent neste documento
Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão.
Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuration#auxiliary-models
O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-custo-hermes-gasta-muito-mais-volume-conversa-tenho-tem. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram.
Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20.
Tamo junto.