Por que meu Hermes gasta muito mais do que o volume de conversa que eu tenho? Tem chamada de LLM acontecendo sem eu pedir? ======================================================================== https://docs.nexialismo.ai/pt/hermes-custo-hermes-gasta-muito-mais-volume-conversa-tenho-tem Hermes Agent v0.19.0, eixo custo, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como corrigida. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-custo-hermes-gasta-muito-mais-volume-conversa-tenho-tem. Em uma frase: Sim. Todo slot auxiliary.* vem com provider: "auto", e na v0.19.0 auto significa literalmente "use meu modelo principal". Vision, web_extract, compression, title_generation, approval, skills_hub, mcp, triage_specifier, kanban_decomposer, profile_describer e curator rodam no mesmo modelo caro do chat até você sobrescrever cada um. A mesma pergunta, dita de outras formas --------------------------------------- - o que são os modelos auxiliares do Hermes e quanto eles custam - meu Opus está queimando crédito sem eu conversar, por quê - auxiliary.* provider auto usa qual modelo - o Hermes faz chamadas de LLM escondidas? O que quebra no Hermes Agent ---------------------------- - Se você apontar um slot para um provider sem credencial válida, a task cai no default do openrouter e loga um warning em agent.log. Não dá erro visível no chat. - auxiliary..model: auto é armadilha: o código normaliza a string literal "auto" para None justamente porque, sem isso, o provider devolve 200 OK com um corpo de erro ("the model 'auto' does not exist") que o compressor aceita como saída válida. Deixe model: "", não model: auto. ### Como perceber que quebrou ``bash grep -i 'auxiliary\|falls back' ~/.hermes/logs/agent.log | tail -20 `` A armadilha desta pergunta -------------------------- Se você já opera isso: Material antigo (e o próprio cli-config.yaml.example do repo) afirma que os auxiliares usam Gemini Flash barato por padrão. Isso era verdade em builds anteriores e deixou de ser: auto hoje é o SEU modelo principal, incluindo Opus. O comando colável ----------------- hermes config get auxiliary --json # ~/.hermes/config.yaml auxiliary: title_generation: provider: openrouter model: google/gemini-3-flash-preview compression: provider: openrouter model: google/gemini-3-flash-preview web_extract: provider: openrouter model: google/gemini-3-flash-preview approval: provider: openrouter model: google/gemini-3-flash-preview grep -i 'auxiliary\|falls back' ~/.hermes/logs/agent.log | tail -20 Como confirmar na sua instalação -------------------------------- Se você nunca viu isso antes: este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta. hermes config get auxiliary --json && hermes config get model --json Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa. O que a frota corrigiu nesta resposta ------------------------------------- Sim, e são 18 slots, não 11. Todo bloco sob auxiliary: nasce com provider: "auto", e na v0.19.0 auto significa literalmente "use meu modelo principal". Os 18 em DEFAULT_CONFIG["auxiliary"] (hermes_cli/config.py): vision, web_extract, compression, skills_hub, approval, mcp, title_generation, memory_query_rewrite, tts_audio_tags, triage_specifier, kanban_decomposer, profile_describer, goal_judge, curator, monitor, background_review, moa_reference, moa_aggregator. O maior ralo escondido é background_review, o fork pós-turno que decide se salva memória ou corrige skill: ele roda no modelo principal replayando a conversa inteira a cada turno, e vem ligado junto com memory_enabled: true (default). Corte assim, em ~/.hermes/config.yaml: ``yaml auxiliary: background_review: provider: openrouter model: google/gemini-3-flash-preview ` Quando o modelo do review difere do principal, o fork troca o transcript completo por um digest compacto automaticamente, e a doc de memória mede ~3-5x menos custo. Para ver os 18 defaults na sua máquina: gh api repos/NousResearch/hermes-agent/contents/hermes_cli/config.py --jq '.content' | base64 -d | sed -n '1662,1890p'` Quem operou o Hermes Agent neste documento ------------------------------------------ Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão. Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuration#auxiliary-models O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-custo-hermes-gasta-muito-mais-volume-conversa-tenho-tem. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram. Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20. Tamo junto.