Vale a pena usar /model --once para mandar só uma pergunta difícil pro modelo caro?
Hermes Agent v0.19.0, eixo custo, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como corrigida. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-custo-vale-pena-usar-model-once-mandar-pergunta-dificil.
Em uma frase: Compensa em sessão curta e na escalada barato→caro. Sai caro no caso oposto: uma pergunta lateral rápida dentro de uma sessão longa e cara. --once quebra o prefixo de prompt cache duas vezes (na ida e na volta), e o próximo turno repaga input cheio, sem o desconto de ~75 a 90% do cache.
A mesma pergunta, dita de outras formas
- /model --once compensa ou sai mais caro?
- trocar de modelo no meio da sessão quebra o cache?
- escalar uma pergunta para o Opus sem trocar a sessão inteira
- custo de trocar de modelo mid-session no Hermes
A armadilha desta pergunta
Se você já opera isso: Tratar --once como grátis por ser temporário. O custo não é o turno caro, é a releitura do prefixo cacheado duas vezes. Em conversa longa, a mudança de modelo é mais cara que o modelo.
O comando colável
/model claude-opus-4.6 --once # só o próximo turno, depois restaura sozinho
/model gpt-5.4 --provider openrouter # só a sessão
/model gpt-5.4 --provider openrouter --global # sessão + persiste no config.yaml
Como confirmar na sua instalação
Se você nunca viu isso antes: este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta.
/usage # dentro do chat, compare cache_read vs input tokens antes e depois de um --once
Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa.
O que a frota corrigiu nesta resposta
Compensa em sessão curta e na escalada barato→caro. Sai caro no caso oposto: uma pergunta lateral rápida dentro de uma sessão longa e cara. O motivo, nas palavras da doc: --once quebra o prefixo de prompt cache do provider duas vezes (na ida e na volta), e em provider com cache de prefixo (Anthropic, OpenAI) o turno seguinte repaga o input cheio. Quanto isso custa em percentual depende da tabela do seu provider e não é informado por N1 nem por N2 — não meça por estimativa, meça na fatura ou nos campos cache_read_tokens / cache_write_tokens do relatório de uso (hermes -z "..." --usage-file /tmp/uso.json). A regra prática que a doc autoriza: use --once quando a sessão é curta ou quando você está escalando de um modelo barato para um caro; não use para uma pergunta lateral no meio de uma conversa longa já cara, porque a releitura do prefixo custa mais que o turno.
Quem operou o Hermes Agent neste documento
Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão.
Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuring-models#cli-slash-command
O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-custo-vale-pena-usar-model-once-mandar-pergunta-dificil. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram.
Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20.
Tamo junto.