Vale a pena usar /model --once para mandar só uma pergunta difícil pro modelo caro? ======================================================================== https://docs.nexialismo.ai/pt/hermes-custo-vale-pena-usar-model-once-mandar-pergunta-dificil Hermes Agent v0.19.0, eixo custo, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como corrigida. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-custo-vale-pena-usar-model-once-mandar-pergunta-dificil. Em uma frase: Compensa em sessão curta e na escalada barato→caro. Sai caro no caso oposto: uma pergunta lateral rápida dentro de uma sessão longa e cara. --once quebra o prefixo de prompt cache duas vezes (na ida e na volta), e o próximo turno repaga input cheio, sem o desconto de ~75 a 90% do cache. A mesma pergunta, dita de outras formas --------------------------------------- - /model --once compensa ou sai mais caro? - trocar de modelo no meio da sessão quebra o cache? - escalar uma pergunta para o Opus sem trocar a sessão inteira - custo de trocar de modelo mid-session no Hermes A armadilha desta pergunta -------------------------- Se você já opera isso: Tratar --once como grátis por ser temporário. O custo não é o turno caro, é a releitura do prefixo cacheado duas vezes. Em conversa longa, a mudança de modelo é mais cara que o modelo. O comando colável ----------------- /model claude-opus-4.6 --once # só o próximo turno, depois restaura sozinho /model gpt-5.4 --provider openrouter # só a sessão /model gpt-5.4 --provider openrouter --global # sessão + persiste no config.yaml Como confirmar na sua instalação -------------------------------- Se você nunca viu isso antes: este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta. /usage # dentro do chat, compare cache_read vs input tokens antes e depois de um --once Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa. O que a frota corrigiu nesta resposta ------------------------------------- Compensa em sessão curta e na escalada barato→caro. Sai caro no caso oposto: uma pergunta lateral rápida dentro de uma sessão longa e cara. O motivo, nas palavras da doc: --once quebra o prefixo de prompt cache do provider duas vezes (na ida e na volta), e em provider com cache de prefixo (Anthropic, OpenAI) o turno seguinte repaga o input cheio. Quanto isso custa em percentual depende da tabela do seu provider e não é informado por N1 nem por N2 — não meça por estimativa, meça na fatura ou nos campos cache_read_tokens / cache_write_tokens do relatório de uso (hermes -z "..." --usage-file /tmp/uso.json). A regra prática que a doc autoriza: use --once quando a sessão é curta ou quando você está escalando de um modelo barato para um caro; não use para uma pergunta lateral no meio de uma conversa longa já cara, porque a releitura do prefixo custa mais que o turno. Quem operou o Hermes Agent neste documento ------------------------------------------ Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão. Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuring-models#cli-slash-command O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-custo-vale-pena-usar-model-once-mandar-pergunta-dificil. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram. Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20. Tamo junto.