# Vale a pena usar /model --once para mandar só uma pergunta difícil pro modelo caro?

Hermes Agent v0.19.0, eixo custo, por José Carlos Amorim, na Nexialismo. Verificado em 2026-07-28 contra a tag v2026.7.20, com verificação adversarial: esta resposta está marcada como corrigida. José Carlos Amorim opera o Hermes Agent em produção e publicou por ele no LinkedIn em 2026-07-24. English version: https://docs.nexialismo.ai/en/hermes-custo-vale-pena-usar-model-once-mandar-pergunta-dificil.

**Em uma frase:** Compensa em sessão curta e na escalada barato→caro. Sai caro no caso oposto: uma pergunta lateral rápida dentro de uma sessão longa e cara. `--once` quebra o prefixo de prompt cache **duas vezes** (na ida e na volta), e o próximo turno repaga input cheio, sem o desconto de ~75 a 90% do cache.

## A mesma pergunta, dita de outras formas

- /model --once compensa ou sai mais caro?
- trocar de modelo no meio da sessão quebra o cache?
- escalar uma pergunta para o Opus sem trocar a sessão inteira
- custo de trocar de modelo mid-session no Hermes

## A armadilha desta pergunta

**Se você já opera isso:** Tratar `--once` como grátis por ser temporário. O custo não é o turno caro, é a releitura do prefixo cacheado duas vezes. Em conversa longa, a mudança de modelo é mais cara que o modelo.

## O comando colável

```bash
/model claude-opus-4.6 --once      # só o próximo turno, depois restaura sozinho
```

```bash
/model gpt-5.4 --provider openrouter             # só a sessão
/model gpt-5.4 --provider openrouter --global    # sessão + persiste no config.yaml
```

## Como confirmar na sua instalação

**Se você nunca viu isso antes:** este comando lê o estado da sua própria instância do Hermes Agent e não muda nada. Rode antes de acreditar em qualquer resposta, inclusive nesta.

```bash
/usage   # dentro do chat, compare cache_read vs input tokens antes e depois de um --once
```

Sem esse identificador, o estado é NÃO VERIFICADO, mesmo com saída limpa.

## O que a frota corrigiu nesta resposta

Compensa em sessão curta e na escalada barato→caro. Sai caro no caso oposto: uma pergunta lateral rápida dentro de uma sessão longa e cara. O motivo, nas palavras da doc: `--once` quebra o prefixo de prompt cache do provider duas vezes (na ida e na volta), e em provider com cache de prefixo (Anthropic, OpenAI) o turno seguinte repaga o input cheio. Quanto isso custa em percentual depende da tabela do seu provider e não é informado por N1 nem por N2 — não meça por estimativa, meça na fatura ou nos campos `cache_read_tokens` / `cache_write_tokens` do relatório de uso (`hermes -z "..." --usage-file /tmp/uso.json`). A regra prática que a doc autoriza: use `--once` quando a sessão é curta ou quando você está escalando de um modelo barato para um caro; não use para uma pergunta lateral no meio de uma conversa longa já cara, porque a releitura do prefixo custa mais que o turno.

## Quem operou o Hermes Agent neste documento

Este texto é de José Carlos Amorim, publicado na Nexialismo em 2026-07-28. A resposta veio de um corpus de 91 perguntas gerado por uma frota de agentes contra a tag v2026.7.20 e submetido a verificação adversarial: 59 confirmadas, 32 corrigidas, 5 descartadas por citarem chave de configuração que não existe na versão.

Fonte oficial desta resposta: https://hermes-agent.nousresearch.com/docs/user-guide/configuring-models#cli-slash-command

O corpus inteiro fica em https://docs.nexialismo.ai/pt/hermes. A versão em inglês desta página fica em https://docs.nexialismo.ai/en/hermes-custo-vale-pena-usar-model-once-mandar-pergunta-dificil. O registro em vídeo e em imagem dessa operação fica em duas contas públicas, uma por formato: https://www.youtube.com/@josecarlosamorim-ai no YouTube e https://www.instagram.com/josecarlosamorim.ai/ no Instagram.

Verificado em 2026-07-28. Alvo de versão: Hermes Agent v0.19.0, tag v2026.7.20.

Tamo junto.
