Quatro palavras que decidem a fatura.
Pedaço de palavra que o modelo lê ou escreve. "Contratação" vira uns três. É a unidade em que tudo é cobrado.
Tudo o que você manda ao modelo a cada chamada: instruções, o histórico da conversa, documentos, o que as ferramentas devolveram.
Tudo o que o modelo escreve, incluindo o raciocínio que ele faz antes de responder. Costuma custar cinco vezes mais por token que a entrada.
Desconto para trechos repetidos que o provedor já viu em chamadas anteriores. Aqui, 90% mais barato. Barato não é grátis: é cobrado de novo a cada chamada.
"40% menos" é a média boa.
Em setembro, a Fireworks lançou o Ember-1: um modelo aberto (o Kimi K3) treinado de novo para raciocinar mais curto. A promessa é "a qualidade do K3 com 40% menos tokens".
A tabela da própria Fireworks, em cinco testes públicos, mostra reduções de 5,9% a 51,9%. A do meio é 23,7%. No teste mais parecido com um atendimento real, um agente de companhia aérea, a redução foi de 5,9%. O número de 40% vem de um índice interno e de um teste com um cliente sem nome, em que a resposta caiu de 49,3 mil para 29,9 mil tokens com nota praticamente igual (0,753 contra 0,751).
Nada disso é mentira. É que "40% menos tokens" fala de um tipo de token, o que o modelo escreve. A conta que você paga tem dois.
| Teste | Tarefas | Acerto antes | Acerto Ember-1 | Tokens a menos |
|---|---|---|---|---|
| Tarefas de terminal (Terminal Bench 2.1) | 89 | 80,9% | 82,0% | 51,9% |
| Programação com conversa (SWE-Interact) | 75 | 21,3% | 20,0% | 32,5% |
| Programação longa (DeepSWE 1.1) | 113 | 66,4% | 75,2% | 23,7% |
| Corrigir bugs reais (SWE-bench Verified) | 500 | 93,2% | 92,2% | 15,5% |
| Atendimento de companhia aérea (τ²-Bench) | 50 | 64% | 66% | 5,9% |
A qualidade se manteve: quatro das cinco diferenças de acerto são de uma tarefa para mais ou para menos, o que é ruído. A única diferença grande (DeepSWE, +8,8 pontos) não passa num teste estatístico simples. "A mesma qualidade" está sustentado; "melhorou", não.
Cada rodada reenvia tudo.
Um agente é um programa que conversa com o modelo várias vezes para terminar uma tarefa: pergunta, chama uma ferramenta, lê o resultado, pergunta de novo. O modelo não guarda memória entre chamadas. Então a cada rodada o agente reenvia tudo: as instruções, os documentos e o histórico inteiro até ali.
O histórico cresce a cada rodada, e o que foi mandado na primeira é pago de novo na segunda, na terceira, na décima quinta. O que o modelo escreve em cada rodada fica mais ou menos do mesmo tamanho. Com poucas rodadas, a saída domina; com muitas, a entrada engole a conta.
O cache ajuda: o trecho que se repete sai 90% mais barato. Mas ele barateia a repetição, não perdoa um contexto inchado. E um modelo que "pensa menos" não toca em nada disso: ele corta só a faixa estreita de cima.
Pergunta curta, resposta difícil.
Os dois exemplos do espécime lá em cima, com os preços da Fireworks, mostram os dois extremos.
Uma pergunta difícil (classificar um caso complicado, resolver uma conta, planejar): uma rodada, pouca entrada, muito raciocínio. Quase todo o custo é saída, e cortar 40% dela economiza 39% do custo. A promessa se cumpre quase inteira.
Um atendimento de 15 rodadas, com instruções longas, histórico crescendo e cache: a mesma troca de modelo economiza 17%. E isso supondo o corte de 40%, quando o teste de atendimento da própria Fireworks mediu 5,9%.
Existe um ganho que a conta de dinheiro não mostra: tempo. O modelo escreve token por token, então escrever menos é responder antes. Quando alguém está esperando na tela, isso pode valer mais que o dinheiro.
O token mais barato perdeu a tarefa.
A IBM mediu 417 tarefas de agente com dois modelos. O que tinha o token mais barato custou quase o dobro por tarefa: US$ 155 contra US$ 79. O motivo é o mesmo desta página: em trabalho de agente, a entrada se repete, e quem aproveita melhor o cache ganha a conta, não quem tem a etiqueta menor.
O mesmo vale ao contrário. Um modelo pode ter token barato e gastar muito mais tokens para chegar à resposta, ou precisar de mais rodadas. O preço que importa é o custo por tarefa terminada, medido no seu próprio uso, com o mesmo nível de esforço dos dois lados.
E o pior gasto não aparece em nenhuma tabela: o agente que entra em laço. Um caso brasileiro publicado em agosto: uma API devolveu dado quebrado, o agente tentou de novo sem parar, e cada tentativa levava o erro anterior no histórico. A primeira custou mil tokens; a décima quinta, vinte mil. A sessão de um único usuário custou US$ 800.
Quatro regras para a conta de um agente.
Meça custo por tarefa, não por token
Some entrada, cache, saída e rodadas de uma tarefa terminada. É o único número que compara modelos, versões e fornecedores de forma honesta.
Olhe a entrada primeiro
Quantas rodadas, quanto se reenvia em cada uma, quanto pega cache. Em agente, é aí que está a maior parte do dinheiro, e é aí que um bom desenho economiza.
Corte raciocínio onde a saída domina
Uma rodada, pergunta curta, resposta difícil; ou quando alguém espera a resposta na tela. Fora disso, um modelo que "pensa menos" muda pouco a fatura.
Ponha teto antes de ligar
Limite de rodadas e de tokens por tarefa, aplicado antes da chamada, não descoberto depois na fatura. Um laço de repetição cresce mais rápido que a sua capacidade de perceber.
Onde isso pode estar errado.
A calculadora é um modelo simples
Supomos que o histórico cresce mil tokens por rodada e que o raciocínio não é reenviado. Agentes reais variam muito; a conta certa é a do seu uso, medido chamada a chamada.
Os números do Ember-1 são deles
Uma rodada por teste, de 50 a 500 tarefas, e o teste com cliente não diz quem é o cliente nem qual é a tarefa. Os pesos não foram liberados para medirmos.
Preço muda toda semana
Na mesma semana do lançamento saíram o GPT-6 Sol e o Claude Opus 5.5, com corte de preço. A proporção entre entrada e saída pode mudar, e com ela a conta inteira.
Cada fornecedor conta tokens de um jeito
Alguns cobram o raciocínio junto com a saída, outros separado; o cache tem tarifa própria e regras diferentes. Comparar sem normalizar isso mede a tabela, não o custo.
← Caderno de pesquisa · stickybit.com.br
- Fireworks: Ember-1 (tabela de testes, preços usados, teste com cliente) · discussão no Hacker News
- IBM Research, "Model routing is simple until it isn't" (Hugging Face, julho de 2026): 417 tarefas AppWorld, custo por tarefa contra preço por token.
- BIX Tecnologia, "colocamos agentes de IA em produção por 6 meses" (TabNews, agosto de 2026): o laço de repetição de US$ 800.
- As contas da calculadora e das figuras são nossas, com os preços acima e as suposições declaradas no espécime.