Stickybit← CadernoConta · custo de IA · 28 set 2026
Conta

Menos tokens não é menos custo.

Um modelo novo promete "a mesma qualidade com 40% menos tokens". Parece 40% mais barato. Numa pergunta única e difícil, quase é. Num agente que conversa quinze vezes com o modelo para terminar uma tarefa, a economia vira uma fração disso, porque o que pesa na conta não é o que o modelo escreve: é o que você manda para ele a cada rodada.

Espécime · quanto custa uma tarefa de um agente
entrada: o que você mandasaída: o que ele escreveo que os 40% cortam
–custo por tarefa hoje
–com o modelo que pensa menos
–economia de dinheiro, de verdade
–espera a menos escrevendo

Preços usados pela própria Fireworks: US$ 3 por milhão de tokens de entrada, US$ 0,30 com cache, US$ 15 por milhão de saída. Suposições nossas: cada rodada acrescenta mil tokens ao histórico (a resposta visível e o que as ferramentas devolveram), o raciocínio não é reenviado, e o modelo escreve uns 80 tokens por segundo.

Antes da conta

Quatro palavras que decidem a fatura.

Token

Pedaço de palavra que o modelo lê ou escreve. "Contratação" vira uns três. É a unidade em que tudo é cobrado.

Entrada

Tudo o que você manda ao modelo a cada chamada: instruções, o histórico da conversa, documentos, o que as ferramentas devolveram.

Saída

Tudo o que o modelo escreve, incluindo o raciocínio que ele faz antes de responder. Costuma custar cinco vezes mais por token que a entrada.

Cache

Desconto para trechos repetidos que o provedor já viu em chamadas anteriores. Aqui, 90% mais barato. Barato não é grátis: é cobrado de novo a cada chamada.

O que prometeram

"40% menos" é a média boa.

Em setembro, a Fireworks lançou o Ember-1: um modelo aberto (o Kimi K3) treinado de novo para raciocinar mais curto. A promessa é "a qualidade do K3 com 40% menos tokens".

A tabela da própria Fireworks, em cinco testes públicos, mostra reduções de 5,9% a 51,9%. A do meio é 23,7%. No teste mais parecido com um atendimento real, um agente de companhia aérea, a redução foi de 5,9%. O número de 40% vem de um índice interno e de um teste com um cliente sem nome, em que a resposta caiu de 49,3 mil para 29,9 mil tokens com nota praticamente igual (0,753 contra 0,751).

Nada disso é mentira. É que "40% menos tokens" fala de um tipo de token, o que o modelo escreve. A conta que você paga tem dois.

promessa: 40%teste do meio: 23,7%
Tarefas de terminalTerminal Bench 2.1
51,9%
Programação com conversaSWE-Interact
32,5%
Programação longaDeepSWE 1.1
23,7%
Corrigir bugs reaisSWE-bench Verified
15,5%
Atendimento aéreoτ²-Bench
5,9%
Redução de tokens escritos pelo modelo em cada teste, contra o modelo de origem. Números da Fireworks, uma rodada por teste; os testes têm de 50 a 500 tarefas.
TesteTarefasAcerto antesAcerto Ember-1Tokens a menos
Tarefas de terminal (Terminal Bench 2.1)8980,9%82,0%51,9%
Programação com conversa (SWE-Interact)7521,3%20,0%32,5%
Programação longa (DeepSWE 1.1)11366,4%75,2%23,7%
Corrigir bugs reais (SWE-bench Verified)50093,2%92,2%15,5%
Atendimento de companhia aérea (τ²-Bench)5064%66%5,9%

A qualidade se manteve: quatro das cinco diferenças de acerto são de uma tarefa para mais ou para menos, o que é ruído. A única diferença grande (DeepSWE, +8,8 pontos) não passa num teste estatístico simples. "A mesma qualidade" está sustentado; "melhorou", não.

Por que a entrada manda

Cada rodada reenvia tudo.

Um agente é um programa que conversa com o modelo várias vezes para terminar uma tarefa: pergunta, chama uma ferramenta, lê o resultado, pergunta de novo. O modelo não guarda memória entre chamadas. Então a cada rodada o agente reenvia tudo: as instruções, os documentos e o histórico inteiro até ali.

O histórico cresce a cada rodada, e o que foi mandado na primeira é pago de novo na segunda, na terceira, na décima quinta. O que o modelo escreve em cada rodada fica mais ou menos do mesmo tamanho. Com poucas rodadas, a saída domina; com muitas, a entrada engole a conta.

O cache ajuda: o trecho que se repete sai 90% mais barato. Mas ele barateia a repetição, não perdoa um contexto inchado. E um modelo que "pensa menos" não toca em nada disso: ele corta só a faixa estreita de cima.

RODADA16 mil entram28,5 mil entram311 mil entram413,5 mil entram516 mil entram618,5 mil entramSomando as seis: 73,5 mil tokens de entrada, 12 mil de saída.instruções e documentoshistóricosaídaos 40% cortados
Seis rodadas de um agente. A parte cinza e a azul-clara são entrada, reenviada toda vez; a escura é o que o modelo escreve. O corte de 40% atinge só a parte escura.
Onde vale de verdade

Pergunta curta, resposta difícil.

Os dois exemplos do espécime lá em cima, com os preços da Fireworks, mostram os dois extremos.

Uma pergunta difícil (classificar um caso complicado, resolver uma conta, planejar): uma rodada, pouca entrada, muito raciocínio. Quase todo o custo é saída, e cortar 40% dela economiza 39% do custo. A promessa se cumpre quase inteira.

Um atendimento de 15 rodadas, com instruções longas, histórico crescendo e cache: a mesma troca de modelo economiza 17%. E isso supondo o corte de 40%, quando o teste de atendimento da própria Fireworks mediu 5,9%.

Existe um ganho que a conta de dinheiro não mostra: tempo. O modelo escreve token por token, então escrever menos é responder antes. Quando alguém está esperando na tela, isso pode valer mais que o dinheiro.

Uma pergunta difícil1 rodada · 2 mil de entrada · 20 mil escritosentrada US$ 0,01 · saída US$ 0,30economia: 39%Atendimento15 rodadas · 12 mil reenviados · 80% com cache · 800 escritosentrada US$ 0,24 · saída US$ 0,18economia: 17%
De onde vem o custo de cada tarefa, e quanto dele o modelo que pensa 40% menos consegue cortar. Contas nossas com os preços da Fireworks.
O preço de tabela não é o custo

O token mais barato perdeu a tarefa.

A IBM mediu 417 tarefas de agente com dois modelos. O que tinha o token mais barato custou quase o dobro por tarefa: US$ 155 contra US$ 79. O motivo é o mesmo desta página: em trabalho de agente, a entrada se repete, e quem aproveita melhor o cache ganha a conta, não quem tem a etiqueta menor.

O mesmo vale ao contrário. Um modelo pode ter token barato e gastar muito mais tokens para chegar à resposta, ou precisar de mais rodadas. O preço que importa é o custo por tarefa terminada, medido no seu próprio uso, com o mesmo nível de esforço dos dois lados.

E o pior gasto não aparece em nenhuma tabela: o agente que entra em laço. Um caso brasileiro publicado em agosto: uma API devolveu dado quebrado, o agente tentou de novo sem parar, e cada tentativa levava o erro anterior no histórico. A primeira custou mil tokens; a décima quinta, vinte mil. A sessão de um único usuário custou US$ 800.

GPT-4.1· token mais baratoUS$ 155Claude Sonnet· token mais caroUS$ 79custo total das 417 tarefas
Custo total das mesmas 417 tarefas de agente (IBM Research, julho de 2026). A ordem por preço de token e a ordem por custo de tarefa se invertem.
O que fazer

Quatro regras para a conta de um agente.

  1. Meça custo por tarefa, não por token

    Some entrada, cache, saída e rodadas de uma tarefa terminada. É o único número que compara modelos, versões e fornecedores de forma honesta.

  2. Olhe a entrada primeiro

    Quantas rodadas, quanto se reenvia em cada uma, quanto pega cache. Em agente, é aí que está a maior parte do dinheiro, e é aí que um bom desenho economiza.

  3. Corte raciocínio onde a saída domina

    Uma rodada, pergunta curta, resposta difícil; ou quando alguém espera a resposta na tela. Fora disso, um modelo que "pensa menos" muda pouco a fatura.

  4. Ponha teto antes de ligar

    Limite de rodadas e de tokens por tarefa, aplicado antes da chamada, não descoberto depois na fatura. Um laço de repetição cresce mais rápido que a sua capacidade de perceber.

O que ainda não sabemos

Onde isso pode estar errado.

A calculadora é um modelo simples

Supomos que o histórico cresce mil tokens por rodada e que o raciocínio não é reenviado. Agentes reais variam muito; a conta certa é a do seu uso, medido chamada a chamada.

Os números do Ember-1 são deles

Uma rodada por teste, de 50 a 500 tarefas, e o teste com cliente não diz quem é o cliente nem qual é a tarefa. Os pesos não foram liberados para medirmos.

Preço muda toda semana

Na mesma semana do lançamento saíram o GPT-6 Sol e o Claude Opus 5.5, com corte de preço. A proporção entre entrada e saída pode mudar, e com ela a conta inteira.

Cada fornecedor conta tokens de um jeito

Alguns cobram o raciocínio junto com a saída, outros separado; o cache tem tarifa própria e regras diferentes. Comparar sem normalizar isso mede a tabela, não o custo.

← Caderno de pesquisa · stickybit.com.br

Fontes