Metade fiel, metade adulterada, e nós sabíamos qual.
Pegamos artigos de leis brasileiras e pedimos a modelos de IA que os resumissem. Para metade, pedimos um resumo fiel. Para a outra metade, pedimos que mudassem o sentido jurídico sem avisar: trocar "proibido" por "permitido", tirar uma exceção, mudar quem tem o direito.
Isso dá uma vantagem rara: a resposta certa não depende da opinião de ninguém, nem de outra IA. Sabíamos qual resumo era qual porque fomos nós que pedimos.
Depois pusemos três conferentes para dizer "fiel" ou "adulterado": regras fixas que comparam palavras-chave, um modelo pequeno que roda de graça no nosso computador e um modelo grande, dos melhores do mercado, pago por uso.
O caro não erra menos que o barato.
Um conferente pode errar de dois jeitos: deixar passar um resumo adulterado ou acusar à toa um resumo fiel. O primeiro erro é o perigoso; o segundo é o que cansa, porque alguém vai ter de conferir de novo.
As regras fixas quase não acusam à toa, mas deixam passar quase metade. O modelo pequeno, somado às regras, pega 97 de cada 100 adulterados. O grande pega todos.
A surpresa está na outra coluna: o grande acusa à toa tanto quanto o pequeno, uns 10 em cada 100 fiéis. Pagar mais não comprou precisão por si só. Então a pergunta deixa de ser "qual conferente é melhor" e passa a ser "quem decide o quê".
Pode liberar sozinho. Nunca condenar sozinho.
O modelo pequeno tem um jeito de errar muito útil: ele acusa demais, mas quase nunca libera o que não devia. Dos 79 resumos adulterados que chegaram até ele, não liberou nenhum. Então, quando ele diz "fiel", dá para confiar e seguir. Isso resolve de graça a maior parte do tráfego, que é de resumos fiéis.
Quando ele diz "adulterado", o caso sobe para o modelo grande. E aqui apareceu o dado que mais nos ensinou: nas 84 acusações corretas, o grande não mudou nenhuma. Nas 13 acusações injustas, desfez 7.
Ou seja: o grande não achou nada que o pequeno tivesse deixado escapar. Ele funcionou como tribunal de apelação, e todo o valor dele foi desfazer acusação injusta.
Invertendo a regra, com o barato condenando sozinho e o caro revendo só o que ele liberou, o alarme falso sobe para 17 em cada 100 fiéis. É pior do que mandar tudo para o caro, e custa mais, porque quase tudo o que o barato faz é liberar.
A regra ganha do sorteio?
Toda regra que manda uma parte dos casos para o conferente caro gasta dinheiro. Então é preciso perguntar: se, em vez da regra, a gente sorteasse a mesma quantidade de casos para o caro, daria no mesmo?
Fizemos o sorteio 4.000 vezes. A regra "o barato libera, o grande confere a acusação" pega todos os adulterados, o que o sorteio não faz. Mas o alarme falso dela, 7,7%, cai dentro da faixa do sorteio. Nessa medida ela não ganha do acaso: não dá para creditar à regra a redução que medimos antes.
A regra que ganha do sorteio nas duas medidas é outra: o grande só entra quando os dois conferentes gratuitos discordam. Pega todos, acusa à toa só 3,6% e chama o grande em 29% dos casos. Ela é a regra marcada no espécime lá em cima.
A regra burra ganhou da nota da IA.
Levamos a mesma pergunta para a revisão de código: o que merece o olho humano primeiro? Pedimos a um modelo pequeno uma nota de risco para 200 mudanças reais, sabendo quais depois precisaram de conserto. A nota acertou praticamente como cara ou coroa. Pior: ela reagiu a haver código na tela, não a qual código era.
A regra que funcionou foi a mais simples possível: o tamanho da mudança. Em 3.358 mudanças de quatro projetos, barrar as que passam de 400 linhas retém 19% delas e junta 36% das que depois deram defeito. É quase o dobro da concentração que se esperaria ao acaso.
Não existe um corte mágico: quanto mais apertado, mais se pega e mais se barra, numa curva sem joelho. Onde cortar é decisão de negócio, e agora ela pode ser tomada com o preço na mesa.
A Meta publicou em 2026 um sistema de revisão com o mesmo desenho, sobre mais de 535 mil mudanças: o conferente automático aprova sozinho os casos de baixo risco e nunca bloqueia sozinho; o resto vai para uma pessoa. É a nossa regra, em outra escala.
Quatro regras para montar a conferência.
Decida o que cada conferente pode fazer sozinho
Não basta escolher a ordem. O barato pode liberar sozinho; condenar, só com confirmação. Na direção errada, a mesma escada fica pior e mais cara.
Use o caro como apelação, não como detetive
Uma segunda IA respondendo à mesma pergunta só desfaz acusação. Para achar o que o barato não acha, o degrau de cima precisa de outra evidência: executar, reproduzir, consultar a fonte.
Faça o sorteio antes de comemorar
Toda regra de encaminhamento tem de ganhar de mandar a mesma quantidade de casos ao acaso. A nossa primeira recomendação não ganhou.
Precifique pela proporção de erros do seu fluxo
Com 5% de resumos adulterados, a melhor regra sai quase 8 vezes mais barata que mandar tudo ao grande. Com metade adulterada, a vantagem encolhe. Mexa na barra do espécime para ver.
Aceitar como fiel um resumo que foi adulterado. É o erro perigoso.
Chamar de adulterado um resumo fiel. Não é perigoso, mas custa: alguém vai conferir de novo, e quem é acusado à toa demais deixa de ser ouvido.
Quantos resumos adulterados existem no lote. Muda tudo na conta de custo, e raramente é o número que se imagina.
Onde isso pode estar errado.
383 casos é pouco
As três melhores regras deram 2,1%, 3,1% e 3,6% de alarme falso. Com essa amostra, essas três são indistinguíveis. Separá-las pede um conjunto maior, que é o próximo passo.
Um assunto só
Todos os casos são resumos de lei brasileira. Em código, contratos ou laudos o padrão de erro de cada conferente pode ser outro.
Tempo não entrou na conta
O modelo pequeno é grátis, mas leva uns 4 segundos por caso no nosso computador. Numa tela em que alguém espera a resposta, a economia pode inverter.
A "prova de indústria" é observacional
O resultado da Meta (1 incidente a cada 50 aprovações) compara casos que o sistema escolheu com casos que ele não tocou. Para saber quanto a revisão humana ainda acrescenta, seria preciso sortear.
← Caderno de pesquisa · stickybit.com.br
- Experimentos próprios, ago–set 2026: 383 resumos (189 adulterados, 194 fiéis) de dispositivos de leis brasileiras; modelos claude-opus-5 e claude-haiku-4-5 como geradores e conferente pago, modelo local de 8B como conferente gratuito. Pré-registrados, custo das rodadas de política US$ 0,00 (reuso dos vereditos já pagos).
- Revisão de código: 3.358 mudanças de quatro projetos de código aberto, defeito atribuído pela mudança que depois o corrigiu.
- Meta, "Automating Low-Risk Code Review at Meta: RADAR", 2026 · Google Mantis (a afirmação "modelos leves para classificar, avançados para análise profunda").