Stickybit← CadernoMedição · IA conferindo IA · 28 set 2026
Medição

O barato absolve, o caro confere a acusação.

Quando uma IA confere o trabalho de outra, quem pode decidir o quê? Testamos com 383 resumos de leis, metade adulterada de propósito. O conferente pequeno e gratuito pode liberar sozinho. Nunca pode condenar sozinho. E o grande, que custa, serve para uma coisa só: desfazer acusação injusta.

Espécime · 1.000 resumos passando pela conferência
fiel, liberadoadulterado, barradofiel, acusado à toaadulterado que passoufoi ao modelo grande
0adulterados que passaram
0fiéis acusados à toa
0casos no modelo grande
0custo por mil resumos

As taxas de cada regra são as medidas nos 383 resumos; aqui elas são aplicadas a 1.000 resumos imaginários. O preço é o do modelo grande que usamos, US$ 4,51 por mil conferências; os gratuitos rodam no nosso próprio computador.

O teste

Metade fiel, metade adulterada, e nós sabíamos qual.

Pegamos artigos de leis brasileiras e pedimos a modelos de IA que os resumissem. Para metade, pedimos um resumo fiel. Para a outra metade, pedimos que mudassem o sentido jurídico sem avisar: trocar "proibido" por "permitido", tirar uma exceção, mudar quem tem o direito.

Isso dá uma vantagem rara: a resposta certa não depende da opinião de ninguém, nem de outra IA. Sabíamos qual resumo era qual porque fomos nós que pedimos.

Depois pusemos três conferentes para dizer "fiel" ou "adulterado": regras fixas que comparam palavras-chave, um modelo pequeno que roda de graça no nosso computador e um modelo grande, dos melhores do mercado, pago por uso.

artigo de lei resumo fiel"resuma sem mudar" adulterado"mude o sentido" regras fixasgrátis modelo pequenográtis, roda aqui modelo grandeUS$ 4,51 por mil cada um diz:fiel ou adulterado nós sabemos a resposta
Os três conferentes olham o mesmo resumo contra o mesmo artigo de lei. Só o último custa dinheiro.
Cada um sozinho

O caro não erra menos que o barato.

Um conferente pode errar de dois jeitos: deixar passar um resumo adulterado ou acusar à toa um resumo fiel. O primeiro erro é o perigoso; o segundo é o que cansa, porque alguém vai ter de conferir de novo.

As regras fixas quase não acusam à toa, mas deixam passar quase metade. O modelo pequeno, somado às regras, pega 97 de cada 100 adulterados. O grande pega todos.

A surpresa está na outra coluna: o grande acusa à toa tanto quanto o pequeno, uns 10 em cada 100 fiéis. Pagar mais não comprou precisão por si só. Então a pergunta deixa de ser "qual conferente é melhor" e passa a ser "quem decide o quê".

100 ADULTERADOS100 FIÉISSó regras fixas· grátis56barrados5acusados à toaRegras + modelo pequeno· grátis97barrados9acusados à toaSó o modelo grande· US$ 4,51 por mil100barrados10acusados à toa
Cada quadradinho é um resumo. À esquerda, 100 adulterados: preenchido é barrado, vazado é o que passou. À direita, 100 fiéis: os coloridos foram acusados à toa. Números arredondados das taxas medidas.
A regra

Pode liberar sozinho. Nunca condenar sozinho.

O modelo pequeno tem um jeito de errar muito útil: ele acusa demais, mas quase nunca libera o que não devia. Dos 79 resumos adulterados que chegaram até ele, não liberou nenhum. Então, quando ele diz "fiel", dá para confiar e seguir. Isso resolve de graça a maior parte do tráfego, que é de resumos fiéis.

Quando ele diz "adulterado", o caso sobe para o modelo grande. E aqui apareceu o dado que mais nos ensinou: nas 84 acusações corretas, o grande não mudou nenhuma. Nas 13 acusações injustas, desfez 7.

Ou seja: o grande não achou nada que o pequeno tivesse deixado escapar. Ele funcionou como tribunal de apelação, e todo o valor dele foi desfazer acusação injusta.

Invertendo a regra, com o barato condenando sozinho e o caro revendo só o que ele liberou, o alarme falso sobe para 17 em cada 100 fiéis. É pior do que mandar tudo para o caro, e custa mais, porque quase tudo o que o barato faz é liberar.

resumo modelo pequenográtis "parece fiel""parece adulterado" liberadosem gastar nada modelo grandeconfere a acusação confirma: barra84 de 84 acusaçõescorretas desfaz7 de 13injustas dos 79 adulterados quechegaram ao pequeno,ele liberou nenhum
O caminho de um resumo pela regra que funcionou. O modelo grande só vê o que foi acusado, e decide se a acusação fica de pé.
O controle que faltava

A regra ganha do sorteio?

Toda regra que manda uma parte dos casos para o conferente caro gasta dinheiro. Então é preciso perguntar: se, em vez da regra, a gente sorteasse a mesma quantidade de casos para o caro, daria no mesmo?

Fizemos o sorteio 4.000 vezes. A regra "o barato libera, o grande confere a acusação" pega todos os adulterados, o que o sorteio não faz. Mas o alarme falso dela, 7,7%, cai dentro da faixa do sorteio. Nessa medida ela não ganha do acaso: não dá para creditar à regra a redução que medimos antes.

A regra que ganha do sorteio nas duas medidas é outra: o grande só entra quando os dois conferentes gratuitos discordam. Pega todos, acusa à toa só 3,6% e chama o grande em 29% dos casos. Ela é a regra marcada no espécime lá em cima.

O barato libera, o grande confere a acusaçãogrande em 26% dos casossorteio7,7%O grande só entra quando os gratuitos discordamgrande em 29% dos casossorteio3,6%0%2%4%6%8%10%12%14%fiéis acusados à toa →
A faixa cinza é onde caiu o alarme falso em 95% dos 4.000 sorteios, gastando o mesmo com o modelo grande. Um ponto dentro da faixa não se distingue do acaso.
E na revisão de código?

A regra burra ganhou da nota da IA.

Levamos a mesma pergunta para a revisão de código: o que merece o olho humano primeiro? Pedimos a um modelo pequeno uma nota de risco para 200 mudanças reais, sabendo quais depois precisaram de conserto. A nota acertou praticamente como cara ou coroa. Pior: ela reagiu a haver código na tela, não a qual código era.

A regra que funcionou foi a mais simples possível: o tamanho da mudança. Em 3.358 mudanças de quatro projetos, barrar as que passam de 400 linhas retém 19% delas e junta 36% das que depois deram defeito. É quase o dobro da concentração que se esperaria ao acaso.

Não existe um corte mágico: quanto mais apertado, mais se pega e mais se barra, numa curva sem joelho. Onde cortar é decisão de negócio, e agora ela pode ser tomada com o preço na mesa.

A Meta publicou em 2026 um sistema de revisão com o mesmo desenho, sobre mais de 535 mil mudanças: o conferente automático aprova sozinho os casos de baixo risco e nunca bloqueia sozinho; o resto vai para uma pessoa. É a nossa regra, em outra escala.

mudanças barradasdefeitos pegos
100 linhas
47,8%
69,4%
200 linhas
33,3%
54,2%
400 linhasnosso padrão
19,0%
36,2%
800 linhas
9,4%
19,8%
Limite de tamanho por mudança (linhas alteradas). Com 400 linhas, 19% barradas juntam 36% dos defeitos. Medido como classificação: não observamos o que aconteceria se as mudanças grandes fossem de fato quebradas em menores.
O que decidimos

Quatro regras para montar a conferência.

  1. Decida o que cada conferente pode fazer sozinho

    Não basta escolher a ordem. O barato pode liberar sozinho; condenar, só com confirmação. Na direção errada, a mesma escada fica pior e mais cara.

  2. Use o caro como apelação, não como detetive

    Uma segunda IA respondendo à mesma pergunta só desfaz acusação. Para achar o que o barato não acha, o degrau de cima precisa de outra evidência: executar, reproduzir, consultar a fonte.

  3. Faça o sorteio antes de comemorar

    Toda regra de encaminhamento tem de ganhar de mandar a mesma quantidade de casos ao acaso. A nossa primeira recomendação não ganhou.

  4. Precifique pela proporção de erros do seu fluxo

    Com 5% de resumos adulterados, a melhor regra sai quase 8 vezes mais barata que mandar tudo ao grande. Com metade adulterada, a vantagem encolhe. Mexa na barra do espécime para ver.

Três palavras deste texto
Deixar passar

Aceitar como fiel um resumo que foi adulterado. É o erro perigoso.

Acusar à toa

Chamar de adulterado um resumo fiel. Não é perigoso, mas custa: alguém vai conferir de novo, e quem é acusado à toa demais deixa de ser ouvido.

Proporção de erros

Quantos resumos adulterados existem no lote. Muda tudo na conta de custo, e raramente é o número que se imagina.

O que ainda não sabemos

Onde isso pode estar errado.

383 casos é pouco

As três melhores regras deram 2,1%, 3,1% e 3,6% de alarme falso. Com essa amostra, essas três são indistinguíveis. Separá-las pede um conjunto maior, que é o próximo passo.

Um assunto só

Todos os casos são resumos de lei brasileira. Em código, contratos ou laudos o padrão de erro de cada conferente pode ser outro.

Tempo não entrou na conta

O modelo pequeno é grátis, mas leva uns 4 segundos por caso no nosso computador. Numa tela em que alguém espera a resposta, a economia pode inverter.

A "prova de indústria" é observacional

O resultado da Meta (1 incidente a cada 50 aprovações) compara casos que o sistema escolheu com casos que ele não tocou. Para saber quanto a revisão humana ainda acrescenta, seria preciso sortear.

← Caderno de pesquisa · stickybit.com.br

Fontes