O resultado herda os defeitos da régua.
Um termômetro que marca sempre 36,5 graus nunca vai acusar febre. O problema não aparece em nenhuma leitura, porque cada leitura parece normal. Só aparece quando alguém põe o termômetro em água quente e vê que ele não sobe.
Com réguas de software, dados e IA é igual. Uma suíte que não consegue falhar fica verde. Um benchmark que confunde ruído com melhoria inventa vencedores. Um painel de IAs que erram parecido concorda consigo mesmo. Nenhum desses defeitos aparece olhando o resultado. Todos aparecem quando se testa a régua de propósito.
Os cinco testes abaixo são esse "pôr em água quente". São baratos perto do que protegem: nenhum exige medição nova do sistema, só usar a régua de um jeito que ela não costuma ser usada.
Comparar o sistema com ele mesmo.
Rode a régua duas vezes sobre a mesma coisa, sem mudar nada. A resposta certa é "não mudou nada". Se a régua declara diferença, ela está lendo o barulho da máquina como notícia, e vai fazer o mesmo quando houver uma mudança de verdade.
Fizemos isso com o coletor de lixo do Go: 198 comparações de um programa com ele mesmo. A regra mais usada nas esteiras, "a média nova passou 5% da antiga?", declarou vencedor em 33 das 198, 16,7%. A regra que olha a faixa inteira contra o limite declarou zero.
- Escolha um caso que você sabe que não mudou: o mesmo código, o mesmo equipamento, a mesma resposta.
- Passe pela régua do jeito normal, duas vezes ou mais, como se fosse uma comparação de verdade.
- Conte quantas vezes ela acusa diferença. Essa é a taxa de alarme falso da régua; tudo abaixo dela é ruído.
Plantar defeitos de propósito.
Faça uma cópia do que está sendo julgado com um erro pequeno e conhecido: trocar um sinal no código, piorar o sistema em 10%, pôr uma resposta errada no meio das certas, medir um item que já se sabe fora da especificação. Passe pela régua. Se ela continua verde, não enxerga aquele tipo de erro.
No espécime da entrada O verde é silêncio, a suíte que costuma vir marcada percebe 5 de 8 defeitos plantados e deixa passar o defeito real. Nas mudanças reais que tentamos auditar, as ferramentas prontas de plantar defeitos quase nunca alcançavam o trecho que a mudança tinha alterado. Por isso vale plantar à mão, onde o risco está.
- Liste três ou quatro erros que doeriam de verdade no seu caso: o limite errado, a conta invertida, o arredondamento.
- Crie uma cópia para cada erro e rode a régua em todas, sem avisar a régua de nada.
- A fração percebida é a nota da régua. Os que passaram verdes são a zona cega dela, e entram no laudo por escrito.
Trocar o sorteio e a ordem.
Muitas réguas têm um pedaço de acaso escondido: a semente do sorteio que estima a margem de erro, a ordem em que os testes rodam, a ordem em que as respostas aparecem para quem dá nota, o dia em que o laudo foi medido. Troque só isso, sem mudar nenhum dado, e veja se o veredito se mexe.
Refizemos 198 comparações com 200 sementes diferentes. 3,6% dos vereditos decididos mudaram de lado sem nenhum dado novo. E o número principal do estudo, 81,6% de diferenças que não sustentavam decisão, oscilou entre 78,9% e 84,2%. O número sobrevive, mas passou a ser citado com a faixa.
- Descubra o que, além do dado, entra na conta: semente, ordem, quem mede, quando.
- Refaça o veredito trocando só isso, algumas dezenas de vezes. Custa minutos de computador.
- Todo veredito que muda está sendo decidido pela moeda. Publique o número com a faixa, e trate esses casos como indecidíveis.
Ver se os juízes erram juntos.
Três testemunhas que leram o mesmo jornal não são três testemunhas. Quando uma régua junta vários juízes (vários testes, várias pessoas, várias IAs), o que importa não é quantos são, e sim o quanto erram de jeitos diferentes.
Um estudo de 2026 mediu nove modelos de IA de sete famílias julgando juntos. Os erros tinham correlação média de 0,391 por par. Na prática, os nove valiam 2,18 votos independentes, e o painel acertava quase o mesmo que o melhor juiz sozinho. Passar de cinco juízes quase não muda isso.
- Separe um conjunto de casos em que você sabe a resposta certa.
- Veja, para cada par de juízes, com que frequência os dois erram no mesmo caso.
- Se erram juntos, conte-os como um só. A página IA conferindo IA faz essa conta para você.
Quem mexe na régua?
Uma prova vale pouco se o aluno pode reescrever o gabarito. Pergunte quem escreveu a régua, quem pode alterá-la e se alguém vê quando ela muda. Teste escrito a partir do próprio código, laudo feito pelo fornecedor, IA dando nota à resposta de um modelo da mesma família: em todos, quem é julgado está segurando a régua.
Medimos o caso mais comum hoje. Uma IA escreveu testes olhando o código de 19 mudanças que sabíamos conter um defeito. Os testes pegaram 0 de 19: registraram o que o código faz, erro incluído. No placar mais usado de agentes de IA que programam, o problema foi registrado no próprio repositório: em algumas montagens, o agente conseguia alterar os testes que o julgariam.
- Escreva quem pode alterar cada peça da régua: testes, limites, dados de referência, instruções do juiz.
- Separe: quem é julgado não altera a régua da própria mudança sem revisão de outra pessoa.
- Trate como alerta automático toda mudança que altera o código e o teste dele juntos.
O que o cartão não pega.
Ele depende de quem responde
O cartão é uma autoavaliação. Uma resposta otimista produz um cartão otimista. Numa auditoria de verdade, cada "sim" vem acompanhado do teste que foi rodado e do resultado.
Passar nos cinco não garante a medida certa
Uma régua pode falhar quando deve, ser estável e independente, e ainda medir a coisa errada: velocidade quando o cliente sente travamento, nota de estilo quando importava a exatidão.
Defeito plantado não é defeito real
Os erros plantados são os que alguém pensou. Os que escapam de verdade costumam morar onde ninguém pensou, e onde nem é fácil testar.
Os números são de casos nossos
33 de 198, 3,6% e 0 de 19 vêm de medições em código aberto e máquina própria. Mostram que os defeitos existem; o tamanho deles no seu caso só aparece medindo o seu caso.
Para usar na prática.
Isto se aplica ao seu caso?
Conte em duas linhas o que você precisa decidir ou medir. A primeira conversa serve para ver se a medição resolve o seu caso, e, se não resolve, dizemos.
← Verificação · stickybit.com.br
- Medições próprias (2026), com previsão e critério de derrota registrados antes: controle do programa contra ele mesmo e as 200 sementes (coletor de lixo do Go, Apple M2, Go 1.26.5); testes gerados por IA para 29 mudanças de dois projetos públicos em Go; tentativa de plantar defeitos em mudanças reais (amostra parcial). Métodos nas entradas Quem decidiu foi o sorteio e O verde é silêncio.
- "Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels" (arXiv, 2026): correlação média de 0,391 entre pares e 2,18 votos efetivos em nove juízes.
- O agente que altera os testes que o julgam: registrado nos issues do repositório do SWE-bench. Reconferência do placar: Wang, Pradel e Liu (arXiv, 2025) e UTBoost (ACL 2025).
- O cartão do topo roda no seu navegador e não envia nada.