Quatro palavras desta seção.
O que decide se algo passou: a suíte de testes, o benchmark, o laudo de aceitação, o painel de IAs que dá nota. Quase ninguém confere a régua. →
Cumpre, não cumpre e indecidível. O terceiro não é defeito do laudo: é ele dizendo onde a medição não resolve. →
Quanto além da linha o resultado precisa estar para decidir. Declarada antes de medir, protege; escolhida depois, é trapaça. →
Chegar a um veredito sem ver o dado sigiloso do auditado: por tamanhos, carimbos, contas cifradas ou provas. →
Produzir ficou de graça. Conferir, não.
Um relatório de 40 páginas, um laudo técnico, mil linhas de código, uma nota de avaliação: com IA, cada um sai em minutos, e custa o mesmo sendo certo ou errado. Conferir qualquer um deles ainda exige alguém lendo com atenção, rodando o teste, olhando o dado.
A conta é aritmética. Se produzir fica cem vezes mais barato e conferir custa o mesmo, com a mesma equipe a fração conferida cai cem vezes. Não é descuido de ninguém; é a proporção mudando.
Por isso o valor passou para quem confere. Mas conferir com outra IA tem o mesmo problema: fica barato e perde a validade junto. O que sobra é um juiz de verdade: algo que não depende de quem gerou, que é caro de construir uma vez e barato de rodar sempre.
Três vereditos, não dois.
Quase todo laudo, painel e esteira de testes responde sim ou não. Quando a medição tem margem de erro e o resultado cai perto da linha, esse sim ou não é decidido pelo acaso, e ninguém fica sabendo. O nosso laudo tem uma terceira resposta, e ela diz exatamente onde a medição parou de decidir.
Cumpre
O resultado, com a margem de erro inteira, está do lado certo do limite, com a folga que foi combinada antes. Aguenta ser medido de novo.
Não cumpre
Mesmo no melhor cenário da margem de erro, o limite foi ultrapassado. Aguenta contestação: não há medição razoável que mude isso.
Indecidível
A medição não tem precisão para decidir aqui. É uma resposta, não um defeito: diz que é preciso medir melhor, ou que o contrato não deveria depender disto.
Quando o que se confere é a presença de um problema (um sensor morto, um defeito, uma fraude), os três viram refutado, sem alarme e indecidível. "Sem alarme" nunca é escrito como "aprovado": é o silêncio de um detector, e vale o que o detector vale.
A régua costuma estar pior que o resultado.
Tudo abaixo é medição nossa, com a previsão e o critério de derrota registrados antes de rodar. Cada número tem uma entrada no caderno com o método completo.
comparações de um programa com ele mesmo em que a regra mais usada nas esteiras declarou um vencedor.
Caderno · Quem decidiu foi o sorteio 3,6%dos vereditos decididos mudaram só trocando a semente do sorteio, sem nenhum dado novo.
Caderno · Quem decidiu foi o sorteio 0 de 19defeitos reais pegos por testes que uma IA escreveu olhando o código. O teste nasce concordando com o erro.
Caderno · O verde é silêncio 2,18votos independentes, de fato, num painel de nove IAs julgando juntas. Elas erram parecido.
Estudo de 2026 · IA conferindo IA 100%das comparações, no trecho em que o robô se mexia, em que um detector de anomalias achou o sensor morto mais normal que o vivo.
Caderno · Julgue o que vaza AbsolveA IA barata pode liberar sozinha o que não tem problema. Nunca condenar sozinha. A acusação vai para quem é caro.
Caderno · O barato absolveQuatro condições para a régua valer.
Fica fora de quem gerou
A régua não pode ser escrita, ajustada ou escolhida por quem vai ser julgado por ela. Teste gerado a partir do código e IA avaliando a própria família falham aqui.
Se apoia em algo que o gerador não controla
Uma conta que se refaz, um dado externo, uma lei da física, um registro carimbado. Opinião de outra IA não conta: ela erra parecido.
É cara de construir e barata de rodar
O trabalho está em montar a régua uma vez: os casos de borda, os defeitos plantados, o limite e a folga. Depois ela roda a cada mudança, sem gente.
Tem dono que paga se ela errar
Uma régua frouxa não custa nada a ninguém até o defeito chegar ao cliente. Se ninguém paga pela frouxidão, ela afrouxa. O laudo diz quem responde por ele.
Para usar na prática.
Uma decisão que dói, uma régua de cada vez.
Escolher uma decisão cara
Liberar uma versão, pagar um fornecedor, aceitar uma obra, aprovar um modelo. Uma decisão em que errar para qualquer lado custa dinheiro.
Achar a régua que decide hoje
Quase sempre ela já existe: uma suíte, um laudo, um painel, uma planilha. Não começamos construindo; começamos medindo o que está lá.
Medir se ela consegue falhar
Comparar o sistema com ele mesmo, plantar defeitos, trocar o sorteio, ver se os juízes concordam demais. Cada teste tem página própria aqui.
Entregar o laudo de três valores
Com o limite e a folga escritos antes, a zona cega declarada e um recibo que um terceiro confere. Se a conta mudar, publicamos a correção.
O que não fazemos, e onde isso pode enganar.
Não certificamos pelo silêncio
"Nenhum teste falhou" vira "sem alarme", nunca "aprovado". Se a régua não consegue falhar, o laudo diz isso antes de dizer qualquer outra coisa.
Não escolhemos a folga depois
Limite e folga entram no laudo antes do resultado. E o valor certo da folga ainda é uma pergunta aberta: medimos três jeitos de derivá-la, e eles não concordam totalmente.
O indecidível pode ser grande
Num estudo nosso, 81,6% das diferenças que um teste estatístico chamou de "reais" não sustentavam decisão. Um laudo honesto pode sair com muito indecidível, e isso é informação, não fracasso.
Os casos são nossos, não de clientes
As medições desta seção são em dados públicos e próprios. Ainda não publicamos um caso de cliente nesta área; quando houver, ele entra aqui com o mesmo formato.
Isto se aplica ao seu caso?
Conte em duas linhas o que você precisa decidir ou medir. A primeira conversa serve para ver se a medição resolve o seu caso, e, se não resolve, dizemos.
- Medições próprias (2026), com previsão e critério de derrota registrados antes: controle do programa contra ele mesmo e a auditoria das 200 sementes (coletor de lixo do Go, Apple M2); testes gerados por IA para 29 mudanças em dois projetos públicos em Go; detector de anomalias no conjunto público ALOHA do LeRobot. Métodos completos nas entradas do caderno ligadas acima.
- Nove juízes, dois votos efetivos: "Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels" (arXiv, 2026). Detalhes em IA conferindo IA.
- O espécime do topo é uma simulação no navegador: 20 medições, cada uma a média de 10 execuções com ruído gaussiano, margem de 95%.