Stickybit.EnglishSeção · verificação · 2026
Verificação · vereditos contestáveis

Vereditos que aguentam contestação.

A IA deixou quase de graça produzir relatório, laudo, código e nota de avaliação. Conferir continua caro. Auditamos a régua com que uma decisão é tomada (a suíte de testes, o benchmark, o laudo, o painel de IAs) e devolvemos três respostas, não duas: cumpre, não cumpre ou indecidível, com a margem declarada antes de medir.

Espécime · o mesmo sistema medido 20 vezes, dois laudos

O contrato diz: responder em até 200 ms. Cada medição tem uma margem de erro. Escolha o tempo real do sistema e o ruído da medição.

Laudo de dois valorescompara só o número
Laudo de três valorescompara a faixa
cumprenão cumpreindecidível
–trocas de lado, laudo de dois valores
–trocas de lado, laudo de três valores
–indecidíveis, ditos em voz alta
–margem de cada medição

Simulação: cada medição é a média de 10 execuções com ruído, e a faixa é essa média mais ou menos a margem de erro (95%). "Trocar de lado" é dizer cumpre numa medição e não cumpre na seguinte. Indecidível não conta como troca: é o laudo dizendo que ali a medição não decide.

Antes de tudo

Quatro palavras desta seção.

Régua

O que decide se algo passou: a suíte de testes, o benchmark, o laudo de aceitação, o painel de IAs que dá nota. Quase ninguém confere a régua. →

Três vereditos

Cumpre, não cumpre e indecidível. O terceiro não é defeito do laudo: é ele dizendo onde a medição não resolve. →

Folga

Quanto além da linha o resultado precisa estar para decidir. Declarada antes de medir, protege; escolhida depois, é trapaça. →

Conferir sem abrir

Chegar a um veredito sem ver o dado sigiloso do auditado: por tamanhos, carimbos, contas cifradas ou provas. →

Por que agora

Produzir ficou de graça. Conferir, não.

Um relatório de 40 páginas, um laudo técnico, mil linhas de código, uma nota de avaliação: com IA, cada um sai em minutos, e custa o mesmo sendo certo ou errado. Conferir qualquer um deles ainda exige alguém lendo com atenção, rodando o teste, olhando o dado.

A conta é aritmética. Se produzir fica cem vezes mais barato e conferir custa o mesmo, com a mesma equipe a fração conferida cai cem vezes. Não é descuido de ninguém; é a proporção mudando.

Por isso o valor passou para quem confere. Mas conferir com outra IA tem o mesmo problema: fica barato e perde a validade junto. O que sobra é um juiz de verdade: algo que não depende de quem gerou, que é caro de construir uma vez e barato de rodar sempre.

MESMA EQUIPE DE CONFERÊNCIA Antes quase tudo o que saía era conferido Depois a produção explodiu; o que é conferido continua do mesmo tamanho conferido saiu sem ninguém conferir
Esquema. A equipe que confere não encolheu; a produção é que cresceu em volta dela.
O que entregamos

Três vereditos, não dois.

Quase todo laudo, painel e esteira de testes responde sim ou não. Quando a medição tem margem de erro e o resultado cai perto da linha, esse sim ou não é decidido pelo acaso, e ninguém fica sabendo. O nosso laudo tem uma terceira resposta, e ela diz exatamente onde a medição parou de decidir.

a faixa inteira do lado bom

Cumpre

O resultado, com a margem de erro inteira, está do lado certo do limite, com a folga que foi combinada antes. Aguenta ser medido de novo.

a faixa inteira do lado ruim

Não cumpre

Mesmo no melhor cenário da margem de erro, o limite foi ultrapassado. Aguenta contestação: não há medição razoável que mude isso.

a faixa atravessa a linha

Indecidível

A medição não tem precisão para decidir aqui. É uma resposta, não um defeito: diz que é preciso medir melhor, ou que o contrato não deveria depender disto.

Quando o que se confere é a presença de um problema (um sensor morto, um defeito, uma fraude), os três viram refutado, sem alarme e indecidível. "Sem alarme" nunca é escrito como "aprovado": é o silêncio de um detector, e vale o que o detector vale.

O que já medimos

A régua costuma estar pior que o resultado.

Tudo abaixo é medição nossa, com a previsão e o critério de derrota registrados antes de rodar. Cada número tem uma entrada no caderno com o método completo.

O que é um bom juiz

Quatro condições para a régua valer.

  1. Fica fora de quem gerou

    A régua não pode ser escrita, ajustada ou escolhida por quem vai ser julgado por ela. Teste gerado a partir do código e IA avaliando a própria família falham aqui.

  2. Se apoia em algo que o gerador não controla

    Uma conta que se refaz, um dado externo, uma lei da física, um registro carimbado. Opinião de outra IA não conta: ela erra parecido.

  3. É cara de construir e barata de rodar

    O trabalho está em montar a régua uma vez: os casos de borda, os defeitos plantados, o limite e a folga. Depois ela roda a cada mudança, sem gente.

  4. Tem dono que paga se ela errar

    Uma régua frouxa não custa nada a ninguém até o defeito chegar ao cliente. Se ninguém paga pela frouxidão, ela afrouxa. O laudo diz quem responde por ele.

A seção

Para usar na prática.

Como começa um trabalho

Uma decisão que dói, uma régua de cada vez.

  1. Escolher uma decisão cara

    Liberar uma versão, pagar um fornecedor, aceitar uma obra, aprovar um modelo. Uma decisão em que errar para qualquer lado custa dinheiro.

  2. Achar a régua que decide hoje

    Quase sempre ela já existe: uma suíte, um laudo, um painel, uma planilha. Não começamos construindo; começamos medindo o que está lá.

  3. Medir se ela consegue falhar

    Comparar o sistema com ele mesmo, plantar defeitos, trocar o sorteio, ver se os juízes concordam demais. Cada teste tem página própria aqui.

  4. Entregar o laudo de três valores

    Com o limite e a folga escritos antes, a zona cega declarada e um recibo que um terceiro confere. Se a conta mudar, publicamos a correção.

Limites

O que não fazemos, e onde isso pode enganar.

Não certificamos pelo silêncio

"Nenhum teste falhou" vira "sem alarme", nunca "aprovado". Se a régua não consegue falhar, o laudo diz isso antes de dizer qualquer outra coisa.

Não escolhemos a folga depois

Limite e folga entram no laudo antes do resultado. E o valor certo da folga ainda é uma pergunta aberta: medimos três jeitos de derivá-la, e eles não concordam totalmente.

O indecidível pode ser grande

Num estudo nosso, 81,6% das diferenças que um teste estatístico chamou de "reais" não sustentavam decisão. Um laudo honesto pode sair com muito indecidível, e isso é informação, não fracasso.

Os casos são nossos, não de clientes

As medições desta seção são em dados públicos e próprios. Ainda não publicamos um caso de cliente nesta área; quando houver, ele entra aqui com o mesmo formato.

Conversar

Isto se aplica ao seu caso?

Conte em duas linhas o que você precisa decidir ou medir. A primeira conversa serve para ver se a medição resolve o seu caso, e, se não resolve, dizemos.

Conversar pelo WhatsApp algorithms@stickybit.com.br Stickybit · Porto Alegre, desde 2004

← stickybit.com.br

Fontes