Stickybit.← VerificaçãoEnglishIA conferindo IA · verificação · 2026
IA conferindo IA

Nove juízes valem dois votos.

Pôr várias IAs para dar nota ao mesmo trabalho parece prudente: se uma erra, as outras corrigem. Só funciona se elas errarem cada uma do seu jeito. Não erram. Num estudo de 2026, nove juízes de sete famílias de modelos diferentes valeram, juntos, 2,18 votos independentes, e o painel inteiro acertou quase o mesmo que o melhor juiz sozinho.

Espécime · quantos juízes, e o quanto erram juntos
se cada um errasse do seu jeitovotos que o painel vale de verdadeteto, com juízes infinitos
–votos independentes, de fato
–teto, mesmo com juízes infinitos
–o que o próximo juiz acrescenta
–do que se pagou, rendeu

A conta é a mesma que o estudo usa: com n juízes que erram juntos numa proporção φ, o painel vale n ÷ (1 + (n − 1) × φ) votos independentes. Com 9 juízes e φ = 0,391, dá 2,18. O teto, com juízes infinitos, é 1 ÷ φ.

A ideia

Nove pessoas que leram o mesmo resumo.

Imagine um júri de nove pessoas em que todas se informaram pelo mesmo resumo do caso, escrito por alguém que entendeu errado um detalhe. Nove votos, uma opinião. Se o resumo estava errado, as nove erram juntas, e a unanimidade só aumenta a confiança no erro.

Com juízes de IA é parecido. Modelos de fabricantes diferentes aprenderam com textos muito parecidos, de jeitos muito parecidos. Quando um tropeça numa pergunta, os outros tendem a tropeçar na mesma pergunta, para o mesmo lado. É isso que "erram juntos" quer dizer, e é o número que o espécime deixa mexer.

Se eles errassem cada um do seu jeito, somar juízes funcionaria muito bem: a maioria acertaria quase sempre, porque os erros de uns cairiam em perguntas diferentes dos erros de outros. É a promessa de quem monta um painel. O que o estudo fez foi medir se ela se cumpre.

CADA LINHA É UM JUIZ · CADA COLUNA, UMA PERGUNTA Erram cada um do seu jeito Erram juntos erro do juiz coluna em que a maioria errou
Esquema. Em cima, cada juiz erra três perguntas, todas diferentes, e a maioria nunca erra. Embaixo, cada juiz erra as mesmas três, e a maioria erra as três.
O que o estudo mediu

72% contra 71,8%.

O estudo pôs nove juízes, de sete famílias de modelos, para avaliar os mesmos casos em três conjuntos públicos de testes de compreensão de texto, onde a resposta certa é conhecida. Depois mediu o quanto os erros de cada par de juízes caíam juntos: em média, 0,391, numa escala em que 0 é "cada um do seu jeito" e 1 é "sempre juntos". O par mais parecido chegou a 0,603; o mais diferente, 0,161.

Com essa taxa, os nove juízes valem 2,18 votos independentes no primeiro conjunto (entre 2,07 e 2,31), e 2,35 e 2,48 nos outros dois. Paga-se por nove opiniões e recebe-se o equivalente a pouco mais de duas: uma razão de 24,2%.

O efeito aparece no acerto. Se os nove errassem cada um do seu jeito, a maioria deveria acertar 94% das vezes. Acertou 72%. O melhor juiz, sozinho, acertava 71,8%. E as formas mais engenhosas de combinar os votos recuperaram no máximo 11% dessa diferença.

ACERTO NO MESMO CONJUNTO DE CASOS Melhor juiz, sozinho71,8% Painel de nove, medido72% Painel de nove, se errassem cada um do seu jeito 94% os 22 pontos que faltam são o preço de errarem juntos
"Nine Judges, Two Effective Votes" (arXiv, 2026), no primeiro dos três conjuntos de teste. Os oito juízes a mais renderam dois décimos de ponto.
A mesma lição, 40 anos antes

27 programas escritos em separado erraram nos mesmos lugares.

Em 1986, John Knight e Nancy Leveson testaram a ideia que sustenta os painéis: se várias equipes escrevem o mesmo programa sem se falar, os defeitos de uma não devem coincidir com os de outra, e a votação entre versões cobre os erros. Pediram a estudantes de duas universidades 27 versões independentes do mesmo programa e rodaram todas contra um milhão de casos de teste.

As falhas coincidiram muito mais do que o acaso explicaria. Pessoas diferentes, sem contato, tropeçaram nas mesmas partes difíceis do problema. A conclusão deles vale para os juízes de IA de hoje: diversidade de origem não garante diversidade de erro. O ponto difícil é difícil para todo mundo.

O que ajuda de verdade

Um juiz de outra natureza vale mais que mais um do mesmo tipo.

O estudo mostra que, passando de cinco juízes, o ganho de acrescentar outro é desprezível. Trocar de fabricante ajuda pouco, porque os modelos aprenderam de fontes parecidas. O que muda o quadro é trazer um juiz que não erra do mesmo jeito porque não funciona do mesmo jeito:

  1. Uma conta que se refaz

    Se o trabalho tem um número, recalcular o número é um juiz que nenhum modelo de linguagem imita. Soma que não bate é refutação, sem opinião envolvida.

  2. Um dado de fora

    Conferir a citação contra o texto original, o valor contra o registro, o endereço contra o cadastro. A âncora está fora do modelo que gerou.

  3. Um teste que executa

    Código que roda contra casos escritos pela regra, não pelo próprio código. Ele falha por razões que não têm nada a ver com o que o gerador "achou".

  4. Uma pessoa, no lugar certo

    Caro demais para tudo, certo para a acusação. É o degrau de cima da escada abaixo.

A escada que funcionou

O barato absolve. O caro confere a acusação.

No nosso próprio teste, com resumos de leis em que sabíamos quais eram fiéis e quais tinham sido adulterados, a combinação que funcionou não foi empilhar juízes para votar, e sim dar a cada um a decisão em que ele é bom. O método completo está na entrada O barato absolve, do caderno.

Degrau 1 · grátis
Regras fixas e um modelo pequeno

Leem tudo. Quando dizem "fiel", o caso segue: dos 79 adulterados que chegaram ao modelo pequeno, ele não liberou nenhum. Acusa demais, mas quase nunca absolve errado.

Degrau 2 · pago
Um modelo grande, só nas acusações

Revê apenas o que foi acusado. Nas 84 acusações corretas, não mudou nenhuma; nas 13 injustas, desfez 7. Funcionou como tribunal de apelação.

Resultado
Quase 8 vezes mais barato

Com 5% de resumos adulterados no fluxo, a escada sai quase 8 vezes mais barata que mandar tudo para o modelo grande. Inverter a escada, com o barato condenando sozinho, piora o alarme falso e custa mais.

O que fazer

Quatro regras para um painel de IAs.

  1. Conte os votos que o painel vale, não os juízes

    Meça o quanto os seus juízes erram juntos, num conjunto de casos com resposta conhecida. Com esse número, a conta do espécime diz quanto o painel vale, antes de pagar pelo décimo juiz.

  2. Pare em poucos

    Passando de cinco juízes do mesmo tipo, o ganho some. O dinheiro rende mais num juiz de outra natureza do que num sexto modelo.

  3. Unanimidade não é certeza

    Nove IAs concordando pode ser um erro em coro. Trate unanimidade entre juízes parecidos como um voto só, com a confiança de um voto só.

  4. Separe quem absolve de quem condena

    O juiz barato decide o que é claramente bom; a acusação sobe para quem é caro e diferente. Nunca deixe o barato condenar sozinho.

Limites

Onde isso pode enganar.

Um estudo, tarefas de texto

Os números vêm de um estudo em três conjuntos de testes de compreensão de texto. Em outras tarefas, a taxa de erro conjunto pode ser maior ou menor; o que o estudo mostra é que ela não é pequena, e que precisa ser medida.

A conta supõe erros parecidos em todo lugar

A fórmula usa uma taxa média. Na prática, os juízes podem concordar muito nos casos fáceis e se dividir nos difíceis. Por isso a medida certa é no seu próprio conjunto de casos.

A escada foi medida num tipo de trabalho

O "quase 8 vezes mais barato" vale para resumos de lei com 5% de adulteração. Com outra proporção de erros ou outro tipo de conteúdo, a conta muda, e a entrada do caderno mostra como refazê-la.

Juiz de outra natureza também erra

Uma conta refeita só pega erro de conta; um dado externo só pega o que ele registra. Eles não substituem o painel: cobrem o ponto cego dele.

A seção

Para ir mais fundo.

Conversar

Isto se aplica ao seu caso?

Conte em duas linhas o que você precisa decidir ou medir. A primeira conversa serve para ver se a medição resolve o seu caso, e, se não resolve, dizemos.

Conversar pelo WhatsApp algorithms@stickybit.com.br Stickybit · Porto Alegre, desde 2004

← Verificação · stickybit.com.br

Fontes