Nove pessoas que leram o mesmo resumo.
Imagine um júri de nove pessoas em que todas se informaram pelo mesmo resumo do caso, escrito por alguém que entendeu errado um detalhe. Nove votos, uma opinião. Se o resumo estava errado, as nove erram juntas, e a unanimidade só aumenta a confiança no erro.
Com juízes de IA é parecido. Modelos de fabricantes diferentes aprenderam com textos muito parecidos, de jeitos muito parecidos. Quando um tropeça numa pergunta, os outros tendem a tropeçar na mesma pergunta, para o mesmo lado. É isso que "erram juntos" quer dizer, e é o número que o espécime deixa mexer.
Se eles errassem cada um do seu jeito, somar juízes funcionaria muito bem: a maioria acertaria quase sempre, porque os erros de uns cairiam em perguntas diferentes dos erros de outros. É a promessa de quem monta um painel. O que o estudo fez foi medir se ela se cumpre.
72% contra 71,8%.
O estudo pôs nove juízes, de sete famílias de modelos, para avaliar os mesmos casos em três conjuntos públicos de testes de compreensão de texto, onde a resposta certa é conhecida. Depois mediu o quanto os erros de cada par de juízes caíam juntos: em média, 0,391, numa escala em que 0 é "cada um do seu jeito" e 1 é "sempre juntos". O par mais parecido chegou a 0,603; o mais diferente, 0,161.
Com essa taxa, os nove juízes valem 2,18 votos independentes no primeiro conjunto (entre 2,07 e 2,31), e 2,35 e 2,48 nos outros dois. Paga-se por nove opiniões e recebe-se o equivalente a pouco mais de duas: uma razão de 24,2%.
O efeito aparece no acerto. Se os nove errassem cada um do seu jeito, a maioria deveria acertar 94% das vezes. Acertou 72%. O melhor juiz, sozinho, acertava 71,8%. E as formas mais engenhosas de combinar os votos recuperaram no máximo 11% dessa diferença.
27 programas escritos em separado erraram nos mesmos lugares.
Em 1986, John Knight e Nancy Leveson testaram a ideia que sustenta os painéis: se várias equipes escrevem o mesmo programa sem se falar, os defeitos de uma não devem coincidir com os de outra, e a votação entre versões cobre os erros. Pediram a estudantes de duas universidades 27 versões independentes do mesmo programa e rodaram todas contra um milhão de casos de teste.
As falhas coincidiram muito mais do que o acaso explicaria. Pessoas diferentes, sem contato, tropeçaram nas mesmas partes difíceis do problema. A conclusão deles vale para os juízes de IA de hoje: diversidade de origem não garante diversidade de erro. O ponto difícil é difícil para todo mundo.
Um juiz de outra natureza vale mais que mais um do mesmo tipo.
O estudo mostra que, passando de cinco juízes, o ganho de acrescentar outro é desprezível. Trocar de fabricante ajuda pouco, porque os modelos aprenderam de fontes parecidas. O que muda o quadro é trazer um juiz que não erra do mesmo jeito porque não funciona do mesmo jeito:
Uma conta que se refaz
Se o trabalho tem um número, recalcular o número é um juiz que nenhum modelo de linguagem imita. Soma que não bate é refutação, sem opinião envolvida.
Um dado de fora
Conferir a citação contra o texto original, o valor contra o registro, o endereço contra o cadastro. A âncora está fora do modelo que gerou.
Um teste que executa
Código que roda contra casos escritos pela regra, não pelo próprio código. Ele falha por razões que não têm nada a ver com o que o gerador "achou".
Uma pessoa, no lugar certo
Caro demais para tudo, certo para a acusação. É o degrau de cima da escada abaixo.
O barato absolve. O caro confere a acusação.
No nosso próprio teste, com resumos de leis em que sabíamos quais eram fiéis e quais tinham sido adulterados, a combinação que funcionou não foi empilhar juízes para votar, e sim dar a cada um a decisão em que ele é bom. O método completo está na entrada O barato absolve, do caderno.
Leem tudo. Quando dizem "fiel", o caso segue: dos 79 adulterados que chegaram ao modelo pequeno, ele não liberou nenhum. Acusa demais, mas quase nunca absolve errado.
Revê apenas o que foi acusado. Nas 84 acusações corretas, não mudou nenhuma; nas 13 injustas, desfez 7. Funcionou como tribunal de apelação.
Com 5% de resumos adulterados no fluxo, a escada sai quase 8 vezes mais barata que mandar tudo para o modelo grande. Inverter a escada, com o barato condenando sozinho, piora o alarme falso e custa mais.
Quatro regras para um painel de IAs.
Conte os votos que o painel vale, não os juízes
Meça o quanto os seus juízes erram juntos, num conjunto de casos com resposta conhecida. Com esse número, a conta do espécime diz quanto o painel vale, antes de pagar pelo décimo juiz.
Pare em poucos
Passando de cinco juízes do mesmo tipo, o ganho some. O dinheiro rende mais num juiz de outra natureza do que num sexto modelo.
Unanimidade não é certeza
Nove IAs concordando pode ser um erro em coro. Trate unanimidade entre juízes parecidos como um voto só, com a confiança de um voto só.
Separe quem absolve de quem condena
O juiz barato decide o que é claramente bom; a acusação sobe para quem é caro e diferente. Nunca deixe o barato condenar sozinho.
Onde isso pode enganar.
Um estudo, tarefas de texto
Os números vêm de um estudo em três conjuntos de testes de compreensão de texto. Em outras tarefas, a taxa de erro conjunto pode ser maior ou menor; o que o estudo mostra é que ela não é pequena, e que precisa ser medida.
A conta supõe erros parecidos em todo lugar
A fórmula usa uma taxa média. Na prática, os juízes podem concordar muito nos casos fáceis e se dividir nos difíceis. Por isso a medida certa é no seu próprio conjunto de casos.
A escada foi medida num tipo de trabalho
O "quase 8 vezes mais barato" vale para resumos de lei com 5% de adulteração. Com outra proporção de erros ou outro tipo de conteúdo, a conta muda, e a entrada do caderno mostra como refazê-la.
Juiz de outra natureza também erra
Uma conta refeita só pega erro de conta; um dado externo só pega o que ele registra. Eles não substituem o painel: cobrem o ponto cego dele.
Para ir mais fundo.
Isto se aplica ao seu caso?
Conte em duas linhas o que você precisa decidir ou medir. A primeira conversa serve para ver se a medição resolve o seu caso, e, se não resolve, dizemos.
← Verificação · stickybit.com.br
- "Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels" (arXiv, 2026): taxa média de erro conjunto 0,391 (0,161 a 0,603) entre nove juízes de sete famílias; 2,18 votos efetivos [2,07 a 2,31] no MNLI, 2,35 no SNLI e 2,48 no AlphaNLI; painel 72% contra 71,8% do melhor juiz; 94% previstos sob independência; combinação sofisticada recupera no máximo 11% da diferença; ganho desprezível além de cinco juízes.
- Knight, J. C. e Leveson, N. G., "An Experimental Evaluation of the Assumption of Independence in Multiversion Programming", IEEE Transactions on Software Engineering, 1986: 27 versões, duas universidades, um milhão de casos de teste.
- A escada: medição própria de 2026, descrita em O barato absolve.
- O espécime usa a fórmula de votos efetivos do estudo: n ÷ (1 + (n − 1) × φ). Conta de conferência: 9 ÷ (1 + 8 × 0,391) = 9 ÷ 4,128 = 2,18.