Como procurar no fichário sem pular gaveta.
Imagine uma biblioteca com o fichário organizado por assunto, uma gaveta por tema. Você pede "tudo o que for parecido com este livro". O atendente apressado abre só as duas gavetas mais prováveis. Na maioria das vezes dá certo. Às vezes um livro que servia estava na gaveta vizinha, e ninguém fica sabendo.
O SIEVE sabe duas coisas sobre cada gaveta: onde fica o centro dela e qual é o livro mais distante desse centro. Com isso ele consegue dizer, sem abrir, "nesta gaveta não pode haver nada que sirva". Descarta essas e abre as outras. Às vezes abre mais gavetas que o atendente apressado, mas no fim pode afirmar que não sobrou nenhum.
É isso que os índices de busca de mercado não dão: eles devolvem os resultados sem dizer quantos verdadeiros ficaram para trás.
O "não achei" silencioso é um risco.
Os índices de busca por parecido do mercado (os que estão por trás de Qdrant, Weaviate, pgvector, Milvus e Pinecone) são aproximados e silenciosos. Medimos o mais usado deles com 40 mil itens: dependendo do ajuste de velocidade, ele acha de 56% a 97% dos 10 vizinhos certos, e não avisa quando perde.
Para recomendar um filme, tudo bem. Para conferir se um cliente está numa lista de sanções, achar fraudes parecidas com uma já conhecida, deduplicar cadastros, buscar patentes anteriores ou auditar o que uma IA consultou, um resultado esquecido é prejuízo que ninguém pode assinar.
Os métodos novos de 2026 já prometem um nível de acerto, mas por estimativa. Um deles (DARTH, 2026) relata que cerca de 13% das buscas ficam abaixo do nível prometido, e o índice não sabe quais.
Três peneiras, nenhuma que engana.
1. Gavetas. Os itens são agrupados em regiões, e o SIEVE guarda o centro e o tamanho de cada uma. Uma região inteira sai da conta se até o ponto mais próximo dela estiver fora do raio. Uma região inteira entra sem conferir item por item se até o ponto mais distante dela estiver dentro.
2. Sombra. Para os itens que sobram, o SIEVE olha primeiro uma "sombra" deles, uma versão com bem menos números. A distância na sombra nunca é maior que a verdadeira. Então, se até a sombra está longe, o item está longe, e a conta completa é pulada.
3. Conta completa. Só o que passou nas duas peneiras tem a distância calculada inteira. Por isso o pior caso do SIEVE é a busca completa, nunca uma resposta incompleta.
Nada disso usa estimativa, amostra ou nível de confiança. É geometria, e é conferido em teste contra a busca completa em todas as configurações.
Mais rápido que olhar tudo, mas não de graça.
No conjunto público SIFT1M (1 milhão de descrições de imagem, 128 números cada), a busca completa leva 109 ms por consulta. O SIEVE na configuração mais rápida leva 16,4 ms, 6,3× menos, sem deixar nenhum resultado de fora. Lendo do disco em vez da memória, a vantagem foi de 7,2×.
Também publicamos o que não deu certo. A primeira versão, com 50 mil itens em memória, só empatou com a busca completa: a promessa inicial de "4 a 8× mais rápido" não se confirmou nesse tamanho.
E medimos como o custo cresce com o tamanho da base. De 100 mil para 1 milhão de itens, as contas completas crescem devagar (proporcional a N0,41, parecido com os índices aproximados), mas o trabalho barato das peneiras cresce quase na proporção da base (N0,94). Na prática: a vantagem encolhe em bases muito grandes, e o SIEVE não tem hoje o mesmo custo dos índices aproximados em escala. O próximo passo é uma peneira em camadas.
| Medição | Resultado | Na prática |
|---|---|---|
| SIFT1M em memória, configuração atual | 16,4 ms × 109 ms | 6,3× mais rápido que olhar tudo, nenhum resultado de fora |
| SIFT1M lendo do disco | 7,2× · 1.215× menos leitura | a organização por gaveta no disco é o que paga |
| 50 mil itens em memória, primeira versão | ≈ empate | a promessa de 4–8× não se confirmou; publicado assim |
| Crescimento, 100 mil → 1 milhão | contas completas ∝ N0,41 · trabalho total ∝ N0,94 | em bases de centenas de milhões, o custo cresce quase na proporção do tamanho |
| Dado difícil (GIST, 960 números) | ≈ 75% vão à conta completa | vira uma busca completa com prova: a garantia fica, a velocidade não |
| Contas em precisão de 32 bits (SIMD) | recheck em 0,008% dos casos | perto da borda do raio, confere em precisão dupla; ver o Caderno |
Achar todos muda o que dá para afirmar.
Afirmar ausência. "Nenhum registro passou do limite" vira uma resposta provada, não um "não encontrei". É a frase que compliance e perícia precisam.
Pegar agentes de IA em círculo. Modelos de raciocínio às vezes entram em espiral, repetindo ideias até esgotar a memória. Em 26 traços reais rotulados, a busca do SIEVE pegou os três tipos de repetição (literal, alternada e reescrita com outras palavras) sem nenhum alarme falso nos 8 traços normais. Os detectores baratos erraram um tipo cada. Veja a análise completa.
Resumir a vizinhança com prova. Combinado com o CLAMP, dá para perguntar "qual a temperatura média dos casos parecidos com este?" e receber uma faixa garantida: em dado real, 327 de 327 respostas contiveram o valor certo.
| Tipo de repetição | Repetição de palavras | Surpresa | SIEVE |
|---|---|---|---|
| Literal ("Wait. Wait.") | 6/6 | 6/6 | 6/6 |
| Alternada (A·B·A·B) | 6/6 | 0/6 | 6/6 |
| Reescrita | 0/6 | 6/6 | 6/6 |
| Normais com alarme falso | 0/8 | 2/8 | 0/8 |
Quando esquecer um resultado custa caro.
Encaixa bem
- Conformidade e sanções: conferir nomes e empresas contra listas oficiais, com prova de que nada escapou.
- Perícia e fraude: achar todos os casos parecidos com um padrão conhecido.
- Deduplicação e patentes: onde um parecido esquecido vira retrabalho ou processo.
- Auditoria de IA: provar o que um assistente consultou e o que não havia para consultar.
Não é a melhor escolha
- Recomendação e busca de produto, onde achar 95% basta: um índice aproximado é mais barato.
- Bases de centenas de milhões de itens, até a peneira em camadas ficar pronta: o custo cresce quase na proporção do tamanho.
- Dados com muitas dimensões independentes (como o GIST): as peneiras descartam pouco e sobra a busca completa com prova.
O que o SIEVE promete e o que não.
Nenhum resultado de fora
Todo item dentro do raio aparece, ou os 10 mais próximos exatos. Conferido em teste contra a busca completa; um erro reprova.
Só descarta o impossível
Cada peneira usa uma conta que nunca exagera a distância real. O que ela não consegue decidir, passa adiante.
A velocidade é medida, não prometida
Publicamos o ganho (6,3× em 1 milhão) e o empate da primeira versão, com o mesmo destaque.
O custo cresce e está dito
Em bases maiores o trabalho cresce quase na proporção do tamanho. Não vendemos custo igual ao dos índices aproximados.
Achar os itens mais semelhantes a um exemplo. Cada item vira uma lista de números, e "parecido" quer dizer "perto" nessa lista.
O quanto um item pode diferir do exemplo e ainda contar como parecido. Quem busca escolhe.
A garantia do SIEVE: todo item dentro do raio aparece na resposta. Não "quase todos", nem "na maioria das buscas".
Onde isso pode estar errado.
Escala
Medido até 1 milhão de itens. Acima disso a projeção indica custo crescendo quase na proporção da base; em 100 milhões, uma consulta custaria cerca de 70× a de 1 milhão na configuração atual.
Dado difícil
Em dados com muitas dimensões realmente independentes, a garantia continua, mas a velocidade vira a da busca completa.
Precisão das contas
Contas mais rápidas em 32 bits têm arredondamento. O SIEVE só usa essas contas com uma faixa de recheck em precisão dupla perto da borda do raio.
O raio é escolha sua
O SIEVE garante que achou tudo dentro do raio pedido. Se o raio não representa "parecido" para o seu uso, a resposta está completa e mesmo assim não ajuda.
← Telemetria certificada · stickybit.com.br
- Medições próprias (jul–set/2026): SIFT1M e GIST1M (ann-benchmarks), hnswlib com 40 mil vetores de 128 dimensões, curva de crescimento de 100 mil a 1 milhão; biblioteca
github.com/andradeandrey/sieve, com o contrato conferido em teste contra a busca completa. - Busca certificada, o artigo técnico (OFAC, UCR, AusTraits, SIFT1M e o caso de triagem de sanções) · Doom loops · demonstração em fibra óptica.
- DARTH (SIGMOD 2026), parada antecipada por meta de acerto; survey de DCO (EDBT 2026); "HNSW with Accuracy Guarantees Using Graph Spanners" (arXiv:2607.02338).
- Caderno de pesquisa: "Mais rápido, outros bits", sobre a faixa de recheck em 32 bits.