Data Leak Detection — Busca em Dados Vazados // MÓDULOS

Data Leak Detection — Busca em Dados Vazados

Mecanismo de busca sobre o acervo de documentos vazados que a plataforma indexa — dumps, combolists, logs de infostealer, despejos de fórum e material enviado pelo próprio cliente. A consulta é federada: um pedido vai para todos os servidores de índice configurados e as respostas voltam fundidas em um resultado único.

Visão Geral

Cada documento entra no índice fatiado em trechos. A busca casa o termo contra o texto do trecho (peso 3), o nome do arquivo (peso 2) e os metadados de seção e título, com tolerância a erro de digitação, e devolve até três fragmentos com o termo destacado no meio da frase — o analista lê o contexto sem abrir o arquivo.

Sobre o resultado vêm três agregações que servem de filtro e de diagnóstico do achado: por tipo de arquivo, por categoria e por fonte de origem. É assim que se descobre, por exemplo, que um mesmo CNPJ aparece em quinze planilhas de uma fonte e em um único e-mail de outra.

Como Funciona por Dentro

Federação e paginação. A plataforma descobre os servidores de índice pela configuração de ambiente e consulta todos. As agregações são somadas chave a chave, os resultados são reordenados por relevância no conjunto já fundido e só então paginados. Se um servidor falhar, os demais respondem e a falha fica registrada — a busca não fica refém do nó mais lento.

Isolamento fail-closed. O filtro por organização é sempre aplicado para quem não é administrador global, mesmo que o campo de organização ainda não exista em parte dos documentos indexados. O efeito é deliberado: documento sem o campo não casa e não aparece. A decisão de engenharia foi trocar o comportamento antigo — que removia o filtro quando o campo faltava e devolvia tudo — por um que erra para menos. Em busca de dados vazados, um falso negativo é um incômodo; um vazamento cruzado entre clientes é um incidente.

Impressão digital cross-fonte. O mesmo arquivo circula em vários canais. A plataforma guarda sha256, sha1 e md5 de cada documento, com contador de ocorrências e datas de primeira e última aparição. Isso responde a uma pergunta que a busca por texto não responde: este dump é novo, ou é o mesmo de março reempacotado?

Atribuição com confiança declarada. Cada impressão digital pode receber atribuições — ator, campanha, canal de origem (Telegram, fórum, paste, marketplace, log de stealer, dark web, clear web, feed de parceiro, envio manual), URL e handle de quem postou, mais a justificativa. A confiança tem três níveis e o critério de cada um é explícito: baixa é heurística automática, média é correlação entre fontes, alta exige revisão humana com múltiplos sinais. Nome e data de quem revisou ficam no registro.

Recursos

  • Seletores estruturados: e-mail, domínio, URL, IPv4, IPv6, telefone, endereço Bitcoin, endereço Ethereum, CPF e CNPJ
  • Extração de texto de PDF, DOCX, XLSX, PPTX, HTML, EML e de compactados ZIP, RAR e 7z
  • Buscas salvas com compartilhamento opcional dentro da organização; edição pelo criador ou pelo administrador da organização
  • Exportação em JSON ou CSV, com teto de 100, 500, 1.000 ou 5.000 resultados
  • Auditoria de seis eventos — busca, visualização, download, exportação, salvar e apagar busca — com IP, consulta, filtros, número de resultados e tempo de resposta

Casos de Uso

  • Verificar se credenciais corporativas apareceram em um despejo recente e em qual canal
  • Rastrear exposição de CPF ou CNPJ de clientes em bases comercializadas
  • Determinar se um dump anunciado como inédito já circulava, pelo contador de ocorrências
  • Reunir a evidência de origem para uma notificação de incidente ou um pedido de takedown

O Que o Módulo Não Faz

  • Busca salva não dispara alerta. Ela guarda a consulta para reuso, não a agenda. Vigilância contínua com notificação é função do Threat Monitoring, que consulta este mesmo acervo.
  • Não consulta HaveIBeenPwned, DeHashed ou serviços equivalentes de terceiros.
  • Não escreve em diretório corporativo: não força troca de senha nem desativa conta em Active Directory ou Entra ID.
  • Não atribui autoria automaticamente com confiança alta — a faixa alta exige assinatura humana.
  • Não guarda o texto extraído no banco relacional; ele vive no índice de busca.

Integrações

  • OpenSearch multi-servidor (índices ooda_leaks_*)
  • Airflow, para os documentos que precisam de OCR antes de entrar no índice
  • OODA Threat Monitoring (busca recorrente sobre este acervo) e OODA EASM (correlação de vazamento com ativos do perímetro)

SLA & Garantias

Índice federado com merge de agregações · isolamento por organização fail-closed · cada consulta auditada

Próximos Passos