Data Leak Detection — Búsqueda en Datos Filtrados
Motor de búsqueda sobre el acervo de documentos filtrados que la plataforma indexa: volcados, combolists, logs de infostealer, vertidos de foros y material enviado por el propio cliente. La consulta es federada: una petición se envía a todos los servidores de índice configurados y las respuestas vuelven fusionadas en un único resultado.
Visión General
Cada documento entra en el índice troceado en fragmentos. La búsqueda coteja el término contra el texto del fragmento (peso 3), el nombre del archivo (peso 2) y los metadatos de sección y título, con tolerancia a errores de escritura, y devuelve hasta tres extractos con el término resaltado en medio de la frase: el analista lee el contexto sin abrir el archivo.
Sobre el resultado vienen tres agregaciones que sirven de filtro y de diagnóstico del hallazgo: por tipo de archivo, por categoría y por fuente de origen. Así se descubre, por ejemplo, que un mismo CNPJ aparece en quince hojas de cálculo de una fuente y en un único correo electrónico de otra.
Cómo Funciona por Dentro
Federación y paginación. La plataforma descubre los servidores de índice a partir de la configuración del entorno y los consulta todos. Las agregaciones se suman clave a clave, los resultados se reordenan por relevancia sobre el conjunto ya fusionado y solo entonces se paginan. Si un servidor falla, los demás responden y el fallo queda registrado: la búsqueda no queda rehén del nodo más lento.
Aislamiento fail-closed. El filtro por organización se aplica siempre a quien no es administrador global, aunque el campo de organización todavía no exista en parte de los documentos indexados. El efecto es deliberado: un documento sin ese campo no coincide y no aparece. La decisión de ingeniería fue sustituir el comportamiento antiguo —que retiraba el filtro cuando faltaba el campo y devolvía todo— por otro que se equivoca por defecto. En una búsqueda de datos filtrados, un falso negativo es una molestia; una fuga cruzada entre clientes es un incidente.
Huella digital entre fuentes. El mismo archivo circula por varios canales. La plataforma guarda sha256, sha1 y md5 de cada documento, con contador de apariciones y fechas de primera y última aparición. Eso responde a una pregunta que la búsqueda por texto no responde: ¿este volcado es nuevo, o es el mismo de marzo reempaquetado?
Atribución con nivel de confianza declarado. Cada huella digital puede recibir atribuciones: actor, campaña, canal de origen (Telegram, foro, paste, marketplace, log de stealer, dark web, clear web, feed de socio, envío manual), URL y handle de quien publicó, más la justificación. La confianza tiene tres niveles y el criterio de cada uno es explícito: baja es heurística automática, media es correlación entre fuentes, alta exige revisión humana con múltiples señales. El nombre y la fecha de quien revisó quedan en el registro.
Funcionalidades
- Selectores estructurados: correo electrónico, dominio, URL, IPv4, IPv6, teléfono, dirección Bitcoin, dirección Ethereum, CPF y CNPJ (los identificadores fiscales brasileños de persona física y de empresa)
- Extracción de texto de PDF, DOCX, XLSX, PPTX, HTML, EML y de comprimidos ZIP, RAR y 7z
- Búsquedas guardadas con compartición opcional dentro de la organización; edición por parte de su creador o del administrador de la organización
- Exportación en JSON o CSV, con tope de 100, 500, 1.000 o 5.000 resultados
- Auditoría de seis eventos —búsqueda, visualización, descarga, exportación, guardar y borrar búsqueda— con IP, consulta, filtros, número de resultados y tiempo de respuesta
Casos de Uso
- Comprobar si unas credenciales corporativas aparecieron en un vertido reciente y en qué canal
- Rastrear la exposición del CPF o del CNPJ de clientes en bases comercializadas
- Determinar si un volcado anunciado como inédito ya circulaba, mediante el contador de apariciones
- Reunir la evidencia de origen para una notificación de incidente o una solicitud de takedown
Lo Que el Módulo No Hace
- Una búsqueda guardada no dispara alertas. Guarda la consulta para reutilizarla, no la programa. La vigilancia continua con notificación es función de Threat Monitoring, que consulta este mismo acervo.
- No consulta HaveIBeenPwned, DeHashed ni servicios equivalentes de terceros.
- No escribe en el directorio corporativo: no fuerza el cambio de contraseña ni desactiva cuentas en Active Directory o Entra ID.
- No atribuye autoría automáticamente con confianza alta: el nivel alto exige firma humana.
- No guarda el texto extraído en la base de datos relacional; vive en el índice de búsqueda.
Integraciones
- OpenSearch multiservidor (índices
ooda_leaks_*) - Airflow, para los documentos que necesitan OCR antes de entrar en el índice
- OODA Threat Monitoring (búsqueda recurrente sobre este acervo) y OODA EASM (correlación de una filtración con activos del perímetro)
SLA y Garantías
Índice federado con fusión de agregaciones · aislamiento por organización fail-closed · cada consulta auditada