PDF Redaction
Integracionesn8n

Tutorial: Detectar PII sin redactar

Construye un flujo de trabajo de n8n que escanea un PDF en busca de nombres, correos electrónicos y fechas usando la operación Detect PII, sin modificar el documento.

Usa la operación Detect PII cuando quieras saber qué información sensible contiene un documento — para auditorías, para construir un paso de revisión antes de redactar, o para enrutar documentos según su contenido — sin modificar el PDF en sí.

Este tutorial construye un flujo de trabajo ejecutable de n8n que obtiene un documento de ejemplo público y detecta nombres, correos electrónicos y fechas en él.

Para la guía general de instalación/configuración, consulta primero el Tutorial de instalación y configuración. Para redactar un PDF (en lugar de solo detectar PII en él), consulta Redactar un PDF obtenido por HTTP. Esta guía asume que el nodo ya está instalado y que ya tienes una credencial PDF Redaction API.

1. Disparador + HTTP Request

Empieza con un Manual Trigger, luego añade un nodo HTTP Request con:

  • Method: GET
  • URL: https://raw.githubusercontent.com/StabRise/pdf-redaction-api/main/examples/pdfs/sample_document_en.pdf
  • Options → Response → Response Format: File

Ejecuta el nodo — el documento de ejemplo (1.11 MB) vuelve como datos binarios en el campo data:

Salida del nodo HTTP Request mostrando los datos binarios del archivo sample_document_en.pdf obtenido

2. PDF Redaction — Detect PII

Añade un nodo PDF Redaction después del nodo HTTP Request y configura:

  • Credential: tu credencial PDF Redaction API
  • Operation: Detect PII
  • Additional Fields → Tags: elige los tipos de PII a buscar — este ejemplo usa Date, Email, Person Name

A diferencia de Anonymize, esta operación no tiene Output Binary Field — no produce un PDF modificado, solo resultados de detección.

Nodo PDF Redaction configurado con la operación Detect PII y las etiquetas Date, Email, Person Name

3. Ejecuta e inspecciona la salida

Haz clic en Execute step. El array detected_pii[].entities de la salida lista cada coincidencia, cada una con un entity_group (p. ej. PERSON_NAME, EMAIL), la word encontrada, y boxes con la ubicación en píxeles en la página.

Para este documento, el nodo encontró entradas como:

junto con coincidencias de Date más abajo en la lista, además del habitual desglose de processing_time.

4. El flujo de trabajo completo

Flujo de trabajo completo: Manual Trigger → HTTP Request → PDF Redaction (Detect PII), todos ejecutados correctamente

Notas

  • Si dejas Tags vacío, la API solo reporta los tipos de entidad configurados por defecto para la solicitud — para resultados predecibles, establece siempre explícitamente las etiquetas que te interesan.
  • Combina Detect PII con un nodo IF o Switch posterior para ramificar un flujo de trabajo según lo encontrado (p. ej. redactar solo los documentos donde detected_pii no esté vacío).
  • Para luego redactar lo que encontraste, envía la misma entrada a un segundo nodo PDF Redaction configurado en Anonymize con las etiquetas correspondientes — consulta Redactar un PDF obtenido por HTTP.

Más recursos