PDF Redaction
Integrationenn8n

Tutorial: PII erkennen, ohne zu schwärzen

Erstellen Sie einen n8n-Workflow, der ein PDF mit der Operation PII erkennen nach Namen, E-Mails und Daten durchsucht, ohne das Dokument zu verändern.

Verwenden Sie die Operation PII erkennen, wenn Sie wissen möchten, welche sensiblen Informationen in einem Dokument enthalten sind — für Audits, einen Prüfschritt vor dem Schwärzen oder um Dokumente basierend auf ihrem Inhalt weiterzuleiten —, ohne das PDF selbst zu verändern.

Dieses Tutorial baut einen lauffähigen n8n-Workflow, der ein öffentliches Beispieldokument abruft und darin Namen, E-Mails und Daten erkennt.

Für die allgemeine Einrichtung/Konfiguration siehe zuerst Einrichtungs- und Konfigurations-Tutorial. Um ein PDF zu schwärzen (statt nur PII darin zu erkennen), siehe Ein per HTTP abgerufenes PDF schwärzen. Diese Anleitung setzt voraus, dass der Node bereits installiert ist und Sie bereits über eine PDF Redaction API-Anmeldeinformation verfügen.

1. Trigger + HTTP Request

Beginnen Sie mit einem Manual Trigger, dann fügen Sie einen HTTP Request-Node hinzu mit:

  • Method: GET
  • URL: https://raw.githubusercontent.com/StabRise/pdf-redaction-api/main/examples/pdfs/sample_document_en.pdf
  • Options → Response → Response Format: File

Führen Sie den Node aus — das Beispieldokument (1,11 MB) kommt als Binärdaten im Feld data zurück:

HTTP Request Node-Ausgabe mit dem abgerufenen sample_document_en.pdf als Binärdaten

2. PDF Redaction — PII erkennen

Fügen Sie nach dem HTTP Request-Node einen PDF Redaction-Node hinzu und stellen Sie ein:

  • Credential: Ihre PDF Redaction API-Anmeldeinformation
  • Operation: PII erkennen
  • Additional Fields → Tags: wählen Sie die zu suchenden PII-Typen aus — dieses Beispiel verwendet Date, Email, Person Name

Anders als Anonymisieren hat diese Operation kein Output Binary Field — sie erzeugt kein verändertes PDF, sondern nur Erkennungsergebnisse.

PDF Redaction Node konfiguriert mit der Operation PII erkennen und den Tags Date, Email, Person Name

3. Ausführen und Ausgabe prüfen

Klicken Sie auf Execute step. Das Array detected_pii[].entities der Ausgabe listet jeden Treffer auf, jeweils mit einer entity_group (z. B. PERSON_NAME, EMAIL), dem gefundenen word und boxes mit der Pixelposition auf der Seite.

Für dieses Dokument fand der Node Einträge wie:

zusammen mit Date-Treffern weiter unten in der Liste sowie der üblichen processing_time-Aufschlüsselung.

4. Der vollständige Workflow

Vollständiger Workflow: Manual Trigger → HTTP Request → PDF Redaction (PII erkennen), alle erfolgreich ausgeführt

Hinweise

  • Wenn Sie Tags leer lassen, meldet die API nur die Entitätstypen, die standardmäßig für die Anfrage erkannt werden — für vorhersehbare Ergebnisse sollten Sie die gewünschten Tags immer explizit angeben.
  • Kombinieren Sie PII erkennen mit einem nachgelagerten IF- oder Switch-Node, um einen Workflow basierend auf den Ergebnissen zu verzweigen (z. B. nur Dokumente schwärzen, bei denen detected_pii nicht leer ist).
  • Um anschließend das Gefundene zu schwärzen, leiten Sie dieselbe Eingabe in einen zweiten PDF Redaction-Node mit der Operation Anonymisieren und passenden Tags — siehe Ein per HTTP abgerufenes PDF schwärzen.

Weitere Ressourcen