PDF Redaction
Integracjen8n

Samouczek: Wykrywanie danych PII bez redagowania

Zbuduj workflow n8n, który skanuje plik PDF w poszukiwaniu imion i nazwisk, e-maili oraz dat za pomocą operacji Detect PII, bez modyfikowania dokumentu.

Użyj operacji Detect PII, gdy chcesz wiedzieć, jakie wrażliwe informacje zawiera dokument — do audytu, budowania kroku weryfikacji przed redakcją lub kierowania dokumentów na podstawie ich zawartości — bez modyfikowania samego pliku PDF.

Ten samouczek buduje gotowy do uruchomienia workflow n8n, który pobiera publiczny dokument przykładowy i wykrywa w nim imiona i nazwiska, e-maile oraz daty.

Ogólny opis instalacji/konfiguracji znajdziesz najpierw w Samouczku instalacji i konfiguracji. Aby zredagować plik PDF (zamiast jedynie wykrywać w nim dane PII), zobacz Redagowanie pliku PDF pobranego przez HTTP. Ten przewodnik zakłada, że węzeł jest już zainstalowany i masz już poświadczenie PDF Redaction API.

1. Trigger + HTTP Request

Zacznij od Manual Trigger, następnie dodaj węzeł HTTP Request z:

  • Method: GET
  • URL: https://raw.githubusercontent.com/StabRise/pdf-redaction-api/main/examples/pdfs/sample_document_en.pdf
  • Options → Response → Response Format: File

Uruchom węzeł — dokument przykładowy (1,11 MB) wraca jako dane binarne w polu data:

Wynik węzła HTTP Request pokazujący pobrane dane binarne pliku sample_document_en.pdf

2. PDF Redaction — Detect PII

Dodaj węzeł PDF Redaction po węźle HTTP Request i ustaw:

  • Credential: swoje poświadczenie PDF Redaction API
  • Operation: Detect PII
  • Additional Fields → Tags: wybierz typy PII do wyszukania — w tym przykładzie użyto Date, Email, Person Name

W przeciwieństwie do Anonymize, ta operacja nie ma Output Binary Field — nie tworzy zmodyfikowanego pliku PDF, a jedynie wyniki wykrywania.

Węzeł PDF Redaction skonfigurowany z operacją Detect PII i tagami Date, Email, Person Name

3. Uruchom i sprawdź wynik

Kliknij Execute step. Tablica detected_pii[].entities w wyniku wymienia każde dopasowanie, z entity_group (np. PERSON_NAME, EMAIL), znalezionym word oraz boxes podającym położenie w pikselach na stronie.

Dla tego dokumentu węzeł znalazł wpisy takie jak:

wraz z dopasowaniami Date dalej na liście, a także zwykły podział processing_time.

4. Kompletny workflow

Kompletny workflow: Manual Trigger → HTTP Request → PDF Redaction (Detect PII), wszystkie wykonane pomyślnie

Uwagi

  • Jeśli pozostawisz Tags puste, API zgłasza tylko typy encji domyślnie skonfigurowane do wykrycia dla żądania — dla przewidywalnych wyników zawsze ustawiaj interesujące Cię tagi jawnie.
  • Połącz Detect PII z węzłem IF lub Switch dalej w workflow, aby rozgałęzić przepływ na podstawie znalezionych wyników (np. redaguj tylko dokumenty, w których detected_pii nie jest puste).
  • Aby następnie zredagować to, co znaleziono, podaj te same dane wejściowe do drugiego węzła PDF Redaction ustawionego na Anonymize z odpowiednimi tagami — zobacz Redagowanie pliku PDF pobranego przez HTTP.

Więcej zasobów