Samouczek: Wykrywanie danych PII bez redagowania
Zbuduj workflow n8n, który skanuje plik PDF w poszukiwaniu imion i nazwisk, e-maili oraz dat za pomocą operacji Detect PII, bez modyfikowania dokumentu.
Użyj operacji Detect PII, gdy chcesz wiedzieć, jakie wrażliwe informacje zawiera dokument — do audytu, budowania kroku weryfikacji przed redakcją lub kierowania dokumentów na podstawie ich zawartości — bez modyfikowania samego pliku PDF.
Ten samouczek buduje gotowy do uruchomienia workflow n8n, który pobiera publiczny dokument przykładowy i wykrywa w nim imiona i nazwiska, e-maile oraz daty.
Ogólny opis instalacji/konfiguracji znajdziesz najpierw w Samouczku instalacji i konfiguracji. Aby zredagować plik PDF (zamiast jedynie wykrywać w nim dane PII), zobacz Redagowanie pliku PDF pobranego przez HTTP. Ten przewodnik zakłada, że węzeł jest już zainstalowany i masz już poświadczenie PDF Redaction API.
1. Trigger + HTTP Request
Zacznij od Manual Trigger, następnie dodaj węzeł HTTP Request z:
- Method:
GET - URL:
https://raw.githubusercontent.com/StabRise/pdf-redaction-api/main/examples/pdfs/sample_document_en.pdf - Options → Response → Response Format:
File
Uruchom węzeł — dokument przykładowy (1,11 MB) wraca jako dane binarne w polu data:

2. PDF Redaction — Detect PII
Dodaj węzeł PDF Redaction po węźle HTTP Request i ustaw:
- Credential: swoje poświadczenie PDF Redaction API
- Operation:
Detect PII - Additional Fields → Tags: wybierz typy PII do wyszukania — w tym przykładzie użyto
Date,Email,Person Name
W przeciwieństwie do Anonymize, ta operacja nie ma Output Binary Field — nie tworzy zmodyfikowanego pliku PDF, a jedynie wyniki wykrywania.

3. Uruchom i sprawdź wynik
Kliknij Execute step. Tablica detected_pii[].entities w wyniku wymienia każde dopasowanie, z entity_group (np. PERSON_NAME, EMAIL), znalezionym word oraz boxes podającym położenie w pikselach na stronie.
Dla tego dokumentu węzeł znalazł wpisy takie jak:
PERSON_NAME—"Johnathan Smith"EMAIL—"[email protected]"
wraz z dopasowaniami Date dalej na liście, a także zwykły podział processing_time.
4. Kompletny workflow

Uwagi
- Jeśli pozostawisz Tags puste, API zgłasza tylko typy encji domyślnie skonfigurowane do wykrycia dla żądania — dla przewidywalnych wyników zawsze ustawiaj interesujące Cię tagi jawnie.
- Połącz Detect PII z węzłem IF lub Switch dalej w workflow, aby rozgałęzić przepływ na podstawie znalezionych wyników (np. redaguj tylko dokumenty, w których
detected_piinie jest puste). - Aby następnie zredagować to, co znaleziono, podaj te same dane wejściowe do drugiego węzła PDF Redaction ustawionego na Anonymize z odpowiednimi tagami — zobacz Redagowanie pliku PDF pobranego przez HTTP.