PDF Redaction

Jak zanonimizować zeskanowany PDF

Aby zanonimizować zeskanowany PDF, narzędzie musi najpierw uruchomić OCR, który zamieni obraz strony w przeszukiwalny tekst, a następnie usunąć zarówno rozpoznany tekst, jak i piksele obrazu pod każdym zaznaczeniem. Darmowe narzędzie PDF Redaction robi to automatycznie w ponad 100 językach: prześlij skan, przejrzyj zaznaczenia AI, dodaj prostokąty na piśmie odręcznym lub pieczątkach i pobierz plik, w którym zanonimizowane obszary zostały usunięte z samego obrazu.

Ten poradnik wyjaśnia, dlaczego skany zachowują się inaczej, prowadzi przez kolejne kroki i pokazuje, jak sprawdzić wynik.

Dlaczego zeskanowane PDF-y są inne

Zeskanowany dokument, faks lub zdjęcie z telefonu zapisane jako PDF zawiera jeden obraz na stronę i żadnego tekstu. Bez warstwy tekstowej:

  • Wyszukiwanie niczego nie znajduje, więc funkcja Znajdź tekst i redaguj w Acrobacie i podobne narzędzia nie zwracają wyników.
  • Automatyczne wykrywanie nie ma czego czytać, więc nazwiska i numery nie są oznaczane.
  • Czarny prostokąt niczego nie usuwa: piksele oryginalnej strony pozostają w obrazie pod adnotacją.

OCR rozwiązuje dwa pierwsze problemy, rozpoznając znaki na obrazie. Właściwe narzędzie do anonimizacji usuwa następnie piksele, a nie tylko rozpoznany tekst, bo to obraz jest prawdziwą treścią.

Metoda 1: anonimizacja skanu z wbudowanym OCR (zalecana)

Kroki

  1. Prześlij zeskanowany PDF

    Przeciągnij skan do darmowego narzędzia PDF Redaction. Akceptowane są skany, faksy i zdjęcia wyeksportowane do PDF. Plik jest przetwarzany w Twojej przeglądarce.

    Przesyłanie zeskanowanego PDF
  2. Pozwól OCR odczytać strony

    Strony bez warstwy tekstowej są automatycznie rozpoznawane przez OCR w ponad 100 językach, w tym w alfabecie łacińskim, cyrylicy, piśmie arabskim, CJK i dewanagari. Jeśli skan ma już słabą warstwę tekstową, włącz opcję „Zawsze uruchamiaj OCR", aby odczytać go ponownie.

  3. Przejrzyj detekcje AI

    AI zaznacza nazwiska, adresy, daty, numery dokumentów i inne dane osobowe znalezione w rozpoznanym tekście. Włącz wykrywanie twarzy, aby znaleźć zdjęcia i podpisy.

    Dane osobowe wykryte na zeskanowanej stronie
  4. Popraw to, co przeoczył OCR

    Pismo odręczne, pieczątki i obszary niskiej jakości mogą nie zostać rozpoznane. Narzędziem prostokąta narysuj ramki na wszystkim, czego AI nie wychwyciło, a wyszukiwarką zanonimizuj powtarzające się terminy.

    Ręczne rysowanie prostokątów anonimizacji na skanie
  5. Pobierz i zweryfikuj

    Przy pobieraniu piksele obrazu pod każdym prostokątem są usuwane i ponownie kodowane, rozpoznany tekst jest kasowany, a metadane czyszczone. Otwórz wynik w narzędziu sprawdzającym, aby to potwierdzić.

    Zanonimizowany zeskanowany PDF

OCR w ponad 100 językach w darmowym planie. Pliki zostają w Twojej przeglądarce.

Metoda 2: Adobe Acrobat Pro

  1. Otwórz skan i uruchom Skanuj i OCR → Rozpoznaj tekst dla całego dokumentu.
  2. Otwórz Narzędzia → Redaguj i użyj Znajdź tekst i redaguj albo oznacz obszary ręcznie.
  3. Zastosuj anonimizację, potwierdź usunięcie ukrytych informacji, a następnie uruchom Oczyść dokument.
  4. Zapisz jako nowy plik.

OCR w Acrobacie dobrze radzi sobie z popularnymi językami i czystymi skanami; nie ma automatycznego wykrywania nazwisk ani adresów, więc każdy element trzeba znaleźć, czytając dokument.

Metoda 3: aplikacja desktopowa i praca offline

Dla skanów, które nie mogą opuścić budynku, PDF Redaction Studio Desktop uruchamia OCR, detekcję AI i wykrywanie twarzy w całości na komputerze, bez połączenia z internetem. Jest dostępny dla Windows i Linux.

Co nie działa na skanach

  • Podgląd w macOS: jego narzędzie Redaguj potrzebuje warstwy tekstowej, a Podgląd nie ma OCR, więc anonimizuje tylko obszar wizualny, po którym przeciągniesz kursor. Na skanie to akceptowalne dla jednej strony, ale nic nie jest wykrywane za Ciebie.
  • Prostokąty adnotacji w dowolnej przeglądarce: obraz pod spodem pozostaje nietknięty.
  • Rozmywanie lub pikselowanie w edytorze graficznym: rozmycie da się częściowo odwrócić, a oryginalny plik nadal istnieje.

Sprawdzanie zanonimizowanego skanu

Ponieważ skan nie ma oryginalnego tekstu, zwykły test „spróbuj zaznaczyć tekst" dowodzi mniej. Zamiast tego:

  1. Powiększ zanonimizowany obszar; prostokąt powinien być jednolity, bez prześwitów.
  2. Wyodrębnij obraz strony (lub otwórz plik w narzędziu sprawdzającym) i potwierdź, że obszar ma jednolity kolor.
  3. Sprawdź właściwości dokumentu pod kątem pozostałych metadanych.

Sprawdź, czy anonimizacja naprawdę zadziałała

Zanim wyślesz zanonimizowany PDF, otwórz go w naszym darmowym narzędziu sprawdzającym i upewnij się, że nie da się odzyskać ukrytego tekstu, warstw ani metadanych.

Sprawdź mój PDF

Skrót

  1. Prześlij skan do PDF Redaction; OCR uruchomi się automatycznie.
  2. Przejrzyj zaznaczenia AI; włącz wykrywanie twarzy dla zdjęć.
  3. Narysuj prostokąty na piśmie odręcznym, pieczątkach i wszystkim, co przeoczył OCR.
  4. Pobierz: piksele i tekst są usunięte, metadane wyczyszczone.
  5. Zweryfikuj wynik.

Najczęściej zadawane pytania

Dlaczego nie mogę zaznaczyć tekstu w zeskanowanym PDF?

Ponieważ skan to obraz strony. Warstwa tekstowa nie istnieje, dopóki OCR (optyczne rozpoznawanie znaków) nie odczyta obrazu i jej nie doda. Narzędzia do anonimizacji bez OCR nie potrafią niczego wyszukać ani wykryć w skanie.

Czy przed anonimizacją muszę uruchomić OCR?

W PDF Redaction nie; OCR uruchamia się automatycznie na stronach bez tekstu. W Acrobat Pro trzeba najpierw uruchomić Skanuj i OCR, w przeciwnym razie funkcja Znajdź tekst i redaguj nic nie zwróci.

Czy anonimizacja zeskanowanego PDF usuwa piksele?

Prawdziwe narzędzie do anonimizacji ponownie koduje obraz bez pikseli pod prostokątem i usuwa tekst z OCR. Narysowanie czarnego prostokąta na obrazie nie zmienia samego obrazu.

Czy OCR odczytuje pismo odręczne?

Częściowo. Tekst drukowany jest rozpoznawany niezawodnie; pismo odręczne, pieczątki i wyblakłe faksy – nie. Przejrzyj zeskanowane strony wzrokowo i dodaj ręczne prostokąty na wszystkim, czego AI nie zaznaczyło.

Jakie języki są obsługiwane?

Ponad 100, w tym polski, angielski, niemiecki, hiszpański, francuski, ukraiński, arabski, chiński, japoński i hindi. Silnik można przełączać w ustawieniach między Tesseract a PaddleOCR.

Czy mogę zanonimizować zdjęcie dokumentu zrobione telefonem?

Tak. Zapisz lub wyeksportuj zdjęcie jako PDF, prześlij je, a OCR je odczyta. Najlepsze rozpoznanie dają zdjęcia zrobione prosto i w dobrym oświetleniu.

Rozpocznij anonimizację swoich PDF już dziś

To darmowe, łatwe w użyciu i w pełni bezpieczne.