PDF Redaction

Dostępne również jako:

Narzędzie OnlineStudio (Chmura)Studio (Self-Hosted)Studio DesktopAPI w ChmurzeAPI Self-HostedIntegracja n8nWidgetSerwer MCPWtyczka Obsidian

ScaleDP: Biblioteka do Anonimizacji PDF dla Pythona

Anonimizacja z AI

Automatycznie wykrywa i ukrywa dane osobowe, takie jak imiona i nazwiska, lokalizacje, adresy e-mail i daty.

Dokładność z uwzględnieniem kontekstu

Wykorzystuje zaawansowaną AI, by rozumieć kontekst i precyzyjnie anonimizować.

Skanowane dokumenty (OCR)

Wbudowany OCR z Tesseract, EasyOCR, Surya lub docTR wykrywa i ukrywa tekst w skanowanych obrazach i PDF.

Lokalnie lub na Spark

Używaj jej jako zwykłej biblioteki Pythona na jednym komputerze albo skaluj ten sam pipeline na Apache Spark, by anonimizować tysiące dokumentów.

Wielojęzyczność

Obsługuje popularne języki: angielski, hiszpański, niemiecki, włoski, rosyjski i inne.

Pasuje do Twojego stosu danych

Działa z DataFrame'ami Pandas i Spark, więc anonimizacja wpasowuje się w istniejące przepływy danych i pipeline'y ML.

ScaleDP: Przykład Kodu w Pythonie

Zainstaluj ScaleDP i zbuduj pipeline anonimizacji w kilku linijkach: wczytaj dokumenty do DataFrame'u Pandas lub Spark, uruchom OCR i wykryj dane osobowe za pomocą NER.

pip install scaledp
from scaledp import *

spark = ScaleDPSession()

pipeline = PipelineModel(stages=[
    PdfDataToImage(),
    TesseractOcr(),
    Ner(model="d4data/biomedical-ner-all"),
])

result = pipeline.transform(df)

ScaleDP-TS: Biblioteka do Anonimizacji PDF dla JavaScriptu

Bez wysyłania, bez serwera

Dokumenty nigdy nie opuszczają przeglądarki. OCR, NER i redakcja działają w całości po stronie klienta.

Działa na onnxruntime-web

Modele działają lokalnie przez WebAssembly lub WebGPU, bez komunikacji z serwerem.

OCR w przeglądarce

Rozpoznawanie tekstu PaddleOCR wykrywa tekst w skanowanych obrazach i PDF.

NER zero-shot

GLiNER pozwala definiować typy encji, np. „person” czy „email”, w momencie wywołania, bez ponownego trenowania.

Wykrywanie podpisów i twarzy

Detektory oparte na YOLO lokalizują podpisy i twarze do ukrycia.

Modułowa i łatwa w składaniu

Importuj tylko to, czego potrzebujesz (/pdf, /ocr, /ner, /detect), i łącz etapy prostym API Pipeline.

ScaleDP-TS: Przykład Kodu w JavaScripcie

Zainstaluj @stabrise/scaledp i zbuduj taki sam pipeline w całości w przeglądarce, korzystając z onnxruntime-web.

npm install @stabrise/scaledp
import { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'

const pipeline = new Pipeline([
  new PdfToImage({ resolution: 300 }),
  new PaddleTextRecognizer({ preset: 'v6-small' }),
  new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])

const rows = await pipeline.transform(file)

Biblioteka czy API: Czego Potrzebujesz?

Otwarta biblioteka

  • Uruchamiasz ją sam: na swoich serwerach, klastrze Spark lub w przeglądarce użytkownika
  • Python (ScaleDP) albo JavaScript i TypeScript (ScaleDP-TS)
  • Bezpłatna na licencji AGPL-3.0
  • Sam wybierasz modele OCR i NER i nimi zarządzasz

API i SDK do Anonimizacji PDF

  • Zarządzane REST API, dostępne także do hostowania lokalnie
  • Wywołanie z dowolnego języka przez HTTP
  • Darmowy limit, potem opłata za stronę
  • Dopracowane produkcyjnie wykrywanie danych osobowych, podpisów, zdjęć i kodów QR
Zobacz API i SDK do anonimizacji PDF

Najczęstsze Pytania o Bibliotekę do Anonimizacji PDF

Tak. ScaleDP i ScaleDP-TS są open source na licencji GNU AGPL-3.0, więc możesz je bezpłatnie używać, modyfikować i hostować samodzielnie. AGPL-3.0 wymaga, aby po zmodyfikowaniu kodu i udostępnieniu go innym, także przez sieć, udostępnić swoje zmiany na tej samej licencji.

Używaj ScaleDP do zadań serwerowych i wsadowych w Pythonie, na jednym komputerze lub skalowanych na Apache Spark. Używaj ScaleDP-TS, gdy dokumenty muszą zostać na urządzeniu użytkownika: wykonuje OCR, wykrywanie danych osobowych i redakcję w przeglądarce za pomocą onnxruntime-web.

Nie. ScaleDP działa jako zwykła biblioteka Pythona na jednym komputerze z DataFrame'ami Pandas. Apache Spark jest opcjonalny i potrzebny tylko wtedy, gdy chcesz rozproszyć przetwarzanie na klaster.

Tak. Obie biblioteki zawierają OCR. ScaleDP obsługuje Tesseract, EasyOCR, Surya i docTR, a ScaleDP-TS uruchamia PaddleOCR w przeglądarce, dzięki czemu tekst na zeskanowanych stronach i obrazach może zostać wykryty i ukryty.

Nie. ScaleDP-TS działa w całości po stronie klienta: renderowanie PDF, OCR i rozpoznawanie encji odbywają się w przeglądarce przez WebAssembly lub WebGPU. Pobierane są tylko pliki modeli; Twoje dokumenty nigdy nie opuszczają urządzenia.

Wybierz API, jeśli chcesz zarządzanej usługi, którą wywołasz z dowolnego języka programowania bez samodzielnego hostowania modeli, albo jeśli nie chcesz przyjmować zobowiązań licencji AGPL-3.0 we własnym kodzie.

Wbuduj anonimizację PDF w swoją platformę

Potrzebujesz pomocy z integracją ScaleDP w swoim pipeline? Porozmawiaj z naszymi inżynierami ML i danych o najbardziej złożonych wyzwaniach związanych z anonimizacją i przetwarzaniem dokumentów.

Skontaktuj sięSprawdź swoją anonimizację