Anonimizuj dane osobowe w PDF z poziomu własnego kodu. ScaleDP (Python) i ScaleDP-TS (JavaScript) łączą OCR, wykrywanie encji z AI i redakcję w jednym pipeline, na Twoim sprzęcie lub w całości w przeglądarce.
pip install scaledpnpm install @stabrise/scaledpDostępne również jako:
Narzędzie OnlineStudio (Chmura)Studio (Self-Hosted)Studio DesktopAPI w ChmurzeAPI Self-HostedIntegracja n8nWidgetSerwer MCPWtyczka ObsidianAutomatycznie wykrywa i ukrywa dane osobowe, takie jak imiona i nazwiska, lokalizacje, adresy e-mail i daty.
Wykorzystuje zaawansowaną AI, by rozumieć kontekst i precyzyjnie anonimizować.
Wbudowany OCR z Tesseract, EasyOCR, Surya lub docTR wykrywa i ukrywa tekst w skanowanych obrazach i PDF.
Używaj jej jako zwykłej biblioteki Pythona na jednym komputerze albo skaluj ten sam pipeline na Apache Spark, by anonimizować tysiące dokumentów.
Obsługuje popularne języki: angielski, hiszpański, niemiecki, włoski, rosyjski i inne.
Działa z DataFrame'ami Pandas i Spark, więc anonimizacja wpasowuje się w istniejące przepływy danych i pipeline'y ML.
Zainstaluj ScaleDP i zbuduj pipeline anonimizacji w kilku linijkach: wczytaj dokumenty do DataFrame'u Pandas lub Spark, uruchom OCR i wykryj dane osobowe za pomocą NER.
pip install scaledpfrom scaledp import *
spark = ScaleDPSession()
pipeline = PipelineModel(stages=[
PdfDataToImage(),
TesseractOcr(),
Ner(model="d4data/biomedical-ner-all"),
])
result = pipeline.transform(df)Dokumenty nigdy nie opuszczają przeglądarki. OCR, NER i redakcja działają w całości po stronie klienta.
Modele działają lokalnie przez WebAssembly lub WebGPU, bez komunikacji z serwerem.
Rozpoznawanie tekstu PaddleOCR wykrywa tekst w skanowanych obrazach i PDF.
GLiNER pozwala definiować typy encji, np. „person” czy „email”, w momencie wywołania, bez ponownego trenowania.
Detektory oparte na YOLO lokalizują podpisy i twarze do ukrycia.
Importuj tylko to, czego potrzebujesz (/pdf, /ocr, /ner, /detect), i łącz etapy prostym API Pipeline.
Zainstaluj @stabrise/scaledp i zbuduj taki sam pipeline w całości w przeglądarce, korzystając z onnxruntime-web.
npm install @stabrise/scaledpimport { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'
const pipeline = new Pipeline([
new PdfToImage({ resolution: 300 }),
new PaddleTextRecognizer({ preset: 'v6-small' }),
new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])
const rows = await pipeline.transform(file)Tak. ScaleDP i ScaleDP-TS są open source na licencji GNU AGPL-3.0, więc możesz je bezpłatnie używać, modyfikować i hostować samodzielnie. AGPL-3.0 wymaga, aby po zmodyfikowaniu kodu i udostępnieniu go innym, także przez sieć, udostępnić swoje zmiany na tej samej licencji.
Używaj ScaleDP do zadań serwerowych i wsadowych w Pythonie, na jednym komputerze lub skalowanych na Apache Spark. Używaj ScaleDP-TS, gdy dokumenty muszą zostać na urządzeniu użytkownika: wykonuje OCR, wykrywanie danych osobowych i redakcję w przeglądarce za pomocą onnxruntime-web.
Nie. ScaleDP działa jako zwykła biblioteka Pythona na jednym komputerze z DataFrame'ami Pandas. Apache Spark jest opcjonalny i potrzebny tylko wtedy, gdy chcesz rozproszyć przetwarzanie na klaster.
Tak. Obie biblioteki zawierają OCR. ScaleDP obsługuje Tesseract, EasyOCR, Surya i docTR, a ScaleDP-TS uruchamia PaddleOCR w przeglądarce, dzięki czemu tekst na zeskanowanych stronach i obrazach może zostać wykryty i ukryty.
Nie. ScaleDP-TS działa w całości po stronie klienta: renderowanie PDF, OCR i rozpoznawanie encji odbywają się w przeglądarce przez WebAssembly lub WebGPU. Pobierane są tylko pliki modeli; Twoje dokumenty nigdy nie opuszczają urządzenia.
Wybierz API, jeśli chcesz zarządzanej usługi, którą wywołasz z dowolnego języka programowania bez samodzielnego hostowania modeli, albo jeśli nie chcesz przyjmować zobowiązań licencji AGPL-3.0 we własnym kodzie.
Potrzebujesz pomocy z integracją ScaleDP w swoim pipeline? Porozmawiaj z naszymi inżynierami ML i danych o najbardziej złożonych wyzwaniach związanych z anonimizacją i przetwarzaniem dokumentów.