Schwärzen Sie personenbezogene Daten in PDFs direkt aus Ihrem Code. ScaleDP (Python) und ScaleDP-TS (JavaScript) kombinieren OCR, KI-Entitätserkennung und Schwärzung in einer Pipeline – auf Ihrer eigenen Hardware oder vollständig im Browser.
pip install scaledpnpm install @stabrise/scaledpAuch verfügbar als:
Online-ToolStudio (Cloud)Studio (Self-Hosted)Studio DesktopCloud-APISelf-Hosted-APIn8n-IntegrationWidgetMCP-ServerObsidian-PluginErkennt und schwärzt automatisch personenbezogene Daten wie Namen, Orte, E-Mails und Datumsangaben.
Nutzt fortschrittliche KI, um den Kontext zu verstehen und präzise zu schwärzen.
Integrierte OCR mit Tesseract, EasyOCR, Surya oder docTR erkennt und schwärzt Text in gescannten Bildern und PDFs.
Nutzen Sie sie als normale Python-Bibliothek auf einem Rechner oder skalieren Sie dieselbe Pipeline auf Apache Spark, um Tausende Dokumente zu schwärzen.
Unterstützt gängige Sprachen: Englisch, Spanisch, Deutsch, Italienisch, Russisch und weitere.
Arbeitet mit Pandas- und Spark-DataFrames, sodass sich die Schwärzung in bestehende Daten-Workflows und ML-Pipelines einfügt.
Installieren Sie ScaleDP und bauen Sie eine Schwärzungspipeline in wenigen Zeilen: Dokumente in ein Pandas- oder Spark-DataFrame laden, OCR ausführen und personenbezogene Daten per NER erkennen.
pip install scaledpfrom scaledp import *
spark = ScaleDPSession()
pipeline = PipelineModel(stages=[
PdfDataToImage(),
TesseractOcr(),
Ner(model="d4data/biomedical-ner-all"),
])
result = pipeline.transform(df)Dokumente verlassen nie den Browser. OCR, NER und Schwärzung laufen vollständig clientseitig.
Modelle laufen lokal über WebAssembly oder WebGPU, ohne Umweg über einen Server.
PaddleOCR erkennt Text in gescannten Bildern und PDFs.
Mit GLiNER definieren Sie Entitätstypen wie „person“ oder „email“ beim Aufruf – ohne Nachtraining.
YOLO-basierte Detektoren finden Unterschriften und Gesichter zum Schwärzen.
Importieren Sie nur, was Sie brauchen (/pdf, /ocr, /ner, /detect), und verketten Sie Schritte mit einer einfachen Pipeline-API.
Installieren Sie @stabrise/scaledp und bauen Sie dieselbe Art von Pipeline vollständig im Browser mit onnxruntime-web.
npm install @stabrise/scaledpimport { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'
const pipeline = new Pipeline([
new PdfToImage({ resolution: 300 }),
new PaddleTextRecognizer({ preset: 'v6-small' }),
new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])
const rows = await pipeline.transform(file)Ja. ScaleDP und ScaleDP-TS sind Open Source unter der GNU AGPL-3.0. Sie können sie kostenlos nutzen, anpassen und selbst hosten. Die AGPL-3.0 verlangt, dass Sie Ihre Änderungen unter derselben Lizenz offenlegen, wenn Sie den Code verändern und anderen zur Verfügung stellen – auch über ein Netzwerk.
Nutzen Sie ScaleDP für serverseitige und Batch-Jobs in Python, auf einem einzelnen Rechner oder skaliert auf Apache Spark. Nutzen Sie ScaleDP-TS, wenn Dokumente auf dem Gerät der Nutzer bleiben müssen: Es führt OCR, PII-Erkennung und Schwärzung mit onnxruntime-web im Browser aus.
Nein. ScaleDP funktioniert als normale Python-Bibliothek auf einem einzelnen Rechner mit Pandas-DataFrames. Apache Spark ist optional und nur nötig, wenn Sie die Verarbeitung auf einen Cluster verteilen möchten.
Ja. Beide Bibliotheken enthalten OCR. ScaleDP unterstützt Tesseract, EasyOCR, Surya und docTR, ScaleDP-TS nutzt PaddleOCR im Browser. So kann Text in gescannten Seiten und Bildern erkannt und geschwärzt werden.
Nein. ScaleDP-TS läuft vollständig clientseitig: PDF-Rendering, OCR und Entitätserkennung laufen im Browser über WebAssembly oder WebGPU. Nur die Modelldateien werden heruntergeladen; Ihre Dokumente verlassen das Gerät nie.
Wählen Sie die API, wenn Sie einen verwalteten Dienst möchten, den Sie aus jeder Programmiersprache aufrufen können, ohne selbst Modelle zu hosten, oder wenn Sie die Pflichten der AGPL-3.0 nicht in Ihre eigene Codebasis übernehmen möchten.
Brauchen Sie Hilfe bei der Integration von ScaleDP in Ihre Pipeline? Sprechen Sie mit unseren ML- und Data-Engineers über Ihre komplexesten Schwärzungs- und Dokumentverarbeitungsaufgaben.