PDF Redaction

Auch verfügbar als:

Online-ToolStudio (Cloud)Studio (Self-Hosted)Studio DesktopCloud-APISelf-Hosted-APIn8n-IntegrationWidgetMCP-ServerObsidian-Plugin

ScaleDP: Bibliothek zum PDF-Schwärzen für Python

KI-gestützte Schwärzung

Erkennt und schwärzt automatisch personenbezogene Daten wie Namen, Orte, E-Mails und Datumsangaben.

Kontextbezogene Genauigkeit

Nutzt fortschrittliche KI, um den Kontext zu verstehen und präzise zu schwärzen.

Gescannte Dokumente (OCR)

Integrierte OCR mit Tesseract, EasyOCR, Surya oder docTR erkennt und schwärzt Text in gescannten Bildern und PDFs.

Lokal oder auf Spark

Nutzen Sie sie als normale Python-Bibliothek auf einem Rechner oder skalieren Sie dieselbe Pipeline auf Apache Spark, um Tausende Dokumente zu schwärzen.

Mehrsprachig

Unterstützt gängige Sprachen: Englisch, Spanisch, Deutsch, Italienisch, Russisch und weitere.

Passt in Ihren Daten-Stack

Arbeitet mit Pandas- und Spark-DataFrames, sodass sich die Schwärzung in bestehende Daten-Workflows und ML-Pipelines einfügt.

ScaleDP: Python-Codebeispiel

Installieren Sie ScaleDP und bauen Sie eine Schwärzungspipeline in wenigen Zeilen: Dokumente in ein Pandas- oder Spark-DataFrame laden, OCR ausführen und personenbezogene Daten per NER erkennen.

pip install scaledp
from scaledp import *

spark = ScaleDPSession()

pipeline = PipelineModel(stages=[
    PdfDataToImage(),
    TesseractOcr(),
    Ner(model="d4data/biomedical-ner-all"),
])

result = pipeline.transform(df)

ScaleDP-TS: Bibliothek zum PDF-Schwärzen für JavaScript

Kein Upload, kein Server

Dokumente verlassen nie den Browser. OCR, NER und Schwärzung laufen vollständig clientseitig.

Läuft auf onnxruntime-web

Modelle laufen lokal über WebAssembly oder WebGPU, ohne Umweg über einen Server.

OCR im Browser

PaddleOCR erkennt Text in gescannten Bildern und PDFs.

Zero-Shot-NER

Mit GLiNER definieren Sie Entitätstypen wie „person“ oder „email“ beim Aufruf – ohne Nachtraining.

Erkennung von Unterschriften & Gesichtern

YOLO-basierte Detektoren finden Unterschriften und Gesichter zum Schwärzen.

Modular & kombinierbar

Importieren Sie nur, was Sie brauchen (/pdf, /ocr, /ner, /detect), und verketten Sie Schritte mit einer einfachen Pipeline-API.

ScaleDP-TS: JavaScript-Codebeispiel

Installieren Sie @stabrise/scaledp und bauen Sie dieselbe Art von Pipeline vollständig im Browser mit onnxruntime-web.

npm install @stabrise/scaledp
import { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'

const pipeline = new Pipeline([
  new PdfToImage({ resolution: 300 }),
  new PaddleTextRecognizer({ preset: 'v6-small' }),
  new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])

const rows = await pipeline.transform(file)

Bibliothek oder API: Was brauchen Sie?

Open-Source-Bibliothek

  • Sie betreiben sie selbst: auf Ihren Servern, Ihrem Spark-Cluster oder im Browser der Nutzer
  • Python (ScaleDP) oder JavaScript und TypeScript (ScaleDP-TS)
  • Kostenlos unter AGPL-3.0
  • Sie wählen und verwalten die OCR- und NER-Modelle

PDF-Schwärzungs-API & SDK

  • Verwaltete REST-API, auch selbst gehostet verfügbar
  • Aufruf aus jeder Programmiersprache über HTTP
  • Kostenloses Kontingent, danach Abrechnung pro Seite
  • Für den Produktionseinsatz abgestimmte Erkennung von PII, Unterschriften, Fotos und QR-Codes
Zur PDF-Schwärzungs-API & SDK

Häufige Fragen zur PDF-Schwärzungsbibliothek

Ja. ScaleDP und ScaleDP-TS sind Open Source unter der GNU AGPL-3.0. Sie können sie kostenlos nutzen, anpassen und selbst hosten. Die AGPL-3.0 verlangt, dass Sie Ihre Änderungen unter derselben Lizenz offenlegen, wenn Sie den Code verändern und anderen zur Verfügung stellen – auch über ein Netzwerk.

Nutzen Sie ScaleDP für serverseitige und Batch-Jobs in Python, auf einem einzelnen Rechner oder skaliert auf Apache Spark. Nutzen Sie ScaleDP-TS, wenn Dokumente auf dem Gerät der Nutzer bleiben müssen: Es führt OCR, PII-Erkennung und Schwärzung mit onnxruntime-web im Browser aus.

Nein. ScaleDP funktioniert als normale Python-Bibliothek auf einem einzelnen Rechner mit Pandas-DataFrames. Apache Spark ist optional und nur nötig, wenn Sie die Verarbeitung auf einen Cluster verteilen möchten.

Ja. Beide Bibliotheken enthalten OCR. ScaleDP unterstützt Tesseract, EasyOCR, Surya und docTR, ScaleDP-TS nutzt PaddleOCR im Browser. So kann Text in gescannten Seiten und Bildern erkannt und geschwärzt werden.

Nein. ScaleDP-TS läuft vollständig clientseitig: PDF-Rendering, OCR und Entitätserkennung laufen im Browser über WebAssembly oder WebGPU. Nur die Modelldateien werden heruntergeladen; Ihre Dokumente verlassen das Gerät nie.

Wählen Sie die API, wenn Sie einen verwalteten Dienst möchten, den Sie aus jeder Programmiersprache aufrufen können, ohne selbst Modelle zu hosten, oder wenn Sie die Pflichten der AGPL-3.0 nicht in Ihre eigene Codebasis übernehmen möchten.

Integrieren Sie PDF-Schwärzung in Ihre Plattform

Brauchen Sie Hilfe bei der Integration von ScaleDP in Ihre Pipeline? Sprechen Sie mit unseren ML- und Data-Engineers über Ihre komplexesten Schwärzungs- und Dokumentverarbeitungsaufgaben.

KontaktSchwärzung prüfen