PDF Redaction

PDF Redaction SDK

PDF Redaction SDK

Nutzen Sie das PDF Redaction SDK für erweiterte PDF-Schwärzung mit verteilter Verarbeitung und ermöglichen Sie hochperformanten automatisierten Datenschutz für große Dokumentensätze.

ScaleDP

Das PDF Redaction SDK basiert auf der Open-Source-Bibliothek ScaleDP — einer Python-Bibliothek zur Verarbeitung von Dokumenten mit AI/ML-Pipelines, skaliert mit Apache Spark und Pandas DataFrames.

pip install scaledp
from scaledp import *

spark = ScaleDPSession()

pipeline = PipelineModel(stages=[
    PdfDataToImage(),
    TesseractOcr(),
    Ner(model="d4data/biomedical-ner-all"),
])

result = pipeline.transform(df)

Links: GitHub · PyPI · Docs

ScaleDP-TS

Möchten Sie Dokumente clientseitig behalten? ScaleDP-TS ist unser TypeScript-Pendant zu ScaleDP, das OCR-, PII-Erkennungs- und Schwärzungs-Pipelines vollständig im Browser mit onnxruntime-web ausführt — es wird kein Dokument an einen Server hochgeladen. Es enthält PaddleOCR-Texterkennung, GLiNER Zero-Shot-NER und YOLO-Erkennung (einschließlich Unterschriften und Gesichtern), zusammengesetzt über dasselbe Pipeline-Modell wie die Python-Bibliothek.

npm install @stabrise/scaledp
import { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'

const pipeline = new Pipeline([
  new PdfToImage({ resolution: 300 }),
  new PaddleTextRecognizer({ preset: 'v6-small' }),
  new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])

const rows = await pipeline.transform(file)

Links: GitHub · npm · Docs

Integrieren Sie PDF-Schwärzung in Ihre Plattform

Beginnen Sie mit der Integration unseres PDF Redaction SDK. Verbinden Sie sich noch heute mit unseren führenden ML/Data-Ingenieuren, um Ihre komplexesten Schwärzungs- und Datenverarbeitungsherausforderungen zu besprechen.

Kontaktieren Sie uns

On this page