PDF Redaction

PDF Redaction SDK

PDF Redaction SDK

Wykorzystaj PDF Redaction SDK do zaawansowanej redakcji PDF z przetwarzaniem rozproszonym, umożliwiając wysokowydajną automatyczną ochronę danych w dużych zestawach dokumentów.

ScaleDP

PDF Redaction SDK jest oparty na bibliotece open-source ScaleDP — bibliotece Pythona do przetwarzania dokumentów za pomocą potoków AI/ML, skalowanej przy użyciu Apache Spark i Pandas DataFrames.

pip install scaledp
from scaledp import *

spark = ScaleDPSession()

pipeline = PipelineModel(stages=[
    PdfDataToImage(),
    TesseractOcr(),
    Ner(model="d4data/biomedical-ner-all"),
])

result = pipeline.transform(df)

Linki: GitHub · PyPI · Docs

ScaleDP-TS

Wolisz zachować dokumenty po stronie klienta? ScaleDP-TS to nasz odpowiednik ScaleDP w TypeScript, który uruchamia potoki OCR, wykrywania danych PII i redakcji całkowicie w przeglądarce przy użyciu onnxruntime-web — żaden dokument nie jest przesyłany na serwer. Zawiera rozpoznawanie tekstu PaddleOCR, zero-shotowe NER GLiNER oraz wykrywanie YOLO (w tym podpisów i twarzy), złożone w oparciu o ten sam model potoku co biblioteka Python.

npm install @stabrise/scaledp
import { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'

const pipeline = new Pipeline([
  new PdfToImage({ resolution: 300 }),
  new PaddleTextRecognizer({ preset: 'v6-small' }),
  new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])

const rows = await pipeline.transform(file)

Linki: GitHub · npm · Docs

Wbuduj redakcję PDF w swoją platformę

Zacznij integrować nasze PDF Redaction SDK. Skontaktuj się już dziś z naszymi czołowymi inżynierami ML/Data, aby omówić Twoje najbardziej złożone wyzwania związane z redakcją i przetwarzaniem danych.

Skontaktuj się z nami

On this page