PDF Redaction SDK
PDF Redaction SDK
Dostępne również jako:
Narzędzie OnlineStudio (Chmura)Studio (Self-Hosted)Studio DesktopAPI w ChmurzeAPI Self-HostedIntegracja n8nWidgetSerwer MCPWtyczka ObsidianWykorzystaj PDF Redaction SDK do zaawansowanej redakcji PDF z przetwarzaniem rozproszonym, umożliwiając wysokowydajną automatyczną ochronę danych w dużych zestawach dokumentów.
ScaleDP
PDF Redaction SDK jest oparty na bibliotece open-source ScaleDP — bibliotece Pythona do przetwarzania dokumentów za pomocą potoków AI/ML, skalowanej przy użyciu Apache Spark i Pandas DataFrames.
pip install scaledpfrom scaledp import *
spark = ScaleDPSession()
pipeline = PipelineModel(stages=[
PdfDataToImage(),
TesseractOcr(),
Ner(model="d4data/biomedical-ner-all"),
])
result = pipeline.transform(df)ScaleDP-TS
Wolisz zachować dokumenty po stronie klienta? ScaleDP-TS to nasz odpowiednik ScaleDP w TypeScript, który uruchamia potoki OCR, wykrywania danych PII i redakcji całkowicie w przeglądarce przy użyciu onnxruntime-web — żaden dokument nie jest przesyłany na serwer. Zawiera rozpoznawanie tekstu PaddleOCR, zero-shotowe NER GLiNER oraz wykrywanie YOLO (w tym podpisów i twarzy), złożone w oparciu o ten sam model potoku co biblioteka Python.
npm install @stabrise/scaledpimport { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'
const pipeline = new Pipeline([
new PdfToImage({ resolution: 300 }),
new PaddleTextRecognizer({ preset: 'v6-small' }),
new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])
const rows = await pipeline.transform(file)Wbuduj redakcję PDF w swoją platformę
Zacznij integrować nasze PDF Redaction SDK. Skontaktuj się już dziś z naszymi czołowymi inżynierami ML/Data, aby omówić Twoje najbardziej złożone wyzwania związane z redakcją i przetwarzaniem danych.
Skontaktuj się z nami