PDF Redaction

PDF Redaction SDK

PDF Redaction SDK

Aproveche el PDF Redaction SDK para redacción avanzada de PDF con procesamiento distribuido, permitiendo protección de datos automatizada de alto rendimiento en grandes conjuntos de documentos.

ScaleDP

El PDF Redaction SDK está basado en la biblioteca de código abierto ScaleDP — una biblioteca de Python para procesar documentos mediante canalizaciones de IA/ML, escalada con Apache Spark y Pandas DataFrames.

pip install scaledp
from scaledp import *

spark = ScaleDPSession()

pipeline = PipelineModel(stages=[
    PdfDataToImage(),
    TesseractOcr(),
    Ner(model="d4data/biomedical-ner-all"),
])

result = pipeline.transform(df)

Enlaces: GitHub · PyPI · Docs

ScaleDP-TS

¿Prefiere mantener los documentos en el lado del cliente? ScaleDP-TS es nuestra versión en TypeScript de ScaleDP, que ejecuta canalizaciones de OCR, detección de PII y redacción completamente en el navegador usando onnxruntime-web — ningún documento se sube a un servidor. Incluye reconocimiento de texto PaddleOCR, NER de disparo cero con GLiNER y detección YOLO (incluyendo firmas y rostros), compuestos mediante el mismo modelo de canalización que la biblioteca de Python.

npm install @stabrise/scaledp
import { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'

const pipeline = new Pipeline([
  new PdfToImage({ resolution: 300 }),
  new PaddleTextRecognizer({ preset: 'v6-small' }),
  new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])

const rows = await pipeline.transform(file)

Enlaces: GitHub · npm · Docs

Integre la redacción de PDF en su plataforma

Comience a integrar nuestro PDF Redaction SDK. Conéctese hoy con nuestros principales ingenieros ML/Data para discutir sus desafíos más complejos de redacción y procesamiento de datos.

Contáctenos

On this page