PDF Redaction

También disponible como:

Herramienta OnlineStudio (Nube)Studio (Autoalojado)Studio de EscritorioAPI en la NubeAPI AutoalojadaIntegración n8nWidgetServidor MCPPlugin de Obsidian

ScaleDP: Biblioteca de Redacción de PDF para Python

Redacción con IA

Detecta y redacta automáticamente datos personales como nombres, ubicaciones, correos electrónicos y fechas.

Precisión según el contexto

Usa IA avanzada para entender el contexto y redactar con precisión.

Documentos escaneados (OCR)

OCR integrado con Tesseract, EasyOCR, Surya o docTR que detecta y redacta texto en imágenes y PDF escaneados.

Local o sobre Spark

Úsala como biblioteca de Python normal en un equipo, o escala el mismo pipeline sobre Apache Spark para redactar miles de documentos.

Multilingüe

Compatible con idiomas comunes: inglés, español, alemán, italiano, ruso y más.

Encaja en tu stack de datos

Funciona con DataFrames de Pandas y Spark, así la redacción se integra en tus flujos de datos y pipelines de machine learning.

ScaleDP: Ejemplo de Código en Python

Instala ScaleDP y compón un pipeline de redacción en pocas líneas: carga documentos en un DataFrame de Pandas o Spark, ejecuta OCR y detecta datos personales con NER.

pip install scaledp
from scaledp import *

spark = ScaleDPSession()

pipeline = PipelineModel(stages=[
    PdfDataToImage(),
    TesseractOcr(),
    Ner(model="d4data/biomedical-ner-all"),
])

result = pipeline.transform(df)

ScaleDP-TS: Biblioteca de Redacción de PDF para JavaScript

Sin subida, sin servidor

Los documentos nunca salen del navegador. OCR, NER y redacción se ejecutan en el cliente.

Funciona con onnxruntime-web

Los modelos se ejecutan localmente con WebAssembly o WebGPU, sin ida y vuelta al servidor.

OCR en el navegador

El reconocimiento de texto PaddleOCR detecta texto en imágenes y PDF escaneados.

NER zero-shot

GLiNER te permite definir tipos de entidad como "person" o "email" al llamar a la función, sin reentrenar.

Detección de firmas y rostros

Detectores basados en YOLO localizan firmas y rostros para redactarlos.

Modular y combinable

Importa solo lo que necesitas (/pdf, /ocr, /ner, /detect) y encadena etapas con una API de Pipeline sencilla.

ScaleDP-TS: Ejemplo de Código en JavaScript

Instala @stabrise/scaledp y compón el mismo tipo de pipeline completamente en el navegador con onnxruntime-web.

npm install @stabrise/scaledp
import { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'

const pipeline = new Pipeline([
  new PdfToImage({ resolution: 300 }),
  new PaddleTextRecognizer({ preset: 'v6-small' }),
  new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])

const rows = await pipeline.transform(file)

Biblioteca o API: ¿Cuál Necesitas?

Biblioteca open source

  • La ejecutas tú: en tus servidores, tu clúster de Spark o el navegador del usuario
  • Python (ScaleDP) o JavaScript y TypeScript (ScaleDP-TS)
  • Gratis bajo AGPL-3.0
  • Tú eliges y gestionas los modelos de OCR y NER

API y SDK de Redacción de PDF

  • API REST gestionada, también disponible autoalojada
  • Llámala desde cualquier lenguaje por HTTP
  • Nivel gratuito y después pago por página
  • Detección ajustada para producción de datos personales, firmas, fotos y códigos QR
Ver la API y SDK de redacción de PDF

Preguntas Frecuentes sobre la Biblioteca de Redacción de PDF

Sí. ScaleDP y ScaleDP-TS son open source bajo la licencia GNU AGPL-3.0, así que puedes usarlas, modificarlas y autoalojarlas gratis. La AGPL-3.0 exige que, si modificas el código y lo pones a disposición de otros, incluso a través de una red, compartas tus cambios bajo la misma licencia.

Usa ScaleDP para trabajos en servidor y por lotes en Python, en un solo equipo o escalado sobre Apache Spark. Usa ScaleDP-TS cuando los documentos deban quedarse en el dispositivo del usuario: ejecuta OCR, detección de datos personales y redacción en el navegador con onnxruntime-web.

No. ScaleDP funciona como una biblioteca de Python normal en un solo equipo con DataFrames de Pandas. Apache Spark es opcional y solo hace falta si quieres distribuir el procesamiento en un clúster.

Sí. Ambas bibliotecas incluyen OCR. ScaleDP admite Tesseract, EasyOCR, Surya y docTR, y ScaleDP-TS ejecuta PaddleOCR en el navegador, de modo que el texto de páginas e imágenes escaneadas se puede detectar y redactar.

No. ScaleDP-TS se ejecuta por completo en el cliente: el renderizado del PDF, el OCR y el reconocimiento de entidades se ejecutan en el navegador con WebAssembly o WebGPU. Solo se descargan los archivos de los modelos; tus documentos nunca salen del dispositivo.

Elige la API si quieres un servicio gestionado que puedas llamar desde cualquier lenguaje sin alojar modelos tú mismo, o si prefieres no asumir las obligaciones de la AGPL-3.0 en tu propio código.

Integra la redacción de PDF en tu plataforma

¿Necesitas ayuda para integrar ScaleDP en tu pipeline? Habla con nuestros ingenieros de ML y datos sobre tus retos más complejos de redacción y procesamiento de documentos.

ContáctanosComprueba tu redacción