Redacta datos personales en PDF desde tu propio código. ScaleDP (Python) y ScaleDP-TS (JavaScript) combinan OCR, detección de entidades con IA y redacción en un solo pipeline, en tu propio hardware o completamente en el navegador.
pip install scaledpnpm install @stabrise/scaledpTambién disponible como:
Herramienta OnlineStudio (Nube)Studio (Autoalojado)Studio de EscritorioAPI en la NubeAPI AutoalojadaIntegración n8nWidgetServidor MCPPlugin de ObsidianDetecta y redacta automáticamente datos personales como nombres, ubicaciones, correos electrónicos y fechas.
Usa IA avanzada para entender el contexto y redactar con precisión.
OCR integrado con Tesseract, EasyOCR, Surya o docTR que detecta y redacta texto en imágenes y PDF escaneados.
Úsala como biblioteca de Python normal en un equipo, o escala el mismo pipeline sobre Apache Spark para redactar miles de documentos.
Compatible con idiomas comunes: inglés, español, alemán, italiano, ruso y más.
Funciona con DataFrames de Pandas y Spark, así la redacción se integra en tus flujos de datos y pipelines de machine learning.
Instala ScaleDP y compón un pipeline de redacción en pocas líneas: carga documentos en un DataFrame de Pandas o Spark, ejecuta OCR y detecta datos personales con NER.
pip install scaledpfrom scaledp import *
spark = ScaleDPSession()
pipeline = PipelineModel(stages=[
PdfDataToImage(),
TesseractOcr(),
Ner(model="d4data/biomedical-ner-all"),
])
result = pipeline.transform(df)Los documentos nunca salen del navegador. OCR, NER y redacción se ejecutan en el cliente.
Los modelos se ejecutan localmente con WebAssembly o WebGPU, sin ida y vuelta al servidor.
El reconocimiento de texto PaddleOCR detecta texto en imágenes y PDF escaneados.
GLiNER te permite definir tipos de entidad como "person" o "email" al llamar a la función, sin reentrenar.
Detectores basados en YOLO localizan firmas y rostros para redactarlos.
Importa solo lo que necesitas (/pdf, /ocr, /ner, /detect) y encadena etapas con una API de Pipeline sencilla.
Instala @stabrise/scaledp y compón el mismo tipo de pipeline completamente en el navegador con onnxruntime-web.
npm install @stabrise/scaledpimport { Pipeline } from '@stabrise/scaledp'
import { PdfToImage } from '@stabrise/scaledp/pdf'
import { PaddleTextRecognizer } from '@stabrise/scaledp/ocr'
import { GlinerNer } from '@stabrise/scaledp/ner'
const pipeline = new Pipeline([
new PdfToImage({ resolution: 300 }),
new PaddleTextRecognizer({ preset: 'v6-small' }),
new GlinerNer({ labels: ['person', 'email', 'phone'] }),
])
const rows = await pipeline.transform(file)Sí. ScaleDP y ScaleDP-TS son open source bajo la licencia GNU AGPL-3.0, así que puedes usarlas, modificarlas y autoalojarlas gratis. La AGPL-3.0 exige que, si modificas el código y lo pones a disposición de otros, incluso a través de una red, compartas tus cambios bajo la misma licencia.
Usa ScaleDP para trabajos en servidor y por lotes en Python, en un solo equipo o escalado sobre Apache Spark. Usa ScaleDP-TS cuando los documentos deban quedarse en el dispositivo del usuario: ejecuta OCR, detección de datos personales y redacción en el navegador con onnxruntime-web.
No. ScaleDP funciona como una biblioteca de Python normal en un solo equipo con DataFrames de Pandas. Apache Spark es opcional y solo hace falta si quieres distribuir el procesamiento en un clúster.
Sí. Ambas bibliotecas incluyen OCR. ScaleDP admite Tesseract, EasyOCR, Surya y docTR, y ScaleDP-TS ejecuta PaddleOCR en el navegador, de modo que el texto de páginas e imágenes escaneadas se puede detectar y redactar.
No. ScaleDP-TS se ejecuta por completo en el cliente: el renderizado del PDF, el OCR y el reconocimiento de entidades se ejecutan en el navegador con WebAssembly o WebGPU. Solo se descargan los archivos de los modelos; tus documentos nunca salen del dispositivo.
Elige la API si quieres un servicio gestionado que puedas llamar desde cualquier lenguaje sin alojar modelos tú mismo, o si prefieres no asumir las obligaciones de la AGPL-3.0 en tu propio código.
¿Necesitas ayuda para integrar ScaleDP en tu pipeline? Habla con nuestros ingenieros de ML y datos sobre tus retos más complejos de redacción y procesamiento de documentos.