davidcastagnetoa/skills

paddleocr

OCR multiidioma de alta precisión completamente self-hosted para extracción de texto de documentos

First seen Mar 6, 2026

Installation

$ npx skills add davidcastagnetoa/skills --skill paddleocr

Similar popular skills

Related neighbors and high-traction skills in the same topics — useful to compare before installing.

Also in this package

Other skills from davidcastagnetoa/skills · top by installs.

npx skills add davidcastagnetoa/skills

Browse all from davidcastagnetoa/skills

More details

Agent compatibility

Declared targets from SKILL.md / docs. Unmarked agents are not listed — the skill may still install via the CLI.

Claude Code Not declared
Cursor Not declared
Codex Not declared
GitHub Copilot Not declared
Windsurf Not declared
Gemini CLI Not declared
Cline Not declared
OpenCode Not declared

Repository health

Stars 1
Default branch main
Open issues 0
Status Active

Package contents

Files included with this skill beyond the listing page.

  • skill md SKILL.md 1,465 B
  • docs SUMMARY.md 117 B

History

  1. First seen on skills.sh
  2. First recorded snapshot · 6 installs

SKILL.md

paddleocr

PaddleOCR es el motor OCR principal del sistema. Ofrece alta precisión en múltiples idiomas e incluye detección de texto, reconocimiento y clasificación de orientación.

When to use

Usar para extraer todos los campos de texto del documento: nombre, apellidos, fecha de nacimiento, número de documento, fecha de expiración, nacionalidad.

Instructions

  1. Instalar: pip install paddlepaddle paddleocr.
  2. Inicializar con modelos en español/inglés: ocr = PaddleOCR(useanglecls=True, lang='es', use_gpu=True).
  3. Procesar imagen: result = ocr.ocr(img_path, cls=True).
  4. El resultado es una lista de [[bounding_box], [text, confidence]] para cada región de texto.
  5. Filtrar por confianza mínima: confidence > 0.8.
  6. Aplicar post-procesamiento: limpiar caracteres extraños, normalizar espacios.
  7. Combinar con las regiones detectadas por YOLOv8 para extracción de campos específicos.
  8. Para el MRZ, aplicar el parser ICAO separadamente sobre la región MRZ recortada.

Notes

  • Repositorio oficial: https://github.com/PaddlePaddle/PaddleOCR
  • EasyOCR es la alternativa: pip install easyocr — misma interfaz, diferente precisión por idioma.
  • Configurar use_gpu=False si no hay GPU disponible (mayor latencia esperada).