JP Sámano

Todo el trabajo

Pipelines de documentos legales

Entregado

Organicé y extraje metadatos de dos archivos legales confidenciales con Claude visión y la Batch API: 13,288 documentos de un operador de telecomunicaciones y 903 registros notariales de un grupo de seguridad.

Rol
Ingeniero, LegalShelf
Periodo
jun – jul 2026
Estado
Entregado
Conciliar01Planear02Copiar03Leer04Extraer05Verificar06Entregar07
Texto si es legible, Claude visión si es escaneo, todo por la Batch API. Solo copia, verificado por hash.
documentos procesados
14,191
archivos verificados por hash
903/903
campos por documento
10
primer archivo, construcción y corrida
3 days

Cifras al 11 de septiembre de 2026.

Problema

El área legal de un operador de telecomunicaciones tenía más de 13,000 contratos, instrumentos corporativos y trámites regulatorios escaneados, indexados en una hoja de cálculo en la que nadie confiaba. Un segundo cliente guardaba sus escrituras y asientos de libros corporativos en una USB, con duplicados y sin estructura.

Restricciones

  • Documentos confidenciales: nada puede moverse ni modificarse, solo copiarse.
  • La mayoría de las páginas son escaneos sin capa de texto.
  • El índice del cliente no era confiable, pero seguía siendo útil como pista.
  • Un presupuesto fijo por documento y un pipeline que puede detenerse y reanudarse en cualquier punto.

Decisiones

  1. Un lector híbrido en lugar de un paso de OCR aparte

    Las páginas con texto legible se leen como texto; los escaneos se renderizan y se envían a Claude visión. Eliminó toda una etapa de OCR y sus fallas.

  2. La Batch API, y el índice del cliente como referencia

    El procesamiento por lotes redujo el costo a la mitad, y pasar el índice existente como pista permitió al modelo verificarlo y corregirlo en lugar de empezar a ciegas.

  3. Solo copiar, con una compuerta de hashes antes de tocar algo

    El organizador solo copia, y una compuerta de verificación compara cada archivo por hash. En el archivo notarial pasó 903 de 903 sin ninguna diferencia.

Resultado

El archivo del operador quedó organizado en 12 áreas legales con 10 campos por documento, entregado con un libro maestro conciliado. El archivo notarial quedó clasificado en documentos protocolizados, societarios y otros, con cinco campos cada uno, y se entregó con un libro con ligas. Cuando el primer cliente señaló el manejo de anexos, rastreé la causa y diseñé una segunda fase que concilia cada anexo uno a uno.

Evidencia

  • 13,288 documentos extraídos; una auditoría de calidad no encontró diferencias entre árbol, plan y libro.
  • 903 de 903 archivos notariales verificados por hash antes de la entrega.
  • Los nombres y documentos de los clientes son confidenciales; puedo explicar el diseño del pipeline.

Tecnologías

PythonClaude APIBatch APIPyMuPDFopenpyxlGoogle Apps Script