Skip to main content

Document Visual Extraction Worker

Stato: operativo. Coda: document.visual.extract.

Renderizza le pagine PDF ed estrae immagini incorporate, regioni vettoriali rilevanti, colori dominanti, hash percettivi e firme di layout. Produce anche derivate normalizzate per confrontare documenti di identità rimuovendo regioni variabili come ritratto, QR code, barcode e MRZ.

Architettura

  • Lo shell Node.js gestisce BullMQ, logging Vinova, settings, JWT e integrazione con il control plane.
  • Il motore Python esegue PDF/image processing.
  • I contenuti transitano da docs-service; i metadati vengono salvati tramite data-service.

Gli elementi conservano relevance score, motivazioni, bounding box e similarityEligible. Le annotazioni corrette nell'Admin Interface costituiscono casi verificati per migliorare detector e futuri dataset; non modificano retroattivamente gli artefatti già estratti.

Configurazione, nell'ordine DB, ambiente, default:

  • VISUAL_EXTRACTION_CONCURRENCY=1
  • VISUAL_EXTRACTION_RENDER_DPI=150