Document Visual Extraction Worker
Stato: operativo. Coda: document.visual.extract.
Renderizza le pagine PDF ed estrae immagini incorporate, regioni vettoriali rilevanti, colori dominanti, hash percettivi e firme di layout. Produce anche derivate normalizzate per confrontare documenti di identità rimuovendo regioni variabili come ritratto, QR code, barcode e MRZ.
Architettura
- Lo shell Node.js gestisce BullMQ, logging Vinova, settings, JWT e integrazione con il control plane.
- Il motore Python esegue PDF/image processing.
- I contenuti transitano da
docs-service; i metadati vengono salvati tramitedata-service.
Gli elementi conservano relevance score, motivazioni, bounding box e similarityEligible. Le annotazioni corrette nell'Admin Interface costituiscono casi verificati per migliorare detector e futuri dataset; non modificano retroattivamente gli artefatti già estratti.
Configurazione, nell'ordine DB, ambiente, default:
VISUAL_EXTRACTION_CONCURRENCY=1VISUAL_EXTRACTION_RENDER_DPI=150