Document Text Extraction Worker
Stato: operativo. Coda: document.text.extract.
Estrae il text layer selezionabile dai PDF e usa Google Vision OCR come fallback quando configurato e necessario. Recupera il documento da docs-service e salva testo, metriche e stato tramite data-service con JWT interno contenente il contesto utente/documento.
Risultati
- testo estratto e suddivisione per pagina;
- metodo utilizzato, inclusa l'eventuale OCR;
- qualità e metriche disponibili;
- artefatti e output del task versionati per audit e Admin Interface.
Il worker non vettorializza direttamente: il control plane passa il contributo completato a document-knowledge-indexing-worker. Può lavorare in parallelo all'estrazione visuale.
Configurazione: TEXT_EXTRACTION_CONCURRENCY, risolta nell'ordine DB, ambiente, default 1.