Skip to main content

Document Text Extraction Worker

Stato: operativo. Coda: document.text.extract.

Estrae il text layer selezionabile dai PDF e usa Google Vision OCR come fallback quando configurato e necessario. Recupera il documento da docs-service e salva testo, metriche e stato tramite data-service con JWT interno contenente il contesto utente/documento.

Risultati

  • testo estratto e suddivisione per pagina;
  • metodo utilizzato, inclusa l'eventuale OCR;
  • qualità e metriche disponibili;
  • artefatti e output del task versionati per audit e Admin Interface.

Il worker non vettorializza direttamente: il control plane passa il contributo completato a document-knowledge-indexing-worker. Può lavorare in parallelo all'estrazione visuale.

Configurazione: TEXT_EXTRACTION_CONCURRENCY, risolta nell'ordine DB, ambiente, default 1.