Skip to main content

Document Evidence Consolidation Worker

Stato: operativo. Coda: document.evidence.consolidate. Workflow: file-text-only@1.8.0.

Prepara il confine stabile fra enrichment e classificazione. Non assegna un tipo al documento: raccoglie e normalizza le evidenze prodotte dai worker precedenti e crea uno snapshot immutabile, versionato e riproducibile.

Input consolidati

  • testo estratto e metriche di disponibilità;
  • artefatti visuali e tipologie rilevate;
  • candidati di similarità, score e classificazioni confermate disponibili;
  • associazione documento/issuer e relativa provenance;
  • tipi documentali confermati per l'issuer e suggerimenti provenienti dal web;
  • stato degli step del processing run.

Lo snapshot separa dati intrinseci, inferenze e informazioni confermate. Calcola completezza, qualità per canale, readiness per la classificazione, conflitti e step attesi mancanti.

Persistenza e sicurezza

I run sono salvati in backbone_documents.document_evidence_consolidation_runs; gli snapshot in backbone_documents.document_evidence_snapshots. Tutte le righe contengono user_id, documento, versione e processing run. Il worker usa esclusivamente data-service con JWT interno e contesto utente/documento; non accede direttamente a Datahub, PostgreSQL o Qdrant.

L'output BullMQ contiene solo identificativi, hash, completezza, readiness e numero di conflitti. Il JSON completo resta nel database e conserva la provenance dei record sorgente.

Configurazione

Priorità: setting DB, variabile d'ambiente, default.

  • DOCUMENT_EVIDENCE_CONSOLIDATION_CONCURRENCY, default 2;
  • DOCUMENT_EVIDENCE_MIN_COMPLETENESS, default 0.5;
  • DOCUMENT_EVIDENCE_GOOD_TEXT_CHARS, default 1000;
  • DOCUMENT_EVIDENCE_GOOD_VISUAL_ELEMENTS, default 3.

Il successivo Document Classification Worker dovrà leggere lo snapshot senza conoscere le tabelle e i dettagli interni dei worker precedenti.