Skip to main content

Documents e AI

backbone_documents

Schema per metadata documentali, file references, versioni, testi estratti e stato di processing. La capability e condivisa, ma ogni record deve essere sempre application/tenant aware.

Tabelle attuali rAInty da mappare

Tabella attualeResponsabilita target
documentsMetadata documento; aggiungere application_code/tenant_id.
document_versionsVersioni documento.
document_textsTesto estratto/OCR legacy, da evolvere verso document_text_artifacts.
document_processing_runsRun pipeline.
document_processing_run_eventsEventi run.
document_processing_artifactsArtifact pipeline/enrichment.
document_duplicate_groupsGruppi duplicati.
document_duplicate_membersMembri gruppi duplicati.
document_lifecycle_linksLink rinnovo/renewal/sostituzione.
document_tagsTag documenti.
vector_rebuild_runsRebuild vector index.
vector_rebuild_run_itemsItem rebuild vector.
mail_message_documentsCollegamento mail-documento, se mail resta capability condivisa.

Nuove tabelle documents

Tabella targetResponsabilita
document_filesRegistra file fisici, storage provider, storage key, checksum, MIME type e dimensione; non contiene il binario.
document_pagesPagine renderizzate e metadati tecnici: dimensioni, rotazione, preview, OCR coverage e stato vision.
document_text_artifactsTesti derivati: OCR raw, testo normalizzato, testo anonimizzato, estratti per pagina o blocco.
document_visual_artifactsElementi grafici estratti: logo, header, footer, timbri, firme, tabelle, blocchi layout e crop visuali.
document_layout_artifactsStruttura documento, bounding box, blocchi pagina, relazioni spaziali e segnali layout.
document_artifact_redactionsTraccia anonimizzazione, pseudonimizzazione e rimozione dati sensibili applicata agli artifact.
document_access_grantsPermessi espliciti su documenti condivisi tra utenti, tenant o applicazioni.
document_processing_stepsStato granulare delle fasi: extraction, enrichment, classification, review, indexing.
document_processing_queue_entriesSnapshot/audit dei messaggi di coda collegati al documento.
document_processing_metricsMetriche tecniche per fase: durata, retry, errori, worker, modello, token e throughput.

Artifact e dataset derivati

Il documento originale non deve essere l'unica sorgente riusabile per training e benchmark.

La pipeline deve produrre artifact derivati:

documento originale
-> testo estratto
-> testo anonimizzato
-> elementi grafici estratti
-> layout/fingerprint/embedding
-> feature set training-ready
-> dataset item

L'obiettivo e creare dataset che funzionino anche se il PDF originale non e piu disponibile o non puo essere condiviso per ragioni privacy.

document_text_artifacts deve distinguere almeno:

  • raw_ocr;
  • normalized_text;
  • anonymized_text;
  • page_text;
  • snippet.

document_visual_artifacts deve contenere riferimenti a crop o feature grafiche:

  • logo_crop;
  • header_crop;
  • footer_crop;
  • stamp;
  • signature;
  • table_region;
  • layout_block.

Ogni artifact visuale deve avere, quando possibile, pagina, bounding box, storage key del crop, perceptual hash, embedding id o vector reference, privacy level e versione del processo estrattivo.

backbone_ai

Schema per LLM, enrichment, classificazione, benchmark, issuer knowledge base e dati semi-strutturati AI.

Tabelle attuali rAInty da mappare

Tabella attualeResponsabilita target
llm_usage_eventsUsage, costi e token per provider/modello/task.
llm_provider_balance_snapshotsSnapshot saldi provider.
llm_operation_categoriesCategorie operative LLM.
llm_learning_jobsJob di apprendimento/ottimizzazione LLM.
assistant_learning_casesCasi di apprendimento assistant.
assistant_training_examplesEsempi training assistant.
document_classification_auditAudit classificazione documento.
document_classification_learning_casesCasi learning classificazione.
document_classification_training_examplesTraining examples classificazione.
document_enrichment_cacheCache enrichment issuer/documenti.
document_issuersIssuer riconosciuti.
document_issuer_aliasesAlias issuer.
document_issuer_observationsOsservazioni issuer derivate da documenti.
document_issuer_document_typesMapping issuer -> tipi documento.
document_issuer_web_sourcesSorgenti web issuer.
document_similarity_runsEsecuzioni versionate della ricerca multimodale, scoped per utente e documento.
document_similarity_candidatesCandidati ordinati con score text, visual, layout e snapshot di classificazione/issuer.
document_issuer_resolution_runsEsecuzioni versionate del resolver locale, scoped per utente e documento.
document_issuer_resolution_candidatesIssuer candidati ordinati con confidence ed evidenze.
document_enrichment_eventsEventi enrichment.

Tabelle benchmark attuali da mappare

Tabella attualeResponsabilita target
benchmark_modelsCatalogo modelli benchmark.
benchmark_phasesFasi benchmark.
benchmark_metric_thresholdsSoglie metriche.
benchmark_datasetsDataset benchmark.
benchmark_dataset_sourcesSorgenti dataset.
golden_documentsGolden set documenti.
golden_document_textsTesti golden.
golden_document_classificationsClassificazioni golden.
golden_document_extractionsEstrazioni golden.
golden_document_pairsCoppie duplicate/renewal.
golden_review_itemsReview item.
benchmark_runsRun benchmark.
benchmark_run_modelsStato modelli per run.
benchmark_model_load_eventsEventi caricamento modello.
benchmark_run_casesCasi benchmark.
benchmark_resultsRisultati benchmark.
benchmark_result_metricsMetriche risultato.
benchmark_artifactsArtifact benchmark.

Nuove tabelle AI

Tabella targetResponsabilita
llm_modelsCatalogo modelli disponibili, locali o cloud, con tag, provider, stato, costo stimato e capability.
llm_providersConfigurazione logica dei provider LLM.
llm_model_capabilitiesCapability per modello: text, vision, JSON mode, embedding, context size, tool calling.
llm_prompt_templatesTemplate logici dei prompt per task ricorrenti.
llm_prompt_versionsVersioni immutabili dei prompt usati in produzione o benchmark.
embedding_modelsCatalogo modelli embedding e dimensioni vector.
vector_indexesNamespace/index vector disponibili, con application, tenant, modello embedding e privacy level.
issuer_visual_fingerprintsFingerprint visuali di logo/header associati a issuer confermati.
document_feature_setsSnapshot training-ready di feature testuali e visuali estratte dal documento.
training_datasetsDefinizione dataset training/benchmark, con task, versione, privacy level e stato review.
training_dataset_itemsEsempi dataset con input normalizzato e output atteso.
training_dataset_item_artifactsCollegamento tra dataset item e artifact sorgente testuali/visuali.
training_labelsLabel confermate manualmente o automaticamente per golden dataset e regression test.

document_feature_sets e il punto di separazione tra document processing e training. Puo riferirsi al documento originale, ma deve contenere o referenziare abbastanza informazione derivata per essere usabile anche senza riaprire il documento.

Ogni record usato per training deve avere un privacy_level esplicito:

raw
pseudonymized
anonymized
synthetic
safe_for_training