Documents e AI
backbone_documents
Schema per metadata documentali, file references, versioni, testi estratti e stato di processing. La capability e condivisa, ma ogni record deve essere sempre application/tenant aware.
Tabelle attuali rAInty da mappare
| Tabella attuale | Responsabilita target |
|---|---|
documents | Metadata documento; aggiungere application_code/tenant_id. |
document_versions | Versioni documento. |
document_texts | Testo estratto/OCR legacy, da evolvere verso document_text_artifacts. |
document_processing_runs | Run pipeline. |
document_processing_run_events | Eventi run. |
document_processing_artifacts | Artifact pipeline/enrichment. |
document_duplicate_groups | Gruppi duplicati. |
document_duplicate_members | Membri gruppi duplicati. |
document_lifecycle_links | Link rinnovo/renewal/sostituzione. |
document_tags | Tag documenti. |
vector_rebuild_runs | Rebuild vector index. |
vector_rebuild_run_items | Item rebuild vector. |
mail_message_documents | Collegamento mail-documento, se mail resta capability condivisa. |
Nuove tabelle documents
| Tabella target | Responsabilita |
|---|---|
document_files | Registra file fisici, storage provider, storage key, checksum, MIME type e dimensione; non contiene il binario. |
document_pages | Pagine renderizzate e metadati tecnici: dimensioni, rotazione, preview, OCR coverage e stato vision. |
document_text_artifacts | Testi derivati: OCR raw, testo normalizzato, testo anonimizzato, estratti per pagina o blocco. |
document_visual_artifacts | Elementi grafici estratti: logo, header, footer, timbri, firme, tabelle, blocchi layout e crop visuali. |
document_layout_artifacts | Struttura documento, bounding box, blocchi pagina, relazioni spaziali e segnali layout. |
document_artifact_redactions | Traccia anonimizzazione, pseudonimizzazione e rimozione dati sensibili applicata agli artifact. |
document_access_grants | Permessi espliciti su documenti condivisi tra utenti, tenant o applicazioni. |
document_processing_steps | Stato granulare delle fasi: extraction, enrichment, classification, review, indexing. |
document_processing_queue_entries | Snapshot/audit dei messaggi di coda collegati al documento. |
document_processing_metrics | Metriche tecniche per fase: durata, retry, errori, worker, modello, token e throughput. |
Artifact e dataset derivati
Il documento originale non deve essere l'unica sorgente riusabile per training e benchmark.
La pipeline deve produrre artifact derivati:
documento originale
-> testo estratto
-> testo anonimizzato
-> elementi grafici estratti
-> layout/fingerprint/embedding
-> feature set training-ready
-> dataset item
L'obiettivo e creare dataset che funzionino anche se il PDF originale non e piu disponibile o non puo essere condiviso per ragioni privacy.
document_text_artifacts deve distinguere almeno:
raw_ocr;normalized_text;anonymized_text;page_text;snippet.
document_visual_artifacts deve contenere riferimenti a crop o feature grafiche:
logo_crop;header_crop;footer_crop;stamp;signature;table_region;layout_block.
Ogni artifact visuale deve avere, quando possibile, pagina, bounding box, storage key del crop, perceptual hash, embedding id o vector reference, privacy level e versione del processo estrattivo.
backbone_ai
Schema per LLM, enrichment, classificazione, benchmark, issuer knowledge base e dati semi-strutturati AI.
Tabelle attuali rAInty da mappare
| Tabella attuale | Responsabilita target |
|---|---|
llm_usage_events | Usage, costi e token per provider/modello/task. |
llm_provider_balance_snapshots | Snapshot saldi provider. |
llm_operation_categories | Categorie operative LLM. |
llm_learning_jobs | Job di apprendimento/ottimizzazione LLM. |
assistant_learning_cases | Casi di apprendimento assistant. |
assistant_training_examples | Esempi training assistant. |
document_classification_audit | Audit classificazione documento. |
document_classification_learning_cases | Casi learning classificazione. |
document_classification_training_examples | Training examples classificazione. |
document_enrichment_cache | Cache enrichment issuer/documenti. |
document_issuers | Issuer riconosciuti. |
document_issuer_aliases | Alias issuer. |
document_issuer_observations | Osservazioni issuer derivate da documenti. |
document_issuer_document_types | Mapping issuer -> tipi documento. |
document_issuer_web_sources | Sorgenti web issuer. |
document_similarity_runs | Esecuzioni versionate della ricerca multimodale, scoped per utente e documento. |
document_similarity_candidates | Candidati ordinati con score text, visual, layout e snapshot di classificazione/issuer. |
document_issuer_resolution_runs | Esecuzioni versionate del resolver locale, scoped per utente e documento. |
document_issuer_resolution_candidates | Issuer candidati ordinati con confidence ed evidenze. |
document_enrichment_events | Eventi enrichment. |
Tabelle benchmark attuali da mappare
| Tabella attuale | Responsabilita target |
|---|---|
benchmark_models | Catalogo modelli benchmark. |
benchmark_phases | Fasi benchmark. |
benchmark_metric_thresholds | Soglie metriche. |
benchmark_datasets | Dataset benchmark. |
benchmark_dataset_sources | Sorgenti dataset. |
golden_documents | Golden set documenti. |
golden_document_texts | Testi golden. |
golden_document_classifications | Classificazioni golden. |
golden_document_extractions | Estrazioni golden. |
golden_document_pairs | Coppie duplicate/renewal. |
golden_review_items | Review item. |
benchmark_runs | Run benchmark. |
benchmark_run_models | Stato modelli per run. |
benchmark_model_load_events | Eventi caricamento modello. |
benchmark_run_cases | Casi benchmark. |
benchmark_results | Risultati benchmark. |
benchmark_result_metrics | Metriche risultato. |
benchmark_artifacts | Artifact benchmark. |
Nuove tabelle AI
| Tabella target | Responsabilita |
|---|---|
llm_models | Catalogo modelli disponibili, locali o cloud, con tag, provider, stato, costo stimato e capability. |
llm_providers | Configurazione logica dei provider LLM. |
llm_model_capabilities | Capability per modello: text, vision, JSON mode, embedding, context size, tool calling. |
llm_prompt_templates | Template logici dei prompt per task ricorrenti. |
llm_prompt_versions | Versioni immutabili dei prompt usati in produzione o benchmark. |
embedding_models | Catalogo modelli embedding e dimensioni vector. |
vector_indexes | Namespace/index vector disponibili, con application, tenant, modello embedding e privacy level. |
issuer_visual_fingerprints | Fingerprint visuali di logo/header associati a issuer confermati. |
document_feature_sets | Snapshot training-ready di feature testuali e visuali estratte dal documento. |
training_datasets | Definizione dataset training/benchmark, con task, versione, privacy level e stato review. |
training_dataset_items | Esempi dataset con input normalizzato e output atteso. |
training_dataset_item_artifacts | Collegamento tra dataset item e artifact sorgente testuali/visuali. |
training_labels | Label confermate manualmente o automaticamente per golden dataset e regression test. |
document_feature_sets e il punto di separazione tra document processing e training. Puo riferirsi al documento originale, ma deve contenere o referenziare abbastanza informazione derivata per essere usabile anche senza riaprire il documento.
Ogni record usato per training deve avere un privacy_level esplicito:
raw
pseudonymized
anonymized
synthetic
safe_for_training