I termini tecnici del mondo dei documenti digitali — OCR, DPI, raster, metadata e altri — spiegati in modo chiaro e pratico.
OCR (Optical Character Recognition)
Tecnologia che riconosce il testo all'interno di immagini e scansioni, trasformando i pixel in caratteri modificabili. L'OCR moderno, combinato con modelli di visione AI, riconosce anche la struttura del documento: tabelle, colonne, intestazioni. È il cuore della conversione dei documenti scansionati.
DPI (Dots Per Inch)
Punti per pollice: misura la risoluzione di una scansione o di una stampa. 150 DPI bastano per la lettura a schermo, 300 DPI sono lo standard per l'OCR di qualità, 600 DPI servono solo per dettagli finissimi e producono file molto pesanti. Una risoluzione più alta non sempre migliora l'estrazione: oltre i 300 DPI i benefici per l'OCR sono minimi.
Raster (immagine bitmap)
Immagine composta da una griglia di pixel, come le fotografie e le scansioni. Ingrandendola perde nitidezza ('sgranatura'). Un PDF scansionato è un contenitore di immagini raster: per estrarne i dati serve l'OCR, perché non contiene testo vero.
Vettoriale
Grafica descritta da formule matematiche (linee, curve, testo come caratteri) anziché da pixel: si ingrandisce all'infinito senza perdere qualità. I PDF 'nativi digitali' contengono testo vettoriale selezionabile, il che rende la loro conversione molto più precisa e veloce rispetto alle scansioni.
Metadata (metadati)
Informazioni invisibili incorporate nel file: autore, software di creazione, date di creazione e modifica, a volte cronologia. Prima di condividere un documento sensibile è buona pratica considerare anche i metadati: rigenerare il PDF (come fa l'export di Dotec) produce un file nuovo e pulito.
PDF/A
Variante del PDF pensata per l'archiviazione a lungo termine: incorpora tutti i font e vieta contenuti esterni o eseguibili, garantendo che il documento resti visualizzabile identico tra decenni. È spesso richiesto da enti pubblici e conservazione digitale a norma.
Font Embedding (incorporamento font)
Inclusione dei caratteri tipografici direttamente nel file PDF, così il documento appare identico anche su dispositivi che non hanno quei font installati. Senza embedding, il testo può essere sostituito da font simili con spostamenti di impaginazione.
Compressione lossy e lossless
Due famiglie di compressione: lossless (senza perdita) riduce il peso conservando ogni dettaglio; lossy (con perdita, es. JPEG) scarta informazioni poco percepibili ottenendo riduzioni molto maggiori. La compressione dei PDF scansionati usa tipicamente il lossy calibrato: peso minimo con leggibilità intatta.
Redazione (redaction)
Oscuramento permanente delle porzioni sensibili di un documento prima della condivisione. La redazione corretta rimuove o copre il dato in modo irreversibile nel file finale: un rettangolo di annotazione sopra il testo NON è redazione, perché il testo sottostante resta copiabile.
Rasterizzazione
Conversione di contenuto vettoriale in immagine a pixel. È il meccanismo usato dalla compressione spinta dei PDF (ogni pagina diventa un'immagine ottimizzata) e dall'inserimento di ritagli: il contenuto diventa un'immagine ad alta risoluzione, stabile e identica ovunque.
Tabella pivot
Strumento di Excel che riassume grandi tabelle raggruppando e aggregando i dati (somme, medie, conteggi) in modo interattivo. È uno dei motivi principali per convertire PDF in Excel: i dati intrappolati nel documento tornano analizzabili.
eIDAS
Regolamento europeo che disciplina identità digitale e firme elettroniche. Distingue firma elettronica semplice, avanzata e qualificata: solo l'ultima equivale per legge alla firma autografa, ma per moltissimi documenti quotidiani la firma semplice è ampiamente utilizzata.
Formato OOXML (.xlsx / .docx)
Standard aperto Office Open XML usato dai file Excel e Word moderni. I file generati in questo formato si aprono con Microsoft Office, LibreOffice, Google Documenti/Fogli e Apple iWork senza plugin aggiuntivi.
Anteprima modificabile
Fase intermedia tra estrazione e download in cui i dati convertiti si possono controllare e correggere direttamente nel browser. È la garanzia di qualità del flusso Dotec: l'AI fa il lavoro pesante, l'utente rifinisce e il file viene rigenerato all'istante con le correzioni.