In breve: il web scraping può raccogliere dati da pagine e documenti quando non esiste una API adeguata, ma la fattibilità tecnica non basta. Prima di automatizzare servono una fonte legittimamente accessibile, uno scopo definito, una valutazione di condizioni d’uso e privacy, limiti di frequenza, controlli di qualità e un piano per gestire i cambiamenti.

Che cos’è il web scraping?

È l’estrazione automatizzata di informazioni da risorse web. Un software richiede una pagina o un documento, identifica gli elementi utili, converte i valori in una struttura coerente e li consegna a un database, un file o un’altra applicazione. Può lavorare su HTML, tabelle, feed, PDF o risposte di servizi accessibili.

Lo scraping non è sempre la prima scelta. Se la fonte offre una API documentata, un export o dati aperti in formato strutturato, questi canali sono in genere più stabili e più facili da governare. Lo sviluppo custom diventa utile quando il canale ufficiale non copre il bisogno, i dati sono frammentati o occorre normalizzare fonti eterogenee.

Quando può essere utile a un’azienda o a un ente?

  • raccogliere dati pubblici da fonti istituzionali per un’attività autorizzata;
  • importare cataloghi e listini forniti dai partner, con accordi e perimetro chiaro;
  • monitorare informazioni operative pubblicate su più portali;
  • trasformare documenti e tabelle in record ricercabili;
  • alimentare una dashboard interna con fonti verificabili;
  • migrare contenuti da un sistema controllato che non dispone di export adeguato;
  • supportare controlli di qualità tra database e pubblicazioni web.

Un progetto non dovrebbe partire dall’idea di “prendere tutto”. Si definiscono campi, frequenza, storico, durata, titolare della fonte e utenti del dato. Ridurre il perimetro aumenta qualità e sostenibilità.

Qual è la differenza tra API, open data e scraping?

Canale Vantaggio Limite da verificare
API Contratto tecnico, errori e autenticazione definiti Copertura, limiti, costi e continuità
Open data Licenza e riuso descritti dal titolare Aggiornamento, formato e qualità
Export o feed Scambio concordato e semplice da controllare Frequenza e gestione delle modifiche
Scraping Adatta una pubblicazione pensata per persone Fragilità, perimetro, regole e impatto sulla fonte

Per la Pubblica Amministrazione, le linee guida AgID su dati aperti e interoperabilità aiutano a distinguere pubblicazione, qualità semantica e scambio tra sistemi. Quando una API è possibile, DLM Design preferisce un contratto documentato; quando non lo è, può costruire un adapter controllato.

robots.txt autorizza lo scraping?

No. La RFC 9309 definisce il Robots Exclusion Protocol come un modo con cui il gestore indica ai crawler quali percorsi possono essere richiesti. Lo stesso standard precisa che queste regole non sono una forma di autorizzazione all’accesso e non sostituiscono misure di sicurezza.

Il file va comunque rispettato come segnale tecnico del gestore. Oltre a robots.txt, vanno considerati termini d’uso, licenze, autenticazione, diritti sui contenuti, eventuali protezioni e finalità. Se il progetto coinvolge dati personali o dubbi sul riuso, serve una valutazione giuridica del caso concreto.

Come si affrontano privacy e minimizzazione?

Il GDPR si applica al trattamento automatizzato di dati personali. Un dato pubblicato online non perde per questo la propria natura personale. Occorre identificare base giuridica, finalità, necessità, tempi di conservazione, destinatari, misure di sicurezza e diritti delle persone interessate.

Dal punto di vista progettuale, la prima misura è non raccogliere ciò che non serve. Si possono escludere campi, pseudonimizzare identificativi, evitare copie integrali, limitare lo storico e registrare provenienza e data. Le scelte tecniche devono seguire la valutazione del titolare del trattamento e del professionista competente; questo articolo non sostituisce una consulenza legale.

Quali componenti servono in un sistema affidabile?

  1. Connettore: richiede la fonte con frequenza e identificazione appropriate.
  2. Parser: estrae campi e conserva evidenza sufficiente per la verifica.
  3. Normalizzatore: converte date, codici, importi e categorie in formati condivisi.
  4. Validatore: applica regole di completezza, tipo, unicità e coerenza.
  5. Archivio: registra dati, origine, versione e momento della raccolta.
  6. Integrazione: invia solo record validi a gestionale, CRM o web app.
  7. Monitor: rileva errori, cambiamenti della fonte e cali anomali di volume.

Questa separazione permette di correggere un parser senza confondere dati grezzi e record approvati. Per fonti critiche può essere utile una coda di revisione manuale, soprattutto quando il significato non è determinabile in modo affidabile.

Come si limita l’impatto sulla fonte?

Un crawler deve comportarsi in modo prevedibile. Usa una frequenza proporzionata, evita richieste parallele inutili, conserva una cache, applica backoff su errori e interrompe il lavoro quando il server segnala un limite. Quando opportuno, comunica un identificativo e un contatto tecnico.

Non si aggirano login, CAPTCHA, protezioni o blocchi. Se la fonte richiede autenticazione, serve un canale autorizzato e concordato. Un sistema sostenibile riduce il carico e rende semplice disattivare o modificare la raccolta.

Che cosa succede quando cambia una pagina?

Il cambiamento è normale. Classi CSS, struttura, etichette e formati possono variare senza preavviso. Per questo il parser non deve considerare “nessun risultato” come esecuzione riuscita. Si definiscono soglie e campioni: se il numero di record crolla, un campo obbligatorio scompare o i valori cambiano distribuzione, la pipeline si ferma e segnala l’anomalia.

  • test automatici su pagine campione;
  • conteggi e percentuali di campi mancanti;
  • versione del parser associata a ogni esecuzione;
  • log privi di dati eccedenti;
  • possibilità di rielaborare la fonte senza duplicare i record.

Scraping e intelligenza artificiale: dove serve controllo umano?

Modelli linguistici e classificatori possono aiutare a interpretare testi non strutturati, associare categorie o proporre riassunti. Non trasformano però una fonte incerta in un dato certo. Il sistema deve conservare origine, distinguere estrazione da inferenza e richiedere revisione quando l’errore può produrre conseguenze operative.

Per campi deterministici sono spesso preferibili regole e parser verificabili. L’AI può intervenire dove il contenuto è variabile, con soglie, campioni e possibilità di correzione. È lo stesso principio usato nelle automazioni AI con controllo umano.

Il metodo DLM Design per integrare fonti eterogenee

DLM Design parte dal contratto dei dati: campi, fonte, frequenza, destinatario, qualità e responsabilità. Progetta web app e software su misura, API e adapter per sistemi che non dispongono di integrazioni native. Per i contesti pubblici, l’esperienza comprende servizi API per l’interoperabilità dell’Albo Pretorio; ogni nuovo progetto mantiene distinto ciò che è documentato da ciò che richiede una verifica specifica.

Domande frequenti su web scraping e integrazione dati

Fare web scraping è sempre legale?

No. Dipende da fonte, dati, finalità, modalità di accesso, termini, diritti e norme applicabili. La fattibilità va valutata sul caso concreto e, quando necessario, con un professionista legale.

Se robots.txt permette l’accesso, posso usare i dati?

Non automaticamente. robots.txt regola il comportamento dei crawler ma non concede diritti sui contenuti e non sostituisce autorizzazioni, licenze o valutazioni privacy.

È meglio usare una API o fare scraping?

Se esiste una API stabile, documentata e adeguata, di norma è preferibile. Lo scraping è un’alternativa da valutare quando manca un canale strutturato o serve adattare fonti specifiche legittimamente accessibili.

Come si evita che un cambiamento della pagina produca dati sbagliati?

Con test su campioni, regole di completezza, soglie sui volumi, versioni del parser e blocco dell’importazione quando la qualità cambia. “Zero errori tecnici” non basta se il contenuto estratto è vuoto o scorretto.

Si possono estrarre dati da PDF?

Sì, se il documento e l’uso sono compatibili con il progetto. PDF testuali, scansioni e tabelle richiedono tecniche diverse; OCR e AI devono essere accompagnati da controlli di qualità e tracciabilità.

Valuta fonte, scopo e integrazione

Indica le fonti, i campi realmente necessari, la frequenza e il sistema destinatario. Possiamo confrontare API, open data, export e scraping e proporre il percorso meno fragile.

Richiedi una valutazione tecnica

Fonti ufficiali