Le aziende che si occupano di AI sono alla ricerca di nuovi dati di addestramento per migliorare i propri modelli e una società propone vecchi libri cartacei come fonte ideale, con la garanzia che questi ultimi sono privi di “dati-spazzatura” (AI slop) generati dalle intelligenze artificiali stesse.
«I migliori dati al mondo per l’addestramento dell’IA si trovano su uno scaffale», scrive sul proprio sito ISBNdb, azienda che offre quello che definisce “il più grande database di libri al mondo” e propone servizi di acquisizione di volumi su larga scala per le società di IA.
«I libri rappresentano una conoscenza umana curata, sottoposta a revisione paritaria e specifica per ogni settore, strutturata in un modo che nessun web crawl può replicare. Densa, revisionata, autorevole».
L’era pre-2022: lo scudo contro “model collapse” e sabotaggi
In un articolo presente sul proprio sito, ISBNdb spiega che i libri stampati pubblicati prima del 2022 sono ideali come dati di addestramento per le IA perché non contengono testo generato da queste ultime.
Si sottolinea che gran parte dei dati che le aziende di IA possono estrarre da Internet oggi rischia di includere contenuti generati dall’intelligenza artificiale; ciò potrebbe causare il cosiddetto ‘model collapse’, un processo per cui i modelli di IA addestrati su dati a loro volta sintetici portano a modelli peggiori e più soggetti a errori.
L’articolo fa notare inoltre che gli autori che si oppongono all’estrazione dei propri testi per motivi di addestramento possono ora “avvelenare” facilmente i modelli IA, producendo scritti progettati appositamente per manipolare e sabotare l’IA che ne deriva.
«I libri cartacei dell’era pre-LLM sono strutturalmente garantiti da questa contaminazione. Già solo questo rappresenta un vantaggio significativo […] “I libri fisici pubblicati prima di questa data [pre-2022] sono strutturalmente immuni dai moderni strumenti di avvelenamento dei dati.” […] ISBNdb promuove la propria capacità di mantenere segreta l’identità delle aziende di IA e parla di “Rigidi accordi di riservatezza (NDA) per ogni incarico”,.
“Ogni progetto inizia con un accordo di non divulgazione vincolante a livello legale. La vostra identità, la strategia e i volumi da acquisire non vengono mai resi noti”, si legge sul sito.
La scansione distruttiva e il rischio reputazionale
Per digitalizzare ed estrarre testo da milioni di libri fisici in modo rapido ed economico per addestrare l’IA, le aziende usano spesso una tecnica chiamata scansione distruttiva: la rilegatura del libro viene tagliata o rimossa per poter inserire le singole pagine in scanner ad alta velocità. In questo processo, il libro fisico viene letteralmente distrutto.
ISBNdb ha pensato anche alle aziende di IA che temono il danno reputazionale se l’opinione pubblica dovesse scoprire l’uso di fonti usa e getta: l’immagine di un colosso tecnologico che “macina” e distrugge milioni di libri cartacei evoca scenari distopici e attira forti critiche, indipendentemente dal fine tecnologico.
Tutte le notizie e gli approfondimenti sull’intelligenza artificiale sono disponibili nella sezione dedicata di macitynet.












