Amazon acquista libri rari in grandi quantità, taglia le rilegature e li scansiona per addestrare i propri modelli di intelligenza artificiale, distruggendoli nel processo. La notizia arriva da un’indagine di 404 Media, che ha nascosto un Apple AirTag tra le pagine di uno dei volumi spediti e lo ha tracciato fino a un magazzino a Nord di Las Vegas, in Nevada.
L’operazione era partita da un venditore di libri usati che aveva ricevuto un ordine anonimo da circa mille volumi su Biblio, marketplace online dove gli acquirenti possono restare anonimi. Il venditore sospettava che dall’altra parte ci fosse un’azienda tecnologica, non un collezionista. Aveva ragione. Il tracciatore ha condotto i giornalisti alla struttura VGT3, un’unità operativa interna al magazzino Amazon LAS8, dove i dipendenti ricevono spedizioni massive di libri stampati, ne rimuovono le rilegature per velocizzare la scansione e poi li smaltiscono. Il libro fisico non esiste più al termine del processo. Un dipendente ha scritto su un forum interno: “All we do is scan books” — tutto quello che facciamo è scansionare libri.
Amazon ha risposto con una dichiarazione lapidaria: l’azienda “acquista libri attraverso canali commerciali per migliorare i prodotti e i servizi utilizzati dai clienti.” Nessun dettaglio sull’uso del materiale, nessun riferimento esplicito all’addestramento dei modelli. Tra i libri coinvolti ci sono volumi rari, fuori catalogo, spesso irreperibili online. Alcuni esistono in pochissime copie circolanti. Distruggerli riduce in modo permanente un’offerta già scarsa. Tra i segnali che i librai avevano già notato in passato: ordini di dimensioni anomale, selezioni apparentemente casuali di titoli, e il dettaglio che tutti i libri acquistati avevano un ISBN. Secondo 404 Media, il fatto che i dipendenti di VGT3 scansionino sistematicamente i codici ISBN di ogni volume lavorato alimenta un’ipotesi inquietante — che le aziende di AI stiano cercando di digitalizzare ogni libro stampato esistente, procedendo da un elenco esaustivo dei numeri seriali.
Il motivo per cui i libri fisici sono così appetibili per l’addestramento dei grandi modelli linguistici è tecnico e concreto. I testi scritti da esseri umani prima del 2022 garantiscono l’assenza di contenuto generato da macchine. Quando un LLM si addestra su testi prodotti da altri modelli, rischia il cosiddetto “model collapse”: un degrado progressivo della qualità degli output, causato dall’ingestione di testi artificiali che replicano difetti e pattern ricorrenti. I libri rari e fuori catalogo, scritti in decenni o secoli passati, sono quindi dati pregiati, difficili da trovare altrove e impossibili da replicare sinteticamente. La pratica non è nuova nel settore. Una causa legale contro Anthropic aveva già portato alla luce metodi simili: un giudice federale aveva definito la scansione distruttiva “trasformativa” e non in violazione del copyright, a patto che non venga creata una copia aggiuntiva del volume originale.
Il caso Amazon segna però un salto di scala e visibilità. L’azienda che ha costruito la sua storia vendendo libri online ora li compra per distruggerli. L’ironia è difficile da ignorare. Se la prassi dovesse consolidarsi — e le spedizioni tracciate risalgono almeno al 2024 — il mercato dei libri rari potrebbe subire pressioni inattese: aumento della domanda da parte di soggetti che non hanno alcun interesse conservativo, riduzione delle copie disponibili, potenziale aumento dei prezzi per i veri collezionisti. Le biblioteche e le istituzioni culturali, che da anni digitalizzano il patrimonio librario preservando gli originali, si trovano ora affiancate da attori industriali con logiche completamente diverse. La domanda che resta aperta è se basterà la pressione dell’opinione pubblica a cambiare qualcosa, o se il costo di un libro raro distrutto verrà semplicemente contabilizzato come voce di spesa nel bilancio dell’addestramento.














