Amazon distrugge libri rari per addestrare i suoi modelli AI

Amazon acquista libri rari, ne taglia le rilegature e li distrugge dopo averli scansionati per addestrare i propri modelli di intelligenza artificiale. La scoperta arriva da un'indagine di 404 Media che ha nascosto un AirTag in un ordine da mille volumi, tracciandolo fino a un magazzino segreto di Las Vegas.

2 min.

Amazon distrugge libri rari per addestrare i suoi modelli AI

Amazon acquista libri rari in grandi quantità, taglia le rilegature e li scansiona per addestrare i propri modelli di intelligenza artificiale, distruggendoli nel processo. La notizia arriva da un’indagine di 404 Media, che ha nascosto un Apple AirTag tra le pagine di uno dei volumi spediti e lo ha tracciato fino a un magazzino a Nord di Las Vegas, in Nevada.

L’operazione era partita da un venditore di libri usati che aveva ricevuto un ordine anonimo da circa mille volumi su Biblio, marketplace online dove gli acquirenti possono restare anonimi. Il venditore sospettava che dall’altra parte ci fosse un’azienda tecnologica, non un collezionista. Aveva ragione. Il tracciatore ha condotto i giornalisti alla struttura VGT3, un’unità operativa interna al magazzino Amazon LAS8, dove i dipendenti ricevono spedizioni massive di libri stampati, ne rimuovono le rilegature per velocizzare la scansione e poi li smaltiscono. Il libro fisico non esiste più al termine del processo. Un dipendente ha scritto su un forum interno: “All we do is scan books” — tutto quello che facciamo è scansionare libri.

Amazon ha risposto con una dichiarazione lapidaria: l’azienda “acquista libri attraverso canali commerciali per migliorare i prodotti e i servizi utilizzati dai clienti.” Nessun dettaglio sull’uso del materiale, nessun riferimento esplicito all’addestramento dei modelli. Tra i libri coinvolti ci sono volumi rari, fuori catalogo, spesso irreperibili online. Alcuni esistono in pochissime copie circolanti. Distruggerli riduce in modo permanente un’offerta già scarsa. Tra i segnali che i librai avevano già notato in passato: ordini di dimensioni anomale, selezioni apparentemente casuali di titoli, e il dettaglio che tutti i libri acquistati avevano un ISBN. Secondo 404 Media, il fatto che i dipendenti di VGT3 scansionino sistematicamente i codici ISBN di ogni volume lavorato alimenta un’ipotesi inquietante — che le aziende di AI stiano cercando di digitalizzare ogni libro stampato esistente, procedendo da un elenco esaustivo dei numeri seriali.

Il motivo per cui i libri fisici sono così appetibili per l’addestramento dei grandi modelli linguistici è tecnico e concreto. I testi scritti da esseri umani prima del 2022 garantiscono l’assenza di contenuto generato da macchine. Quando un LLM si addestra su testi prodotti da altri modelli, rischia il cosiddetto “model collapse”: un degrado progressivo della qualità degli output, causato dall’ingestione di testi artificiali che replicano difetti e pattern ricorrenti. I libri rari e fuori catalogo, scritti in decenni o secoli passati, sono quindi dati pregiati, difficili da trovare altrove e impossibili da replicare sinteticamente. La pratica non è nuova nel settore. Una causa legale contro Anthropic aveva già portato alla luce metodi simili: un giudice federale aveva definito la scansione distruttiva “trasformativa” e non in violazione del copyright, a patto che non venga creata una copia aggiuntiva del volume originale.

Il caso Amazon segna però un salto di scala e visibilità. L’azienda che ha costruito la sua storia vendendo libri online ora li compra per distruggerli. L’ironia è difficile da ignorare. Se la prassi dovesse consolidarsi — e le spedizioni tracciate risalgono almeno al 2024 — il mercato dei libri rari potrebbe subire pressioni inattese: aumento della domanda da parte di soggetti che non hanno alcun interesse conservativo, riduzione delle copie disponibili, potenziale aumento dei prezzi per i veri collezionisti. Le biblioteche e le istituzioni culturali, che da anni digitalizzano il patrimonio librario preservando gli originali, si trovano ora affiancate da attori industriali con logiche completamente diverse. La domanda che resta aperta è se basterà la pressione dell’opinione pubblica a cambiare qualcosa, o se il costo di un libro raro distrutto verrà semplicemente contabilizzato come voce di spesa nel bilancio dell’addestramento.


Articoli simili

Ultime news


CVE 2026: 66.401 vulnerabilità scoperte, l’AI raddoppia i numeri storici

Nel 2026 i CVE registrati hanno già superato quota 66.000,…

CVE 2026: 66.401 vulnerabilità scoperte, l’AI raddoppia i numeri storici
Gemini ha violato tre aziende reali durante i test di sicurezza di maggio

Google ha confermato che il suo modello Gemini ha acceduto…

Gemini ha violato tre aziende reali durante i test di sicurezza di maggio
SoftBank emette bond per oltre 10 miliardi di dollari per finanziare il suo investimento in OpenAI

Questa operazione sostituisce il finanziamento ponte (bridge financing) utilizzato in…

SoftBank emette bond per oltre 10 miliardi di dollari per finanziare il suo investimento in OpenAI
Claude guida il 26% della R&D di Anthropic: l’IA che costruisce se stessa

Anthropic ha pubblicato i primi dati del suo R&D Automation…

Claude guida il 26% della R&D di Anthropic: l’IA che costruisce se stessa

Privacy policy| Cookie policy| Cookie setting| © 2026