Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

404media404media+1404media+1Amazon Amazon.com, Inc. achète de grandes quantités de livres rares et épuisés, en tranche les dos pour un scan plus rapide et détruit les originaux, tout cela pour alimenter ses modèles d'IA en données d'entraînement. Une enquête publiée lundi par 404 Media a révélé cette pratique après que le média a placé un Apple AirTag dans une cargaison d'environ 1 000 livres et l'a suivi jusqu'à un entrepôt Amazon à Las Vegas.404media
"Amazon achète des livres par le biais de canaux commerciaux pour aider à développer et améliorer les produits et services que nos clients utilisent", a déclaré un porte-parole d'Amazon dans un communiqué, refusant de répondre aux questions sur le nombre de livres détruits ou le nombre d'installations de ce type exploitées.404media
Le livre suivi a voyagé de Californie à travers le Wisconsin et le Colorado avant d'arriver dans une installation Amazon appelée LAS8 à Las Vegas. Les travailleurs décrivent une opération distincte située à l'extrémité nord du site, codée VGT3, dont le logo est un Tyrannosaurus rex tenant un livre.404media
Les employés disent que leur seul travail consiste à recevoir des cargaisons massives de livres imprimés, à en couper les reliures et à scanner les pages. "Je travaille à VGT3 ici à Vegas, et tout ce que nous faisons, c'est scanner des livres", a écrit un employé sur un forum d'employés d'Amazon. "Certains sont chargés de couper les livres, et d'autres vont à la réception où ils reçoivent les livres et scannent les codes-barres".404media
Les libraires ont déclaré à 404 Media qu'ils soupçonnaient les entreprises d'IA de parcourir le catalogue mondial des ISBN pour scanner systématiquement chaque livre publié. Les commandes en gros qu'ils reçoivent ne sont pas sensibles au prix et incluent des titres apparemment aléatoires, contrairement aux achats effectués par les bibliothèques ou les collectionurs.404media
Les livres imprimés avant 2022 sont prisés car ils sont garantis sans texte généré par l'IA. Lorsque les modèles de langage s'entraînent sur des résultats synthétiques, ils risquent une dégradation connue sous le nom d'effondrement du modèle. Beaucoup de ces textes contiennent également des informations indisponibles partout sur Internet, ce qui en fait un réservoir inexploité de données d'entraînement.techcrunch+1
La pratique suit le même modèle que celui révélé dans le "Projet Panama" d'Anthropic, exposé par des litiges intentés par des auteurs de livres. Dans ce cas, un juge fédéral a statué en juin 2025 que le scan de livres achetés légalement pour l'entraînement à l'IA constitue un usage loyal, en partie parce que l'acheteur a détruit la copie originale.gadgetreview+1
La révélation survient alors qu'Amazon restructure sa stratégie d'IA autour de la recherche sur les modèles de pointe. L'entreprise a mis fin à plusieurs modèles Nova internes et a consolidé ses efforts sous un groupe de recherche sur les modèles de pointe dirigé par Pieter Abbeel, suite au départ de l'ancien chef de l'IA Rohit Prasad en décembre 2025.firstpost
Pour les libraires, le calcul est plus simple. "Il existe différents types de valeur", a déclaré le libraire anonyme qui a aidé 404 Media. "Il y a la valeur historique, la valeur intellectuelle, la valeur sentimentale. Toutes sortes de choses, et les entreprises d'IA ne se soucient pas de tout cela. Elles veulent juste le contenu comme un tas de mots mis bout à bout".404media