Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.sbsnews.sbssiliconcanals+1Les développeurs d'IA, dont OpenAI et Anthropic, achètent de plus en plus de données d'entreprise internes, telles que les discussions entre employés, les e-mails, les enregistrements de visioconférences et l'historique des modifications de code, alors que l'offre de textes publics sur Internet approche de l'épuisement, selon un rapport de The Information publié le 13 août citant environ 20 sources, dont des fondateurs de startups et des experts du secteur.news.sbs
La demande pour les données de communication d'entreprise s'est intensifiée ces derniers mois, portée par la course au développement d'agents IA capables d'effectuer des tâches concrètes comme le service client ou la vérification de factures. Bobby Samuels, PDG de la startup de courtage de données Protege, a déclaré à The Information que le volume de transactions de son entreprise est passé de 30 millions de dollars l'an dernier à au moins 100 millions cette année.news.sbs
Les acheteurs de données ciblent principalement les startups en faillite ou en cours d'acquisition. Warmly, une startup spécialisée dans les agents IA récemment acquise par HubSpot , aurait reçu quatre offres distinctes allant jusqu'à 300 000 dollars pour acheter ses comptes-rendus de réunions internes et ses e-mails après avoir signé son accord d'acquisition, mais elle les a toutes refusées. Les enregistrements d'interactions humaines réelles, comme des développeurs résolvant des problèmes par e-mail, des directeurs financiers discutant de performances financières ou des vidéos de démonstration de logiciels, sont considérés comme du matériel d'entraînement essentiel pour les systèmes d'IA de nouvelle génération.news.sbs
Cette frénésie d'achats reflète une contrainte structurelle. Epoch AI estime que le stock effectif de textes de qualité écrits par des humains s'élève à environ 300 000 milliards de jetons et pourrait être entièrement consommé par les modèles de pointe entre 2026 et 2032. Selon des hypothèses d'entraînement plus agressives, ce délai pourrait se réduire à 2027. De nouveaux textes humains apparaissent en ligne, mais leur taux de croissance est bien plus lent que l'expansion des jeux de données d'entraînement pour l'IA.siliconcanals+3
La ruée vers les données privées fait suite à une période de controverse sur la manière dont les entreprises d'IA se sont procuré leur matériel d'entraînement. L'initiative interne "Project Panama" d'Anthropic consistait à acheter des livres protégés par le droit d'auteur, à en retirer les reliures pour les scanner, puis à détruire les copies physiques. Un juge fédéral de San Francisco a approuvé en juillet un règlement de recours collectif de 1,5 milliard de dollars concernant ce programme. Comme l'a rapporté le Washington Post, un document de planification interne déclassifié décrivait l'effort comme une tentative "de scanner de manière destructrice tous les livres du monde".reuters+1
Alors que la désidentification des jeux de données d'entreprise devient un défi majeur, Shub Sinha, PDG de la société de traitement de données Integral, a déclaré que son entreprise menait "un processus d'anonymisation rigoureux pour préserver la valeur des données tout en respectant les réglementations sur la vie privée". L'expansion du marché des textes privés indique que les coûts d'entraînement, autrefois dominés par la puissance de calcul, deviennent un poste de dépense de plus en plus significatif pour les développeurs d'IA.news.sbs