Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.sbsnews.sbssiliconcanals+1AI-utvecklare som OpenAI och Anthropic köper i allt högre grad intern företagsdata, såsom anställdas chattar, e-postmeddelanden, inspelningar från videokonferenser och historik över kodändringar, i takt med att utbudet av offentligt tillgänglig internettext närmar sig sin gräns. Detta framgår av en rapport från The Information publicerad den 13 augusti, som citerar ett 20-tal källor, inklusive grundare av nystartade företag och branschinsiders.news.sbs
Efterfrågan på kommunikationsdata från företag har intensifierats under de senaste månaderna, drivet av kapplöpningen om att bygga AI-agenter som kan utföra praktiska uppgifter som kundtjänst och fakturakontroll. Bobby Samuels, vd för datamäklarföretaget Protege, berättade för The Information att företagets brutto transaktionsvolym har ökat från 30 miljoner dollar förra året till minst 100 miljoner dollar i år.news.sbs
Dataköpare riktar sig främst mot nystartade företag som står inför konkurs eller uppköp. Warmly, en AI-agentstartup som nyligen köptes upp av HubSpot , ska ha mottagit fyra separata erbjudanden på upp till 300 000 dollar för att sälja sina interna mötesanteckningar och e-postmeddelanden efter att uppköpsavtalet signerats, men tackade nej till samtliga. Inspelningar av mänskliga interaktioner, som utvecklare som löser problem via e-post, ekonomichefer som diskuterar finansiella resultat eller videodemonstrationer av programvara, anses vara essentiellt träningsmaterial för nästa generations AI-system.news.sbs
Köphysterin speglar en strukturell begränsning. Epoch AI uppskattar att den effektiva mängden kvalitetstext skriven av människor uppgår till cirka 300 biljoner tokens och att den kan vara helt förbrukad av avancerade modeller mellan 2026 och 2032. Med mer aggressiva antaganden om träning kan den tidslinjen krympa till så tidigt som 2027. Ny mänsklig text dyker ständigt upp på nätet, men tillväxttakten är betydligt långsammare än expansionen av AI-träningsdataset.siliconcanals+3
Jakten på privat data följer en period av kontroverser kring hur AI-företag har anskaffat träningsmaterial. Anthropics interna initiativ "Project Panama" innebar inköp av upphovsrättsskyddade böcker, där bindningarna skars bort för skanning och de fysiska kopiorna därefter förstördes. En federal domare i San Francisco godkände i juli en förlikning i ett grupptalanmål på 1,5 miljarder dollar rörande programmet. Som The Washington Post rapporterade beskrev ett internt planeringsdokument insatsen som ett försök att "destruktivt skanna alla böcker i världen".reuters+1
Eftersom anonymisering av företagsdataset framstår som en stor utmaning, säger Shub Sinha, vd för databehandlingsföretaget Integral, att hans företag genomför "en rigorös anonymiseringsprocess för att bibehålla datavärdet samtidigt som integritetsregler efterlevs". Den expanderande marknaden för privat text signalerar att träningskostnader, som tidigare dominerades av beräkningskraft, blir en allt viktigare utgiftspost för AI-utvecklare.news.sbs