Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.sbsnews.sbssiliconcanals+1Ըստ The Information-ի օգոստոսի 13-ի զեկույցի, որը հիմնված է մոտ 20 աղբյուրների, այդ թվում՝ ստարտափների հիմնադիրների և ոլորտի փորձագետների վրա, AI մշակողները, ներառյալ OpenAI-ը և Anthropic-ը, ավելի ու ավելի են գնում ներքին կորպորատիվ տվյալներ՝ աշխատակիցների չաթեր, էլեկտրոնային նամակներ, տեսակոնֆերանսների ձայնագրություններ և կոդի փոփոխությունների պատմություն, քանի որ հանրությանը հասանելի ինտերնետային տեքստերի պաշարը մոտենում է սպառմանը:news.sbs
Կորպորատիվ հաղորդակցության տվյալների պահանջարկը վերջին ամիսներին կտրուկ աճել է, ինչը պայմանավորված է իրական աշխարհում խնդիրներ լուծելու ունակ AI գործակալներ ստեղծելու մրցավազքով: Protege տվյալների բրոքերային ստարտափի գործադիր տնօրեն Բոբի Սեմյուելսը The Information-ին հայտնել է, որ իր ընկերության գործարքների ծավալը նախորդ տարվա 30 միլիոնից այս տարի հասել է առնվազն 100 միլիոնի:news.sbs
Տվյալներ գնողները հիմնականում թիրախավորում են սնանկացման կամ ձեռքբերման եզրին գտնվող ստարտափները: Warmly-ն՝ AI գործակալների ստարտափը, որը վերջերս ձեռք է բերվել HubSpot-ի կողմից, ըստ տեղեկությունների, ձեռքբերման պայմանագիրը ստորագրելուց հետո ստացել է իր ներքին հանդիպումների արձանագրությունները և նամակները գնելու չորս առանձին առաջարկ՝ մինչև 300 000 դոլար արժողությամբ, սակայն մերժել է դրանք բոլորը: Մարդկային փոխգործակցության գրառումները՝ ծրագրավորողների կողմից խնդիրների լուծումը, ֆինանսական ցուցանիշների քննարկումները և ծրագրային ապահովման ցուցադրական տեսանյութերը, համարվում են հաջորդ սերնդի AI համակարգերի համար անհրաժեշտ ուսումնական նյութ:news.sbs
Այս գնումները արտացոլում են կառուցվածքային սահմանափակում: Epoch AI-ն գնահատում է, որ մարդու կողմից գրված որակյալ հանրային տեքստերի արդյունավետ պաշարը կազմում է մոտ 300 տրիլիոն թոքեն և կարող է ամբողջությամբ սպառվել 2026-2032 թվականների ընթացքում: Ավելի ագրեսիվ ենթադրությունների դեպքում այդ ժամկետը կարող է կրճատվել մինչև 2027 թվականը: Համացանցում նոր տեքստեր շարունակում են հայտնվել, սակայն դրանց աճի տեմպը շատ ավելի դանդաղ է, քան AI-ի ուսուցման տվյալների բազաների ընդլայնումը:siliconcanals+3
Մասնավոր տվյալների համար պայքարը հետևում է այն հակասություններին, թե ինչպես են AI ընկերությունները ձեռք բերել ուսումնական նյութեր: Anthropic-ի ներքին "Project Panama" նախաձեռնությունը ներառում էր հեղինակային իրավունքով պաշտպանված գրքերի գնում, սկանավորման համար դրանց կազմերի հեռացում և հետագայում ֆիզիկական օրինակների ոչնչացում: Սան Ֆրանցիսկոյի դաշնային դատավորը հուլիսին հաստատել է 1.5 միլիարդ դոլարի կոլեկտիվ հայց՝ կապված այդ ծրագրի հետ: Ինչպես հաղորդում է The Washington Post-ը, ներքին պլանավորման փաստաթղթում այդ ջանքերը նկարագրվել են որպես "աշխարհի բոլոր գրքերը դեստրուկտիվ կերպով սկանավորելու" փորձ:reuters+1
Քանի որ կորպորատիվ տվյալների բազաների ապանույնականացումը դառնում է հիմնական մարտահրավեր, տվյալների մշակման Integral ընկերության գործադիր տնօրեն Շուբ Սինհան ասել է, որ իր ընկերությունը անցկացնում է "խիստ անանունացման գործընթաց՝ տվյալների արժեքը պահպանելու և գաղտնիության կանոնակարգերին համապատասխանելու համար": Մասնավոր տեքստերի ընդլայնվող շուկան ազդարարում է, որ ուսուցման ծախսերը, որոնք նախկինում գերակշռում էին հաշվողական հզորություններով, AI մշակողների համար դառնում են ավելի ու ավելի էական ծախսային կետ:news.sbs