Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.sbsnews.sbssiliconcanals+1Οι εταιρείες ανάπτυξης τεχνητής νοημοσύνης, συμπεριλαμβανομένων της OpenAI και της Anthropic, αγοράζουν όλο και περισσότερο εσωτερικά εταιρικά δεδομένα, όπως συνομιλίες εργαζομένων, email, καταγραφές βιντεοκλήσεων και ιστορικά αλλαγών κώδικα, καθώς η προσφορά δημόσια διαθέσιμου κειμένου στο διαδίκτυο πλησιάζει στην εξάντληση, σύμφωνα με έκθεση του The Information που δημοσιεύθηκε στις 13 Αυγούστου, επικαλούμενη περίπου 20 πηγές, συμπεριλαμβανομένων ιδρυτών startups και στελεχών του κλάδου δεδομένων.news.sbs
Η ζήτηση για δεδομένα εταιρικής επικοινωνίας έχει ενταθεί τους τελευταίους μήνες, λόγω του ανταγωνισμού για τη δημιουργία πρακτόρων τεχνητής νοημοσύνης ικανών να εκτελούν εργασίες, όπως η εξυπηρέτηση πελατών και η επαλήθευση τιμολογίων. Ο Bobby Samuels, διευθύνων σύμβουλος της startup μεσιτείας δεδομένων Protege, δήλωσε στο The Information ότι ο όγκος των συναλλαγών της εταιρείας του εκτινάχθηκε από 30 εκατομμύρια δολάρια πέρυσι σε τουλάχιστον 100 εκατομμύρια φέτος.news.sbs
Οι αγοραστές δεδομένων στοχεύουν κυρίως σε startups που αντιμετωπίζουν πτώχευση ή εξαγορά. Η Warmly, μια startup πρακτόρων τεχνητής νοημοσύνης που εξαγοράστηκε πρόσφατα από τη HubSpot , φέρεται να έλαβε τέσσερις ξεχωριστές προσφορές ύψους έως και 300.000 δολαρίων για την αγορά των εσωτερικών πρακτικών των συναντήσεών της και των email της μετά την υπογραφή της συμφωνίας εξαγοράς, αλλά τις απέρριψε όλες. Τα αρχεία ζωντανών ανθρώπινων αλληλεπιδράσεων, όπως προγραμματιστές που επιλύουν προβλήματα μέσω email, οικονομικοί διευθυντές που συζητούν οικονομικές επιδόσεις και βίντεο επίδειξης λογισμικού, θεωρούνται απαραίτητο υλικό εκπαίδευσης για τα συστήματα τεχνητής νοημοσύνης επόμενης γενιάς.news.sbs
Αυτή η αγοραστική μανία αντικατοπτρίζει έναν δομικό περιορισμό. Η Epoch AI εκτιμά ότι το αποτελεσματικό απόθεμα ποιοτικού κειμένου γραμμένου από ανθρώπους ανέρχεται σε περίπου 300 τρισεκατομμύρια tokens και θα μπορούσε να εξαντληθεί πλήρως από τα προηγμένα μοντέλα μεταξύ 2026 και 2032. Με βάση πιο επιθετικές παραδοχές εκπαίδευσης, αυτό το χρονοδιάγραμμα θα μπορούσε να συμπιεστεί έως και το 2027. Νέο ανθρώπινο κείμενο εμφανίζεται συνεχώς στο διαδίκτυο, αλλά ο ρυθμός ανάπτυξής του είναι πολύ πιο αργός από την επέκταση των συνόλων δεδομένων εκπαίδευσης τεχνητής νοημοσύνης.siliconcanals+3
Η προσπάθεια απόκτησης ιδιωτικών δεδομένων ακολουθεί μια περίοδο αντιπαραθέσεων σχετικά με το πώς οι εταιρείες τεχνητής νοημοσύνης προμηθεύονται υλικό εκπαίδευσης. Η εσωτερική πρωτοβουλία "Project Panama" της Anthropic περιλάμβανε την αγορά βιβλίων που προστατεύονται από πνευματικά δικαιώματα, την αφαίρεση των εξωφύλλων τους για σάρωση και την καταστροφή των φυσικών αντιτύπων στη συνέχεια. Ένας ομοσπονδιακός δικαστής στο Σαν Φρανσίσκο ενέκρινε τον Ιούλιο έναν συμβιβασμό ομαδικής αγωγής ύψους 1,5 δισεκατομμυρίου δολαρίων για το πρόγραμμα. Όπως ανέφερε η Washington Post, ένα εσωτερικό έγγραφο σχεδιασμού περιέγραφε την προσπάθεια ως μια απόπειρα "να σαρωθούν καταστροφικά όλα τα βιβλία στον κόσμο".reuters+1
Καθώς η αποταυτοποίηση των εταιρικών συνόλων δεδομένων αναδεικνύεται σε σημαντική πρόκληση, ο Shub Sinha, διευθύνων σύμβουλος της εταιρείας επεξεργασίας δεδομένων Integral, δήλωσε ότι η εταιρεία του διεξάγει "μια αυστηρή διαδικασία ανωνυμοποίησης για τη διατήρηση της αξίας των δεδομένων, συμμορφούμενη παράλληλα με τους κανονισμούς προστασίας της ιδιωτικής ζωής". Η διευρυνόμενη αγορά ιδιωτικού κειμένου υποδηλώνει ότι το κόστος εκπαίδευσης, που κάποτε κυριαρχούνταν από την υπολογιστική ισχύ, γίνεται όλο και πιο σημαντικό κονδύλι για τους προγραμματιστές τεχνητής νοημοσύνης.news.sbs