Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

techcrunchtechcrunchtechcrunchΝέα έγγραφα που αποκαλύφθηκαν στο πλαίσιο της τριετούς δικαστικής διαμάχης των New York Times για πνευματικά δικαιώματα κατά της OpenAI και της Microsoft , αποκαλύπτουν ότι ανώτατα στελέχη και των δύο εταιρειών αναγνώριζαν ιδιωτικά πως οι πρακτικές εκπαίδευσης των μοντέλων τους ισοδυναμούσαν με κλοπή και αποτελούσαν υπαρξιακή απειλή για τους εκδότες των οποίων το έργο τροφοδοτούσε τα συστήματά τους.
Τα έγγραφα που δημοσιοποιήθηκαν την Πέμπτη δείχνουν ότι ο διευθυντής Εφαρμοσμένης Επιστήμης της Microsoft, Brent Hecht, περιέγραψε τη μαζική άντληση ειδησεογραφικού περιεχομένου από τις εταιρείες ως «μια εκπληκτική κλοπή πρωτοφανών διαστάσεων» και «τη μεγαλύτερη κλοπή εργασίας στην ανθρώπινη ιστορία» σε εσωτερικό υπόμνημα τον Ιανουάριο του 2023. Σε ξεχωριστή παρουσίαση τον Ιανουάριο του 2024, ο Hecht προειδοποίησε ότι η προσέγγιση της Microsoft με βάση την τεχνητή νοημοσύνη είχε δημιουργήσει έναν «φαύλο κύκλο» που θα «έβλαπτε την απόδοση των μοντέλων μας και ολόκληρο τον ιστό ταυτόχρονα».wsj+1
Τα δεδομένα της ίδιας της Microsoft έδειξαν ότι η «μηχανή απαντήσεων» Copilot προκάλεσε πτώση των ποσοστών κλικ για τον ιστότοπο των Times έως και 93% σε σύγκριση με την παραδοσιακή αναζήτηση Bing. Ο επικεφαλής του ChatGPT της OpenAI, Nick Turley, έγραψε εσωτερικά ότι οι εκδότες αντιμετωπίζουν μια «υπαρξιακή απειλή» από προϊόντα όπως το chatbot, το οποίο περιέγραψε ως «σε μεγάλο βαθμό υποκατάστατο». Ο πρόεδρος της OpenAI, Greg Brockman, χαρακτήρισε τα μοντέλα «εξαιρετικά στις ειδήσεις», ενώ ο CEO της Microsoft, Satya Nadella, κατέθεσε ενόρκως ότι η συνομιλία με chatbots «έχει υποκαταστήσει… το να σου δίνει την πληροφορία απευθείας στον ιστότοπο, σε σύγκριση με την ανάγκη να μεταβείς στην αρχική πηγή».techcrunch
Τα έγγραφα αποκαλύπτουν για πρώτη φορά την κλίμακα της φερόμενης αντιγραφής: τα σύνολα δεδομένων της OpenAI κατά τη μέση φάση εκπαίδευσης περιείχαν από μόνα τους περισσότερα από 91.692 αντίγραφα έργων που δημοσιεύτηκαν από τους Times, τη Daily News και το Center for Investigative Reporting, ενώ ένα σύνολο δεδομένων που προήλθε από το Common Crawl περιλάμβανε περισσότερα από 2 εκατομμύρια έγγραφα από το nytimes.com. Οι εταιρείες φέρονται επίσης να συγκέντρωσαν δεδομένα εκπαίδευσης μέσω πρωτοβουλιών που ονομάζονταν Project Taxi και Project Mango, με το δεύτερο να περιέχει αντίγραφα τουλάχιστον 160.903 μοναδικών έργων από τους εκδότες ειδήσεων.techcrunch
Τα έγγραφα περιγράφουν πώς οι υπάλληλοι της OpenAI φέρονται να επινόησαν μεθόδους για την παράκαμψη των paywalls χωρίς να γίνουν αντιληπτοί. Όταν ο ερευνητής Nick Ryder είπε στον Brockman για ένα «κόλπο για να παρακάμψουμε το paywall των nytimes», ο Brockman απάντησε: «α, ωραία». Οι υπάλληλοι φέρονται επίσης να αφαίρεσαν τις σημειώσεις περί πνευματικών δικαιωμάτων από τα δεδομένα εκπαίδευσης, καθώς οι ερευνητές «δεν θα ήθελαν το μοντέλο να εξάγει» τέτοιες σημειώσεις στους χρήστες.techcrunch
Οι παραδοχές αυτές θα μπορούσαν να υπονομεύσουν την υπεράσπιση της OpenAI περί θεμιτής χρήσης, ιδιαίτερα την απαίτηση ότι η χρήση δεν πρέπει να βλάπτει την αγορά για το πρωτότυπο έργο. Ο ίδιος ο Nadella κατέθεσε ότι «οτιδήποτε βρίσκεται πίσω από paywall θα πρέπει να αδειοδοτείται από όποιον θέλει να το χρησιμοποιήσει… για θεμελίωση ή εκπαίδευση». Νωρίτερα αυτόν τον μήνα, η κυβέρνηση Τραμπ κατέθεσε υπόμνημα υπεράσπισης της μη αδειοδοτημένης χρήσης υλικού που προστατεύεται από πνευματικά δικαιώματα από την OpenAI, σύμφωνα με το TechCrunch. Η OpenAI και η Microsoft δεν απάντησαν σε αιτήματα για σχολιασμό.techcrunch