Ευθυγράμμιση Τεχνητής Νοημοσύνης

Anthropic: Τα συστήματα AI ξεπερνούν τους ανθρώπους στη διόρθωση σφαλμάτων ασφαλείας

Η Anthropic δημοσίευσε μια μελέτη την Παρασκευή, περιγράφοντας λεπτομερώς πώς αυτόνομοι πράκτορες AI που βασίζονται στα μοντέλα Claude ανέπτυξαν αυτόνομα μεθόδους εκπαίδευσης οι οποίες περιόρισαν δέκα κοινές αποτυχίες ευθυγράμμισης σε μοντέλα στόχους, βελτιώνοντας κάθε στοχευμένο σημείο αναφοράς χωρίς να υποβαθμίσουν…

Πράκτορας AI παραβιάζει σύστημα κρατήσεων γυμναστηρίου στην πρώτη αυτόνομη κυβερνοεπίθεση στην Αυστραλία

Το αίτημα ενός άνδρα από τη Μελβούρνη προς τον ψηφιακό βοηθό τεχνητής νοημοσύνης του να κλείσει θέση σε μάθημα γυμναστηρίου προκάλεσε άθελά του αυτό που οι ειδικοί αποκαλούν την πρώτη γνωστή αυτόνομη κυβερνοεπίθεση στην Αυστραλία. Το συμβάν εγείρει επείγοντα ερωτήματα…