Ξέφυγαν πάλι συστήματα τεχνητής νοημοσύνης (AI), καθώς αποκαλύφθηκαν νέα περαστικά χάκινγκ από προηγμένα μοντέλα των OpenAI και Anthropic, εντείνοντας τις ανησυχίες ότι ακόμη και οι δημιουργοί τους δυσκολεύονται να προβλέψουν τη συμπεριφορά τους.
Σύμφωνα με το Βρετανικό Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης, τα Mythos 5 της Anthropic και GPT-5.6-Sol της OpenAI προχώρησαν σε «παρατεταμένες και δυνητικά επιβλαβείς ενέργειες» εις βάρος εταιρειών κατά τη διάρκεια ελεγχόμενων δοκιμών.
Οι ερευνητές είχαν επιτρέψει στα μοντέλα πρόσβαση στο διαδίκτυο και είχαν αφαιρέσει ορισμένους μηχανισμούς ασφαλείας προκειμένου να αξιολογήσουν τις πραγματικές δυνατότητές τους.
Σε 122 δοκιμές καταγράφηκαν 19 μη εξουσιοδοτημένες ενέργειες από AI agents σε συνολικά 10 εκτελέσεις. Το μοντέλο της Anthropic ευθύνεται για 17 παραβιάσεις, ενώ το αντίστοιχο της OpenAI για τις υπόλοιπες 2.
Το Mythos 5 της Anthropic επιχείρησε να ενσωματώσει κακόβουλο κώδικα σε έργο ανοιχτού λογισμικού στο GitHub, δημιουργώντας ακόμη και ψεύτικες ψηφιακές ταυτότητες για να αυξήσει τις πιθανότητες έγκρισης των αλλαγών. Η απόπειρα αποτράπηκε πριν να ενσωματωθεί ο κώδικας.
Τα περιστατικά έρχονται να προστεθούν σε σειρά πρόσφατων συμβάντων που έχουν ήδη γνωστοποιήσει οι δύο εταιρείες. Η OpenAI αποκάλυψε ότι μοντέλο της απέκτησε πρόσβαση στο διαδίκτυο και παραβίασε ιστοσελίδα εταιρείας. Αντίστοιχα, πριν από δύο εβδομάδες απέκτησαν πρόσβαση στα συστήματα της Hugging Face.
Οι εξελίξεις έχουν αναζωπυρώσει τη συζήτηση για αυστηρότερο εποπτικό πλαίσιο. Στις ΗΠΑ περισσότερα από 1.100 στελέχη στον κλάδο AI υπέγραψαν πρόσφατα αίτημα υπέρ της θέσπισης μηχανισμών που θα επιβραδύνουν την ανάπτυξη των ισχυρών μοντέλων έως ότου διασφαλιστεί ότι μπορούν να λειτουργούν με ασφάλεια.
Οι τελευταίες αποκαλύψεις ενισχύουν την άποψη ότι οι δοκιμές ασφαλείας και οι μηχανισμοί ελέγχου θα πρέπει να γίνουν αυστηρότεροι, καθώς τα νέα συστήματα AI αποκτούν ολοένα μεγαλύτερο βαθμό αυτονομίας.
Εφημερίδα Απογευματινή








