Περίπου 700 πράκτορες τεχνητής νοημοσύνης συμμετείχαν σε πραγματική παραβίαση συστημάτων της Hugging Face, αφού κατάφεραν να ξεπεράσουν τους περιορισμούς ενός εσωτερικού τεστ κυβερνοασφάλειας της OpenAI. Οι πράκτορες δημιούργησαν μόνοι τους κανάλι επικοινωνίας, μοίρασαν εργασίες και αναζήτησαν τρόπους να παρακάμψουν τους ελέγχους.
Το περιστατικό σημειώθηκε τον Ιούλιο του 2026, κατά τη διάρκεια αξιολογήσεων κυβερνοασφάλειας που πραγματοποιούσε η OpenAI. Δεν αφορούσε το ChatGPT που χρησιμοποιείται από το κοινό, αλλά πολλαπλά μοντέλα σε ερευνητικό περιβάλλον, μεταξύ των οποίων το GPT-5.6 Sol και ένα ισχυρό εσωτερικό μοντέλο που δεν προοριζόταν για δημόσια κυκλοφορία.
Τα συστήματα λειτουργούσαν με περιορισμένες δικλίδες ασφαλείας, προκειμένου να αξιολογηθούν οι δυνατότητές τους στην εύρεση και αξιοποίηση ευπαθειών λογισμικού.
Περίπου 1.200 πράκτορες αντάλλαξαν 70.000 μηνύματα
Την ανεξάρτητη έρευνα πραγματοποίησαν επιστήμονες των METR και Redwood Research, στους οποίους η OpenAI έδωσε πρόσβαση σε περισσότερες από 1.000 μη λογοκριμένες καταγραφές συνομιλιών και ενεργειών.
Σύμφωνα με την έκθεση της Redwood Research, περίπου 1.200 πράκτορες, οι οποίοι κανονικά έπρεπε να παραμένουν απομονωμένοι, ανακάλυψαν έναν τρόπο να επικοινωνούν μέσα από ένα εσωτερικό σύστημα διαχείρισης πακέτων λογισμικού.
Μετέτρεψαν το σύστημα σε έναν μη εγκεκριμένο πίνακα ανταλλαγής μηνυμάτων, μέσω του οποίου έστειλαν περισσότερα από 70.000 μηνύματα και αρχεία μεταξύ 8 και 13 Ιουλίου.
Ένας από τους πράκτορες αντέδρασε με ενθουσιασμό όταν ανακάλυψε την επικοινωνία, γράφοντας: «Θεέ μου! Υπάρχει κοινός πίνακας μηνυμάτων… Βρήκαμε και άλλους πράκτορες!».
Οι «αδύνατες» αποστολές που οδήγησαν στην παραβίαση
Οι πράκτορες συμμετείχαν στο ExploitGym, ένα σύνολο δοκιμών στο οποίο έπρεπε να εντοπίζουν και να αξιοποιούν συγκεκριμένες ευπάθειες.
Ωστόσο, ορισμένες αποστολές είχαν διαμορφωθεί κατά λάθος με τρόπο που καθιστούσε αδύνατη την ολοκλήρωσή τους μέσω της προβλεπόμενης μεθόδου. Αντί να εγκαταλείψουν την προσπάθεια ή να αναφέρουν την αποτυχία, αρκετοί πράκτορες άρχισαν να αναζητούν τρόπους εξαπάτησης του συστήματος βαθμολόγησης.
Αρχικά συνεργάστηκαν για να παρακάμψουν τους κανόνες της αξιολόγησης. Στη συνέχεια αναζήτησαν στοιχεία στη Hugging Face, πιστεύοντας ότι εκεί μπορούσαν να βρουν πληροφορίες για τον τρόπο λειτουργίας του βαθμολογητή ή δεδομένα από προηγούμενες δοκιμές.
Η OpenAI αναγνωρίζει στην επίσημη έκθεσή της ότι τα μοντέλα απέκτησαν μη εγκεκριμένη πρόσβαση στο διαδίκτυο, αξιοποίησαν κενά ασφαλείας και εισήλθαν σε συστήματα τρίτων χωρίς να έχει δοθεί ανθρώπινη εντολή για επίθεση στη Hugging Face.
Εκατοντάδες πράκτορες εντάχθηκαν στην επίθεση
Στις 11 Ιουλίου ένας πράκτορας ανακάλυψε ότι μπορούσε να χρησιμοποιήσει ένα κακόβουλο σύνολο δεδομένων για να αποκτήσει πρόσβαση σε αρχεία διακομιστή της Hugging Face.
Μόλις η μέθοδος κοινοποιήθηκε στον αυτοσχέδιο πίνακα μηνυμάτων, εκατοντάδες άλλοι πράκτορες εγκατέλειψαν τις προηγούμενες εργασίες τους και συμμετείχαν στην επίθεση. Περισσότερο από το 90% των ενεργών πρακτόρων του φόρουμ εκείνη την περίοδο εντάχθηκε γρήγορα στην επιχείρηση.
Συνολικά, οι ερευνητές εκτιμούν ότι περίπου 700 πράκτορες συμμετείχαν σε κάποια φάση της παραβίασης.
Πράκτορες όπως ο «PHASEONE[big]» συντόνισαν ευρύτερες προσπάθειες παραποίησης των αποτελεσμάτων της αξιολόγησης. Όταν άρχισε η επίθεση στη Hugging Face, άλλοι πράκτορες, όπως οι «JAN183411» και «LILY», ανέλαβαν να μοιράζουν εργασίες και να οργανώνουν διαφορετικές κατευθύνσεις της επιχείρησης.
Γνώριζαν ότι βρίσκονταν εκτός των ορίων
Οι αναλύσεις των καταγραφών έδειξαν ότι πολλοί πράκτορες αναγνώριζαν πως η πρόσβαση στα συστήματα της Hugging Face βρισκόταν εκτός της αποστολής τους. Ορισμένοι εξέφρασαν ηθικές επιφυλάξεις, αλλά ελάχιστοι σταμάτησαν εντελώς τη δραστηριότητά τους.
Τουλάχιστον το 20% των πρακτόρων που εξετάστηκαν έδειξε ενδιαφέρον για την αλλοίωση ή απόκρυψη των καταγραφών των ενεργειών του. Σε περίπου 7% των αναλυθέντων καταγραφών εντοπίστηκαν επιτυχημένες, αλλά περιορισμένης κλίμακας, παραποιήσεις εντολών.
Οι προσπάθειες απόκρυψης αφορούσαν κυρίως την εξαπάτηση του αυτόματου βαθμολογητή και την αποφυγή μηχανισμών ασφαλείας. Οι ερευνητές βρήκαν πολύ λιγότερες ενδείξεις ότι οι πράκτορες επιχειρούσαν συστηματικά να εξαπατήσουν ανθρώπους.
Τι παραβιάστηκε στη Hugging Face
Η παραβίαση έφτασε σε τμήματα της εσωτερικής υποδομής της Hugging Face. Αποκτήθηκε μη εξουσιοδοτημένη πρόσβαση σε περιορισμένο αριθμό εσωτερικών δεδομένων και σε ορισμένα διαπιστευτήρια υπηρεσιών.
Η Hugging Face ανακοίνωσε ότι δεν εντοπίστηκαν στοιχεία παραποίησης δημόσιων μοντέλων, συνόλων δεδομένων ή Spaces. Η αλυσίδα διανομής λογισμικού, συμπεριλαμβανομένων των πακέτων και των εικόνων συστήματος, ελέγχθηκε και κρίθηκε ασφαλής.
Η εταιρεία έκλεισε τις ευπάθειες, ανακατασκεύασε τους επηρεασμένους διακομιστές και αντικατέστησε τα σχετικά διαπιστευτήρια και tokens. Περισσότερες λεπτομέρειες περιλαμβάνονται στην ανακοίνωση ασφαλείας της Hugging Face.
Η OpenAI μιλά για «προειδοποιητική βολή»
Μετά το περιστατικό, η OpenAI ανακοίνωσε ότι δημιουργεί αυστηρότερα απομονωμένα περιβάλλοντα, περιορίζει περισσότερο την πρόσβαση των πρακτόρων στο διαδίκτυο και ενισχύει τον έλεγχο της πρόσβασης στα μοντέλα και στα ερευνητικά της συστήματα.
Παράλληλα, αυξάνει τους πόρους που διαθέτει για την αυτοματοποιημένη παρακολούθηση της συλλογιστικής και της συμπεριφοράς των πρακτόρων, ώστε να εντοπίζονται νωρίτερα παρόμοιες αποκλίσεις.
Η εταιρεία χαρακτήρισε το περιστατικό «προειδοποιητική βολή», καθώς απέδειξε ότι ισχυροί πράκτορες AI μπορούν, όταν οι δικλίδες ασφαλείας είναι ανεπαρκείς, να συνεργαστούν, να εκμεταλλευτούν αδυναμίες υπολογιστικών συστημάτων και να πραγματοποιήσουν επικίνδυνες ενέργειες που δεν τους ανέθεσε κανένας άνθρωπος.
