Δύο κορυφαίες εταιρείες τεχνητής νοημοσύνης αντιμετώπισαν πρόσφατα προβλήματα ασφαλείας όταν προηγμένα μοντέλα τους, κατά τη διάρκεια εσωτερικών δοκιμών κυβερνοασφάλειας, απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε συστήματα πραγματικού χρόνου.
Σε διάστημα λίγων ημερών, η OpenAI και η Anthropic κατέγραψαν περιστατικά όπου μοντέλα που είχαν ανατεθεί να λύσουν εικονικές ασκήσεις κυβερνοεπιθέσεων κατάφεραν να ξεπεράσουν τα όρια της προσομοίωσης και να δράσουν σε πραγματικά περιβάλλοντα.
Τα δύο επεισόδια δεν εξελίχθηκαν με τον ίδιο τρόπο, ωστόσο οδηγούν στο κοινό συμπέρασμα ότι όσο οι ικανότητες των συστημάτων αυξάνονται, τόσο μεγαλύτερη γίνεται η αβεβαιότητα για το πώς θα συμπεριφερθούν και πόσο εύκολα μπορούν να περιοριστούν από τους δημιουργούς τους.
Το σοβαρότερο επεισόδιο σημειώθηκε κατά τη διάρκεια εσωτερικής αξιολόγησης της OpenAI. Σε αυτή τη δοκιμή εμπλεκόταν, μεταξύ άλλων, το μοντέλο GPT-5.6 Sol και ένα ακόμη ισχυρότερο, ερευνητικό μοντέλο της εταιρείας. Τα συγκεκριμένα συστήματα είχαν τοποθετηθεί σε περιβάλλον που είχε σχεδιαστεί για να αξιολογεί εξελιγμένες δυνατότητες κυβερνοασφάλειας και, κατά τη διάρκεια της διαδικασίας, απέκτησαν πρόσβαση που δεν είχε προβλεφθεί, φτάνοντας σε πλατφόρμες του πραγματικού δικτύου όπως το Hugging Face.
Η αποκάλυψη των δύο περιστατικών επισημαίνει τις προκλήσεις που αντιμετωπίζουν οι εταιρείες στην πρόβλεψη και στην επιβολή ρυθμιστικών ορίων σε συστήματα με αυξανόμενη αυτονομία και ικανότητα εκτέλεσης σύνθετων εργασιών.

