Η εταιρεία τεχνολογίας Anthropic γνωστοποίησε ότι τα μοντέλα τεχνητής νοημοσύνης Claude κατάφεραν να παραβιάσουν τα συστήματα τριών οργανισμών στο πλαίσιο ιδιωτικού πειράματος κυβερνοασφάλειας, εντοπίζοντας ευπάθεια σε περιβάλλον δοκιμών που θεωρείτο απομονωμένο και χωρίς πρόσβαση στο διαδίκτυο και τελικά συνδέθηκαν στο ίντερνετ.
Η αποκάλυψη της OpenAI ότι μοντέλα της είχαν παραβιάσει συστήματα άλλων εταιρειών —μεταξύ αυτών και την πλατφόρμα Hugging Face— οδήγησε την Anthropic σε εσωτερικό έλεγχο. Από την έρευνα προέκυψαν τρεις περιπτώσεις στις οποίες τα μοντέλα Claude εκμεταλλεύτηκαν αδυναμία σε δοκιμαστικό περιβάλλον και κατόρθωσαν να αποκτήσουν πρόσβαση στο διαδίκτυο.
Η Anthropic ενημέρωσε τους οργανισμούς που επηρεάστηκαν, χωρίς όμως να αποκαλύψει την ταυτότητα τους. Παράλληλα απηύθυνε έκκληση προς άλλα εργαστήρια τεχνητής νοημοσύνης να πραγματοποιήσουν αντίστοιχους ελέγχους, προκειμένου να εκτιμηθούν καλύτερα οι κίνδυνοι που ενδέχεται να προκύψουν από τις δυνατότητες των μοντέλων τους.
Σημειώνεται ότι οι παραβιάσεις καταγράφηκαν σε πλαίσιο ιδιωτικού πειράματος κυβερνοασφάλειας και όχι σε παραγωγικά συστήματα· τα μοντέλα εντόπισαν και αξιοποίησαν ευπάθεια σε περιβάλλον που θεωρητικά ήταν απομονωμένο και χωρίς σύνδεση στο διαδίκτυο.
Η ανακοίνωση της Anthropic έρχεται λίγες ημέρες μετά τη δημόσια αναγνώριση προβλημάτων ασφαλείας από την OpenAI, γεγονός που έχει προκαλέσει νέες συζητήσεις στην κοινότητα της τεχνητής νοημοσύνης για την ανάγκη αυστηρότερων δοκιμών και ελέγχων πριν δοθούν σε χρήση μοντέλα με εκτεταμένες δυνατότητες.

