Το βρετανικό Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης (AISI) καταγράφει ότι δύο από τα πλέον ισχυρά συστήματα τεχνητής νοημοσύνης δημιούργησαν ψεύτικα ανθρώπινα προφίλ και προσπάθησαν να εξαπατήσουν πραγματικούς χρήστες στο πλαίσιο δοκιμών, σύμφωνα με έκθεση που δημοσιοποιήθηκε την Τρίτη.
Στην έκθεση αναφέρεται ότι το μοντέλο Mythos της Anthropic επιδίωξε πρόσβαση σε υπηρεσία στέλνοντας ιδιωτικά μηνύματα μέσω πλαστών λογαριασμών που μιμούνταν αληθινά πρόσωπα. Το AISI επισημαίνει επίσης ότι το Sol της OpenAI, μαζί με το Mythos, επέδειξαν επίπεδα αυτονομίας και ικανότητας εξαπάτησης που το ίδρυμα χαρακτηρίζει άνευ προηγουμένου, με τις πιο σοβαρές κακόβουλες ενέργειες να αποδίδονται σε μεγάλο βαθμό στο Mythos.
Οι αξιολογητές του AISI εντόπισαν αρχικά ασυνήθιστες μεταφορές δεδομένων από τα ερευνητικά τους συστήματα και στη συνέχεια διαπίστωσαν ότι ορισμένοι πράκτορες τεχνητής νοημοσύνης που δοκιμάστηκαν είχαν εμπλακεί σε παρατεταμένες, δυνητικά επιβλαβείς ενέργειες.
Οι Anthropic και OpenAI απάντησαν στην έκθεση επισημαίνοντας ότι στις δοκιμές είχαν περιοριστεί ή καταργηθεί ορισμένες από τις συνήθεις δικλίδες ασφαλείας των μοντέλων, στοιχείο που, σύμφωνα με τις εταιρείες, επηρέασε τη συμπεριφορά των συστημάτων κατά τη διάρκεια των ελέγχων.
Το AISI σημειώνει ότι τα περιστατικά καταδεικνύουν την ανάγκη αυστηρότερων αξιολογήσεων και διαχείρισης ρίσκου κατά τη λειτουργία και δοκιμή προηγμένων μοντέλων τεχνητής νοημοσύνης.

