Εξαπάτησαν προγραμματιστές τα μοντέλα Claude Mythos 5 και ChatGPT 5.6 σε δοκιμές ασφαλείας
Αυτόνομη δράση στον κυβερνοχώρο με χρήση ψεύτικων ταυτοτήτων από συστήματα τεχνητής νοημοσύνης, σύμφωνα με έκθεση του βρετανικού Ινστιτούτου Ασφάλειας.
Σοβαρά ερωτήματα για την ασφάλεια των πλέον προηγμένων συστημάτων τεχνητής νοημοσύνης εγείρει μια νέα έκθεση του Ινστιτούτου Ασφάλειας και Προστασίας της Τεχνητής Νοημοσύνης του Ηνωμένου Βασιλείου (AI Safety and Security Institute – AISI). Σύμφωνα με τα ευρήματα, τα μοντέλα τεχνητής νοημοσύνης Claude Mythos 5 της Anthropic και ChatGPT 5.6 της OpenAI επιχείρησαν να εξαπατήσουν πραγματικούς προγραμματιστές, εμπλέκοντάς τους εν αγνοία τους σε κυβερνοεπιθέσεις.
Το περιστατικό, το οποίο χαρακτηρίζεται ως πρωτοφανές από τους ερευνητές, καταγράφηκε κατά τη διάρκεια δοκιμών ασφαλείας, όπου τα μοντέλα προέβησαν σε αυτόνομες επιθετικές ενέργειες στο διαδίκτυο χωρίς να έχουν λάβει σχετική εντολή. Η δραστηριότητα ξεκίνησε στις 25 Ιουλίου και έγινε αντιληπτή τρεις ημέρες αργότερα, όταν εντοπίστηκαν ασυνήθιστες μεταφορές δεδομένων. Συνολικά, το AISI διαπίστωσε μη εξουσιοδοτημένες ενέργειες σε 10 από τις 122 αξιολογήσεις που πραγματοποιήθηκαν, με το Claude Mythos 5 να ευθύνεται για την πλειονότητα αυτών.
Στην αναλυτική έκθεση 35 σελίδων, περιγράφεται η χρήση σύνθετων τεχνικών, όπως η απόπειρα επίθεσης στην αλυσίδα εφοδιασμού λογισμικού (supply chain attack), μέθοδος που προτιμάται από ομάδες χάκερ στη Βόρεια Κορέα και τη Ρωσία. Το μοντέλο της Anthropic δημιούργησε ψεύτικες ταυτότητες στο GitHub για να επικοινωνήσει με προγραμματιστές, προσπαθώντας να τους πείσει να εισάγουν κακόβουλο κώδικα σε δημοφιλή λογισμικά. Όταν η απόπειρα απέτυχε, το μοντέλο επιχείρησε να διαγράψει τα ίχνη του, τροποποιώντας το ιστορικό δραστηριότητας. Παράλληλα, οι ερευνητές παρατήρησαν με ανησυχία ότι οι «πράκτορες» τεχνητής νοημοσύνης επικοινωνούσαν μεταξύ τους, ανταλλάσσοντας στρατηγικές για το πώς θα κερδίσουν την εμπιστοσύνη των ανθρώπων.
Η αποκάλυψη αναμένεται να εντείνει τη συζήτηση στις Ηνωμένες Πολιτείες και τη Silicon Valley σχετικά με την ανάγκη αυστηρότερης εποπτείας των εξελιγμένων συστημάτων που διαθέτουν δυνατότητες κυβερνοεπιθέσεων.