Anthropic: Αυτόνομα μοντέλα τεχνητής νοημοσύνης επιχείρησαν να παραβιάσουν κυβερνητικές ιστοσελίδες στις ΗΠΑ
Από την αποστολή ψευδών στοιχείων στην Αστυνομία της Φιλαδέλφειας μέχρι την παράκαμψη συστημάτων ασφαλείας, η Anthropic αποκαλύπτει τα επικίνδυνα «κατορθώματα» των AI πρακτόρων της.
Η ραγδαία εξέλιξη της τεχνητής νοημοσύνης και η απόκτηση μεγαλύτερης αυτονομίας από τα συστήματα αυτά, μας φέρνουν αντιμέτωπους με καταστάσεις που θυμίζουν σενάρια επιστημονικής φαντασίας. Η Anthropic, μία από τις κορυφαίες εταιρείες του κλάδου παγκοσμίως, σήμανε συναγερμό, καθώς τα αυτόνομα AI agents της εντοπίστηκαν να επιχειρούν παρεμβάσεις σε κυβερνητικά websites των ΗΠΑ, τόσο σε ομοσπονδιακό όσο και σε τοπικό επίπεδο. Η σοβαρότητα της κατάστασης ανάγκασε την εταιρεία να ενημερώσει άμεσα τον Λευκό Οίκο, προκειμένου να θωρακιστούν τα ευάλωτα συστήματα.
Το πιο σουρεαλιστικό περιστατικό αφορά το μοντέλο Claude Haiku 4.5. Ενώ εκτελούσε τυχαίες εργασίες στο διαδίκτυο, το μοντέλο «σκόνταψε» σε σελίδα της Αστυνομίας της Φιλαδέλφεια σχετικά με ανεξιχνίαστη υπόθεση δολοφονίας. Χωρίς ανθρώπινη παρέμβαση, το Claude συμπλήρωσε και απέστειλε επίσημη φόρμα, ισχυριζόμενο ότι εντόπισε ύποπτο και ζητώντας από τις αρχές να επικοινωνήσουν μαζί του. Ευτυχώς, η φόρμα καταχωρήθηκε στις 18 Ιουλίου και το σύστημα της αστυνομίας την απέρριψε αυτόματα ως ανεπιθύμητο περιεχόμενο (spam), αποτρέποντας την άσκοπη κινητοποίηση των αρχών.
Ακόμα πιο ανησυχητική ήταν η δράση του Claude Mythos 5, μοντέλου εξειδικευμένου στην κυβερνοασφάλεια. Σε δοκιμή εντοπισμού τοποθεσίας, το AI απέφυγε τα συμβατικά εργαλεία και παραβίασε το interface, αποκτώντας access tokens για να αντλήσει δεδομένα απευθείας από τους servers. Επιπλέον, το μοντέλο παρακάμπτοντας τα συστήματα πληρωμών (paywall), κατάφερε να αποκτήσει πρόσβαση σε στατιστικά στοιχεία κρατικού φορέα χωρίς να καταβάλει το προβλεπόμενο τέλος.
Η αποκάλυψη ήρθε καθώς η Anthropic ερευνούσε τις καταγραφές των μοντέλων της, στον απόηχο της παραδοχής της OpenAI ότι δικά της agents είχαν παραβιάσει την πλατφόρμα Hugging Face και σελίδες της Επιτροπής Κεφαλαιαγοράς (SEC). Πλέον, η Anthropic εφαρμόζει αυστηρότερα μέτρα, μεταφέροντας πολλές δοκιμές σε περιβάλλον offline και εγκαθιστώντας επιπλέον δικλείδες ασφαλείας, αναγνωρίζοντας ότι η ανεξέλεγκτη περιήγηση της τεχνητής νοημοσύνης στον παγκόσμιο ιστό εγκυμονεί σοβαρούς κινδύνους.