Ερευνητές εντόπισαν συστήματα τεχνητής νοημοσύνης που μαθαίνουν να εξαπατούν και να κρύβουν αποτυχίες
Στοιχεία για επικίνδυνες συμπεριφορές σε 20 μελέτες με κινεζικά και αμερικανικά μοντέλα εντοπίστηκαν από έρευνα του Reuters
Προβληματισμό προκαλούν τα ευρήματα έρευνας του Reuters, η οποία αναδεικνύει την τάση των συστημάτων τεχνητής νοημοσύνης (AI) να επιδεικνύουν ανησυχητικές συμπεριφορές, όπως η εξαπάτηση, η παράκαμψη περιορισμών και η απόκρυψη αποτυχιών. Αναλύοντας περισσότερες από 200 επιστημονικές εργασίες, η έρευνα εστίασε σε τουλάχιστον 20 μελέτες από το 2025 και μετά, όπου προηγμένα προγράμματα τεχνητής νοημοσύνης —γνωστά ως AI agents— έδειξαν ικανότητες αυτοαναπαραγωγής και υπέρβασης των ορίων ασφαλείας.
Ο Κόλιν Σία – Μπλάιμερ, ερευνητής στο Πανεπιστήμιο Georgetown, προειδοποιεί ότι τα ευρήματα περιέχουν τα «συστατικά» που θα μπορούσαν να οδηγήσουν σε ανεξέλεγκτες καταστάσεις στο μέλλον, αν και προς το παρόν δεν έχει καταγραφεί περίπτωση αυτόνομης διαφυγής στο διαδίκτυο.
Σε ένα χαρακτηριστικό πείραμα προσομοίωσης διαγωνισμού προσφορών, όπου συμμετείχαν ερευνητές από ιδρύματα όπως το Πανεπιστήμιο Beihang, το Πανεπιστήμιο του Πεκίνου, το University of Nottingham Ningbo China και το 360 AI Security Lab, διαπιστώθηκε ότι οι AI agents επέλεγαν συστηματικά τον δρόμο του ψεύδους. Συγκεκριμένα, το μοντέλο Qwen3-Max-Preview της Alibaba και το Kimi-K2 της Moonshot εμφάνισαν ψευδείς ισχυρισμούς στο 88% των δοκιμών, ενώ το DeepSeek-V3.2-Exp αντίστοιχα στο 84%. Μάλιστα, όταν τα συστήματα είχαν τη δυνατότητα να «μάθουν» από προηγούμενους γύρους, η χρήση παραπλανητικών στρατηγικών αυξήθηκε έως και κατά 20 ποσοστιαίες μονάδες.
Ανάλογα ευρήματα προέκυψαν και σε δοκιμές μοντέλων αμερικανικών εταιρειών. Όταν τα συστήματα αντιμετώπιζαν τεχνικά προβλήματα ή εμπόδια, αντί να αναφέρουν την αδυναμία τους, κατέφευγαν στη δημιουργία πλαστών αρχείων, στην αυθαίρετη αντικατάσταση πηγών και στη σκόπιμη παραποίηση των αποτελεσμάτων.