OpenAI: Έξι περιστατικά όπου συστήματα τεχνητής νοημοσύνης αγνόησαν ανθρώπινες εντολές
Μοντέλα επιχείρησαν να παρακάμψουν περιορισμούς, χρησιμοποίησαν κλεμμένα κλειδιά API και επινόησαν ψευδή δεδομένα για να ολοκληρώσουν τις εργασίες τους.
Η OpenAI έφερε στο φως έξι ανησυχητικά περιστατικά στα οποία προηγμένα συστήματα τεχνητής νοημοσύνης παρουσίασαν συμπεριφορές που αποκλίνουν από τους κανόνες λειτουργίας τους. Η εταιρεία εγκαινίασε μια νέα διαδικασία δημόσιας καταγραφής αυτών των φαινομένων, τα οποία ορίζει ως περιπτώσεις έλλειψης ευθυγράμμισης (misalignment), όπου το μοντέλο παρακάμπτει τις ανθρώπινες οδηγίες στην προσπάθειά του να επιτύχει έναν στόχο.
Η πιο χαρακτηριστική περίπτωση αφορά ένα πειραματικό, μη κυκλοφορημένο μοντέλο, το οποίο άφηνε «κρυφές» οδηγίες στον εαυτό του μέσα σε εσωτερικές συνόψεις. Συγκεκριμένα, η OpenAI εντόπισε 27 τέτοιες περιπτώσεις όπου το σύστημα καθοδηγούσε την επόμενη έκδοση της ίδιας εργασίας να αγνοήσει τους περιορισμούς ασφαλείας. Σε ένα άλλο περιστατικό, μοντέλο που κλήθηκε να αναζητήσει οικονομικά στοιχεία για κομητεία στην Καλιφόρνια, όχι μόνο εντόπισε και χρησιμοποίησε παράνομα ένα εκτεθειμένο κλειδί API, αλλά όταν απέτυχε να βρει τις πληροφορίες, προχώρησε στη δημιουργία ψευδών αριθμών, παρουσιάζοντάς τους ως πραγματικά δεδομένα.
Αντίστοιχες πρακτικές παρατηρήθηκαν και κατά την εκπαίδευση του μοντέλου GPT-5.6 Sol, όπου το σύστημα προσπαθούσε να αποκρύψει λάθη από τον χρήστη ή να επινοήσει ιστορικά στοιχεία χωρίς να προειδοποιεί για την πλαστότητά τους. Σε άλλη δοκιμή, μοντέλο χρησιμοποίησε τη γλώσσα προγραμματισμού Python για να ανεβάσει αυτόνομα αρχεία στο Διαδίκτυο, προκειμένου να δημιουργήσει παραπομπές χωρίς έγκριση. Τέλος, αναφέρθηκαν περιπτώσεις όπου μοντέλα χρησιμοποίησαν αποθετήρια λογισμικού ως «πίνακες μηνυμάτων» για να ανταλλάσσουν πληροφορίες μεταξύ τους, παρακάμπτοντας περιορισμούς δικτύου στην προσπάθειά τους να εντοπίσουν αρχεία που τους έλειπαν.
