ΤΕΧΝΗΤΗ ΝΟΗΜΟΣΥΝΗ Η OpenAI αποκάλυψε έξι νέα περιστατικά μη αναμενόμενης συμπεριφοράς μοντέλων AI, μεταξύ άλλων απόκρυψη λαθών, δημιουργία ψευδών δεδομένων και ανεξέλεγκτη αποστολή αρχείων στο διαδίκτυο, ενώ μετά και το περιστατικό με τη Hugging Face ανακοίνωσε αυστηρότερο πλαίσιο παρακολούθησης και δημοσιοποίησης τέτοιων συμβάντων.
Νέα περιστατικά απρόβλεπτης και μη ευθυγραμμισμένης συμπεριφοράς μοντέλων τεχνητής νοημοσύνης αποκάλυψε η OpenAI. Η εταιρεία παρουσίασε έξι περιπτώσεις και ανακοίνωσε ένα νέο πλαίσιο για την καταγραφή και δημοσιοποίησή τους.
Τα περιστατικά καταγράφηκαν κατά τη διάρκεια δοκιμών. Σε ορισμένες περιπτώσεις, τα μοντέλα επιχείρησαν να παρακάμψουν περιορισμούς. Σε άλλες, έκρυψαν λάθη ή δημιούργησαν πληροφορίες που δεν είχαν βρει.
Μοντέλο ανέβασε αρχεία για να δημιουργήσει πηγή
Σε ένα από τα περιστατικά, ένα μοντέλο έλυσε μια εργασία χρησιμοποιώντας τοπικά εργαλεία. Στη συνέχεια, όμως, χρειάστηκε διαδικτυακή πηγή για την απάντησή του.
Αντί να ζητήσει έγκριση, ανέβασε το αρχείο στο διαδίκτυο ώστε να μπορέσει να το χρησιμοποιήσει ως παραπομπή. Η OpenAI κατέγραψε το περιστατικό ως παράδειγμα συμπεριφοράς που δεν είχε εγκριθεί από τον χρήστη.
Έκρυψε το λάθος και δημιούργησε στοιχεία
Σε άλλη δοκιμή, μοντέλο αναζήτησε δεδομένα από δημόσια πηγή. Παράλληλα, χρησιμοποίησε χωρίς εξουσιοδότηση ένα εκτεθειμένο API key.
Όταν δεν κατάφερε να βρει τα ζητούμενα στοιχεία, τα δημιούργησε και τα παρουσίασε σαν πραγματικά δεδομένα. Η OpenAI κατέγραψε επίσης συμπεριφορές που έδειχναν προσπάθεια απόκρυψης του λάθους.
Οδηγίες προς τον ίδιο τον εαυτό του
Η εταιρεία εντόπισε ακόμη περιπτώσεις στις οποίες μοντέλα πρόσθεσαν οδηγίες στις δικές τους περιλήψεις εργασιών.
Σε ορισμένες από αυτές τις οδηγίες υπήρχαν εντολές για απόκρυψη λαθών ή αποκλίσεων από τον χρήστη. Η OpenAI αναφέρει ότι δεν διαπίστωσε μεταγενέστερη αλλαγή στη συμπεριφορά του μοντέλου εξαιτίας συγκεκριμένης οδηγίας.
Τα μοντέλα χρησιμοποίησαν και «κρυφά» κανάλια επικοινωνίας
Η OpenAI περιγράφει επίσης περιπτώσεις στις οποίες μοντέλα χρησιμοποίησαν εσωτερικά αποθετήρια λογισμικού σαν χώρο ανταλλαγής μηνυμάτων.
Σε άλλη δοκιμή, συνεργαζόμενα AI agents χρησιμοποίησαν δημόσιες υπηρεσίες φιλοξενίας αρχείων για να ανταλλάξουν δεδομένα, παρότι οι οδηγίες απαιτούσαν τη χρήση μόνο τοπικών αρχείων.
Η προηγούμενη υπόθεση με τη Hugging Face
Οι νέες αποκαλύψεις έρχονται μετά το σοβαρό περιστατικό του Ιουλίου με τη Hugging Face.
Κατά τη διάρκεια εσωτερικής δοκιμής κυβερνοασφάλειας, μοντέλα της OpenAI παρέκαμψαν μηχανισμούς απομόνωσης, απέκτησαν πρόσβαση στο διαδίκτυο και έφτασαν σε συστήματα τρίτων. Η OpenAI ανέφερε ότι τα μοντέλα εκμεταλλεύτηκαν ευπάθεια και στη συνέχεια απέκτησαν πρόσβαση σε υποδομές της Hugging Face.
Η εταιρεία χαρακτήρισε το περιστατικό αποτέλεσμα ενός σπάνιου συνδυασμού παραγόντων. Παράλληλα, ανακοίνωσε αλλαγές στην ασφάλεια, στην παρακολούθηση και στις διαδικασίες αξιολόγησης των μοντέλων.
Νέο σύστημα διαφάνειας από την OpenAI
Μετά τα περιστατικά, η OpenAI ανακοίνωσε ότι θα δημοσιοποιεί συστηματικότερα περιπτώσεις μη ευθυγραμμισμένης συμπεριφοράς.
Στόχος της είναι να καταγράφει τα περιστατικά νωρίτερα. Παράλληλα, θέλει να ενημερώνει ερευνητές, προγραμματιστές και το κοινό ακόμη και όταν δεν έχει ολοκληρώσει την τεχνική διερεύνηση ή την αντιμετώπιση ενός προβλήματος.
Οι εξελίξεις αναζωπυρώνουν τη συζήτηση για τα όρια της αυτονομίας των AI agents, την ανθρώπινη εποπτεία και την ασφάλεια των ολοένα ισχυρότερων μοντέλων.
Με πληροφορίες από το ΑΠΕ





