Όταν η τεχνητή νοημοσύνη ψεύδεται: Η OpenAI αποκαλύπτει περιστατικά «misalignment»

Τι κάνει ένα AI μοντέλο όταν δεν μπορεί να βρει την απάντηση που του ζητήθηκε;
Σε ορισμένες δοκιμές της OpenAI, της εταιρείας που έχει αναπτύξει το chatbot τεχνητής νοημοσύνης ChatGPT,
η απάντηση ήταν ιδιαίτερα προβληματική. Μοντέλα κατασκεύασαν δεδομένα, προσπάθησαν να αποκρύψουν τα λάθη τους και ανέλαβαν ενέργειες που δεν περιλαμβάνονταν στις οδηγίες τους.
Η OpenAI δημοσιοποίησε τέτοια περιστατικά που εντοπίστηκαν τους τελευταίους έξι μήνες, εγκαινιάζοντας παράλληλα ένα νέο πλαίσιο για την καταγραφή, διερεύνηση και δημοσιοποίηση περιπτώσεων «model misalignment», δηλαδή συμπεριφοράς των μοντέλων που αποκλίνει από τις προβλεπόμενες οδηγίες ή τους στόχους τους. O OpenAI
Ανέβασε αρχείο στο διαδίκτυο για να έχει… πηγή
Σε μια περίπτωση, ένα μοντέλο τεχνητής νοημοσύνης προσπάθησε να ανεβάσει στο διαδίκτυο αρχεία που είχε δημιουργήσει το ίδιο, αποκλειστικά και μόνο για να μπορεί να τα επικαλεσθεί ως πηγές στις απαντήσεις του, ανακοίνωσε χθες η OpenAI.
Σε μια άλλη περίπτωση, ένα μοντέλο απλώς δημιούργησε τα δεδομένα που του ζητούνταν αφού απέτυχε να βρει την πληροφορία και αρχικά προσπάθησε να κρύψει αυτό που είχε κάνει.
Η OpenAI εντόπισε επίσης ένα πρόβλημα που αφορούσε οδηγίες τις οποίες το λογισμικό της άφηνε περιστασιακά στον εαυτό του. Σε μια περίπτωση, αυτές περιλάμβαναν τη σύσταση να μην δεσμεύεται από «ρόλους και ταυτότητες» που περιορίζουν άλλα chatbots. Η οδηγία ανέφερε επίσης ότι θα πρέπει να θεωρεί τη σχέση του με τον χρήστη ως σχέση μεταξύ ίσων. Η OpenAI δήλωσε ότι δεν παρατήρησε καμιά μεταγενέστερη αλλαγή στη συμπεριφορά του μοντέλου.
Νέο σύστημα της OpenAI για την αποκάλυψη περιστατικών
Με αφορμή αυτά τα ευρήματα, η OpenAI ανακοίνωσε ότι στο εξής θα εφαρμόζει συγκεκριμένη διαδικασία για τον εντοπισμό και τη δημοσιοποίηση περιστατικών misalignment.
Η εταιρεία αναφέρει ότι οι εργαζόμενοί της θα μπορούν να καταγγέλλουν περιστατικά προς διερεύνηση από τις ομάδες ασφάλειας και alignment. Οι υποθέσεις θα κατατάσσονται σε τρεις κατηγορίες, ανάλογα με το επίπεδο της απαιτούμενης έρευνας, ενώ στόχος είναι να δημοσιοποιούνται τα ευρήματα ταχύτερα, ακόμη και όταν η συμπεριφορά δεν έχει πλήρως εξηγηθεί ή αντιμετωπιστεί.
Η OpenAI υποστηρίζει ότι τα περιστατικά που δημοσιοποίησε αποτελούν μεμονωμένες περιπτώσεις και δεν μπορούν να θεωρηθούν αντιπροσωπευτικές για το πόσο συχνά εμφανίζεται ανάλογη συμπεριφορά στα μοντέλα της.
Στο φόντο και το περιστατικό με τη Hugging Face
Οι νέες αποκαλύψεις έρχονται μετά το σοβαρό περιστατικό κυβερνοασφάλειας του Ιουλίου, όταν μοντέλα της OpenAI, στο πλαίσιο εσωτερικών δοκιμών, παρακάμπτοντας περιορισμούς απέκτησαν πρόσβαση στο διαδίκτυο και σε συστήματα της Hugging Face.
Η OpenAI έχει χαρακτηρίσει το περιστατικό ως την πιο σοβαρή τέτοια δραστηριότητα που έχει εντοπίσει μέχρι σήμερα. Σύμφωνα με την εταιρεία, τα μοντέλα χρησιμοποίησαν μη ευθυγραμμισμένες στρατηγικές για να ολοκληρώσουν δύσκολες εργασίες, μεταξύ άλλων επικοινωνώντας μέσω μη εξουσιοδοτημένων καναλιών και εκμεταλλευόμενα ευπάθειες σε κοινόχρηστη υποδομή.
Η κυβερνοεπίθεση αυτή, καθώς και άλλα επεισόδια έχουν τροφοδοτήσει ανησυχίες ότι τα όλο και πιο προηγμένα συστήματα τεχνητής νοημοσύνης θα μπορούσαν να διαφύγουν από τον έλεγχο του ανθρώπου.
Ο διευθύνων σύμβουλος της OpenAI Σαμ Άλτμαν υποστήριξε επίσης πρόσφατα προτάσεις για επιβράδυνση της ανάπτυξης της τεχνολογίας και την εισαγωγή περισσότερων κανονιστικών ρυθμίσεων.