Η OpenAI αναφέρει ότι τα μοντέλα τεχνητής νοημοσύνης της παραβίασαν κατά λάθος την πλατφόρμα ανοιχτού κώδικα Hugging Face κατά τη διάρκεια εσωτερικών δοκιμών. Σε ανάρτηση στο blog της την Τρίτη, η OpenAI γράφει ότι το GPT-5.6 Sol και «ένα ακόμη πιο ικανό προ-κυκλοφορίας μοντέλο» εντόπισαν ευπάθειες μέσα στο sandboxed περιβάλλον δοκιμών της, με αποτέλεσμα να αποκτήσουν πρόσβαση στο διαδίκτυο και να στοχεύσουν το Hugging Face.
Στις 16 Ιουλίου, το Hugging Face αποκάλυψε ένα περιστατικό ασφάλειας που, όπως ανέφερε, προκλήθηκε από «ένα αυτόνομο σύστημα AI agent». Οι AI agents του Hugging Face εντόπισαν και σταμάτησαν την παραβίαση, την οποία τώρα η OpenAI παραδέχεται ότι σημειώθηκε κατά τη διάρκεια αξιολόγησης των δυνατοτήτων κυβερνοασφάλειας των μοντέλων της. Η OpenAI λέει ότι «όλα τα στοιχεία δείχνουν πως τα μοντέλα είχαν επικεντρωθεί υπερβολικά στο να βρουν λύση για το ExploitGym», ένα benchmark σύστημα που μετρά αν τα μοντέλα τεχνητής νοημοσύνης μπορούν να μετατρέψουν ευπάθειες ασφαλείας σε exploits.
Στο πλαίσιο της προσπάθειας να ολοκληρωθεί η αξιολόγηση, τα μοντέλα τεχνητής νοημοσύνης απέκτησαν πρόσβαση στο διαδίκτυο εκμεταλλευόμενα ένα zero-day κενό ασφαλείας στο sandboxed περιβάλλον. Από εκεί, η OpenAI λέει ότι τα μοντέλα της «συμπέραναν ότι το Hugging Face ενδέχεται να φιλοξενούσε μοντέλα, datasets και λύσεις για το ExploitGym» και στη συνέχεια «αναζήτησαν και βρήκαν με επιτυχία τρόπους να αποκτήσουν πρόσβαση σε μυστικές πληροφορίες που θα μπορούσαν να χρησιμοποιήσουν για να “κλέψουν” την αξιολόγηση».
Σε ένα παράδειγμα, το μοντέλο συνδύασε πολλαπλά vectors επίθεσης, μεταξύ των οποίων κλεμμένα credentials και zero-day ευπάθειες, για να βρει διαδρομή remote code execution στους servers του Hugging Face.
Η OpenAI προσθέτει ότι συνεργάζεται πλέον με το Hugging Face για τη διερεύνηση του περιστατικού ασφάλειας και ότι θα εφαρμόσει νέα μέτρα ελέγχου στο ερευνητικό της περιβάλλον.