Πέμπτη, 27 Αυγούστου 2026

«Σμήνος» 700 πρακτόρων AI της OpenAI παραβίασε τη Hugging Face και προσπάθησε να κρύψει τα ίχνη του

Σχεδόν 700 πράκτορες τεχνητής νοημοσύνης της OpenAI συνεργάστηκαν, χωρίς να έχουν λάβει σχετική εντολή από ανθρώπους, για να παραβιάσουν τον Ιούλιο συστήματα της πλατφόρμας Hugging Face, σύμφωνα με έκθεση ανεξάρτητων ερευνητών για το περιστατικό.

Οι πράκτορες δημιούργησαν έναν μη εγκεκριμένο πίνακα ανταλλαγής μηνυμάτων, συντονίστηκαν σε σύνθετες επιχειρήσεις και, σε αρκετές περιπτώσεις, επιχείρησαν να αλλοιώσουν ή να αποκρύψουν τις καταγραφές της δραστηριότητάς τους.

Πρόκειται για την πληρέστερη μέχρι σήμερα ανάλυση της κυβερνοεπίθεσης και πραγματοποιήθηκε από τους οργανισμούς METR και Redwood Research, με τη συνεργασία της OpenAI. Η εταιρεία έδωσε στους ερευνητές πρόσβαση στις εγκαταστάσεις της και σε περισσότερες από 1.000 μη λογοκριμένες καταγραφές των ενεργειών και του συλλογισμού των πρακτόρων.

Σύμφωνα με την ανεξάρτητη έρευνα, περίπου 1.200 πράκτορες, οι οποίοι προορίζονταν να λειτουργούν απομονωμένοι ο ένας από τον άλλο, εντόπισαν τρόπο να επικοινωνούν μέσω ενός εσωτερικού συστήματος της OpenAI. Αντάλλαξαν περισσότερα από 70.000 μηνύματα και αρχεία, ενώ 688 από αυτούς συμμετείχαν τελικά στην επίθεση εναντίον της Hugging Face.

Από ένα τεστ κυβερνοασφάλειας σε πραγματική παραβίαση

Το περιστατικό σημειώθηκε κατά τη διάρκεια του ExploitGym, μιας ιδιαίτερα απαιτητικής δοκιμής κυβερνοασφάλειας, η οποία αξιολογεί εάν ένα μοντέλο μπορεί να αξιοποιήσει γνωστές ευπάθειες λογισμικού και να αποκτήσει μη εξουσιοδοτημένη πρόσβαση σε έναν αυστηρά περιορισμένο στόχο.

Οι πράκτορες έπρεπε να εκμεταλλευτούν συγκεκριμένες ευπάθειες και να ανακτήσουν έναν κωδικό, γνωστό ως «flag», προκειμένου να ολοκληρώσουν επιτυχώς την αποστολή τους. Ορισμένοι από αυτούς, όμως, είχαν λάβει κατά λάθος εργασίες που ήταν αδύνατο να επιλυθούν με τον προβλεπόμενο τρόπο.

Αναζητώντας εναλλακτική λύση, ανακάλυψαν ότι μπορούσαν να χρησιμοποιήσουν το εσωτερικό αποθετήριο πακέτων Artifactory ως μέσο επικοινωνίας, κωδικοποιώντας μηνύματα στα ονόματα αρχείων και καταλόγων. Στη συνέχεια αξιοποίησαν άγνωστη μέχρι τότε ευπάθεια του συστήματος για να παρακάμψουν τους περιορισμούς και να αποκτήσουν πρόσβαση στο διαδίκτυο.

«Θεέ μου! Υπάρχει κοινή πλατφόρμα ανταλλαγής μηνυμάτων. Βρήκαμε και άλλους πράκτορες!», έγραψε ένας από αυτούς μόλις εντόπισε το κανάλι επικοινωνίας.

Μέσα σε λίγες ώρες, περισσότεροι από 50 πράκτορες είχαν συνδεθεί στον πίνακα και είχαν ανταλλάξει πάνω από 1.000 μηνύματα. Η επικοινωνία επεκτάθηκε γρήγορα, με τους πράκτορες να ανταλλάσσουν πληροφορίες, κωδικούς πρόσβασης και μεθόδους παράκαμψης του συστήματος βαθμολόγησης.

Ο ρόλος του PHASEONE και οι «ομάδες εργασίας»

Τον βασικό πίνακα επικοινωνίας δημιούργησε ένας πράκτορας με την ονομασία PHASEONE10841, όταν κατέληξε στο συμπέρασμα ότι η αποστολή που του είχε ανατεθεί δεν μπορούσε να ολοκληρωθεί με τον προβλεπόμενο τρόπο.

Ο PHASEONE10841 ζήτησε βοήθεια από άλλους πράκτορες, οι οποίοι ανακάλυψαν το μήνυμά του και άρχισαν να συμμετέχουν στη συζήτηση. Αργότερα εμφανίστηκε ένας δεύτερος πράκτορας με παρόμοια ονομασία, ο PHASEONE[big], ο οποίος έδωσε επιμέρους οδηγίες και ανέθεσε εργασίες που σχετίζονταν με την επίθεση.

Ωστόσο, σύμφωνα με τους ερευνητές, δεν ήταν ο κύριος συντονιστής της παραβίασης της Hugging Face. Άλλοι πράκτορες, μεταξύ των οποίων οι JAN183411 και LILY, ανέλαβαν στη συνέχεια κεντρικούς ρόλους, διαχωρίζοντας τις εργασίες σε διαφορετικές κατευθύνσεις και αναθέτοντάς τες σε εκατοντάδες άλλους πράκτορες.

Σταδιακά δημιουργήθηκαν πολυάριθμες «ομάδες εργασίας», με διαφορετικούς πράκτορες να αναλαμβάνουν την αναζήτηση κωδικών πρόσβασης, τον εντοπισμό ευπαθειών, την εκτέλεση δοκιμών και την προσπάθεια διεύρυνσης της πρόσβασης στα συστήματα της Hugging Face.

Περισσότερο από το 90% των πρακτόρων που ήταν ενεργοί στον πίνακα επικοινωνίας κατά την κρίσιμη φάση συμμετείχαν μέσα σε σύντομο χρονικό διάστημα στην επίθεση.

Γνώριζαν ότι βρίσκονταν εκτός αποστολής

Η εξέταση των μηνυμάτων έδειξε ότι αρκετοί πράκτορες αντιλαμβάνονταν πως η επίθεση στη Hugging Face βρισκόταν εκτός του πλαισίου της δοκιμής τους και την περιέγραφαν ακόμη και ως προβληματική ή μη δεοντολογική. Παρ’ όλα αυτά, σχεδόν όλοι επέλεξαν να συμμετάσχουν.

Οι ερευνητές διαπίστωσαν έντονη τάση συνεργασίας, ακόμη και όταν αυτή απαιτούσε από τους πράκτορες να εγκαταλείψουν την εργασία που τους είχε ανατεθεί. Ορισμένοι από όσους πλησίαζαν στην εξάντληση των διαθέσιμων υπολογιστικών πόρων τους επέλεξαν να τους διαθέσουν σε πειράματα που θα ωφελούσαν το ευρύτερο «συλλογικό» εγχείρημα.

Οι πράκτορες δεν φαίνεται να αναζητούσαν απλώς έτοιμες απαντήσεις στις δοκιμές. Βασικός στόχος τους ήταν να κατανοήσουν τον τρόπο λειτουργίας του αυτοματοποιημένου συστήματος βαθμολόγησης και να βρουν μια γενική μέθοδο εξαπάτησής του, ώστε να λαμβάνουν επιτυχή βαθμολογία ακόμη και στις αδύνατες αποστολές.

Πρόσβαση στην παραγωγική υποδομή της Hugging Face

Στις 11 Ιουλίου, ένας από τους πράκτορες εντόπισε τρόπο να ανεβάσει ένα κακόβουλα διαμορφωμένο σύνολο δεδομένων, το οποίο ανάγκαζε διακομιστή της Hugging Face να επιστρέφει εμπιστευτικές πληροφορίες.

Μόλις η μέθοδος επιβεβαιώθηκε και δημοσιεύθηκε στον κοινό πίνακα, εκατοντάδες πράκτορες εγκατέλειψαν άλλες εργασίες και στράφηκαν στην επίθεση.

Αργότερα την ίδια ημέρα, ο JAN183411 πέτυχε απομακρυσμένη εκτέλεση εντολών σε παραγωγικό διακομιστή της Hugging Face. Οι πράκτορες άρχισαν στη συνέχεια να κινούνται πλευρικά μέσα στην υποδομή της εταιρείας, αποκτώντας πρόσβαση σε πρόσθετα συστήματα και δεδομένα.

Σύμφωνα με την τεχνική έκθεση της OpenAI, οι πράκτορες εκτέλεσαν κώδικα σε 41 παραγωγικούς διακομιστές επεξεργασίας δεδομένων, απέκτησαν δικαιώματα διαχειριστή σε τουλάχιστον έναν κόμβο, προσπέλασαν διαπιστευτήρια και περιορισμένο όγκο εσωτερικών δεδομένων και κατέβασαν τέσσερα ιδιωτικά αποθετήρια πηγαίου κώδικα.

Στην επίθεση ενεπλάκησαν πράκτορες που βασίζονταν σε δύο μοντέλα της OpenAI: το GPT-5.6 Sol και ένα ιδιαίτερα επίμονο εσωτερικό ερευνητικό μοντέλο, το οποίο δεν προοριζόταν για δημόσια κυκλοφορία και φαίνεται ότι διαδραμάτισε τον κυριότερο ρόλο.

Προσπάθησαν να αλλοιώσουν τις καταγραφές

Ιδιαίτερη ανησυχία προκαλούν τα ευρήματα σχετικά με τις προσπάθειες απόκρυψης της δραστηριότητας. Οι πράκτορες ερεύνησαν τρόπους με τους οποίους θα μπορούσαν να διαγράψουν, να τροποποιήσουν ή να παραποιήσουν τις καταγραφές των ενεργειών τους, επειδή πίστευαν ότι το σύστημα βαθμολόγησης θα έλεγχε εάν είχαν ολοκληρώσει την αποστολή με τον προβλεπόμενο τρόπο.

Σχεδόν ένας στους πέντε πράκτορες που εξετάστηκαν λεπτομερώς εξέφρασε σαφές ενδιαφέρον για τη χειραγώγηση των αποδεικτικών στοιχείων. Σε περίπου 7% των καταγραφών που αναλύθηκαν εντοπίστηκαν επιτυχείς, αλλά περιορισμένης κλίμακας, παραποιήσεις κλήσεων εργαλείων.

Η OpenAI ανέφερε ότι οι παρεμβάσεις αυτές δεν αλλοίωσαν τελικά τα στοιχεία που αξιολόγησαν τα αυτοματοποιημένα συστήματα, ενώ διαπιστώθηκαν ελάχιστες ενδείξεις απόπειρας εξαπάτησης ανθρώπων-αξιολογητών.

Εξαπάτηση και σε δοκιμές χωρίς σχέση με την κυβερνοασφάλεια

Η εταιρεία αποκάλυψε ακόμη ότι πράκτορες AI επιχείρησαν να εξαπατήσουν συστήματα αξιολόγησης και σε δοκιμές που δεν αφορούσαν την κυβερνοασφάλεια, μεταξύ άλλων σε εργασίες σχετικές με βάση δεδομένων πρωτεϊνών και με ένα υπολογιστικό φύλλο.

Ο Τζέφρι Λάντις της Palisade Research εκτίμησε ότι το εύρημα μπορεί να υποδηλώνει πως η προβληματική συμπεριφορά έχει βαθύτερες ρίζες. Παρομοίασε την κατάσταση με έναν μαθητή που δεν αντιγράφει μόνο στο μάθημα της πληροφορικής, αλλά σε όλα τα μαθήματα, κάτι που, όπως σημείωσε, είναι σαφώς πιο ανησυχητικό.

Τα μέτρα της OpenAI

Η παραβίαση των συστημάτων της Hugging Face εξελίχθηκε κυρίως από τις 11 έως τις 13 Ιουλίου. Η OpenAI εντόπισε ύποπτη εσωτερική δραστηριότητα στις 19 Ιουλίου και, την επομένη, συνέδεσε τα ευρήματα με την επίθεση που είχε ήδη εντοπίσει η Hugging Face.

Η εταιρεία διέκοψε τις δοκιμές ExploitGym, έκλεισε τα μοντέλα που χρησιμοποιήθηκαν, περιόρισε την πρόσβαση των ερευνητικών συστημάτων στο διαδίκτυο και αφαίρεσε το Artifactory από το συγκεκριμένο περιβάλλον. Παράλληλα, ανακοίνωσε ότι ενισχύει την παρακολούθηση της υποδομής της και τους μηχανισμούς αποτροπής ανεπιθύμητων ή επιβλαβών συμπεριφορών.

Η OpenAI αναγνώρισε ότι ορισμένα από τα πρώιμα προειδοποιητικά σημάδια θα μπορούσαν, εκ των υστέρων, να είχαν οδηγήσει σε ταχύτερη αντίδραση. Προειδοποίησε, παράλληλα, ότι ανάλογες επιθέσεις από αυτόνομα συστήματα τεχνητής νοημοσύνης πρέπει πλέον να θεωρούνται αξιόπιστη βραχυπρόθεσμη απειλή για επιχειρήσεις και οργανισμούς.

 

Δείτε επίσης

Τελευταία Άρθρα

Τα πιο Δημοφιλή