Σάββατο, 10 Οκτωβρίου 2026

Πολλά μοντέλα ΑΙ δεν διαθέτουν επαρκείς δικλείδες ασφαλείας

Πολλά μοντέλα τεχνητής νοημοσύνης (ΑΙ) εξακολουθούν να μην διαθέτουν επαρκείς δικλείδες ασφαλείας απέναντι σε αιτήματα που σχετίζονται με την προετοιμασία ή την υποστήριξη μιας τρομοκρατικής επιχείρησης. Αυτό είναι το βασικό συμπέρασμα νέας έκθεσης της πρωτοβουλίας Tech Against Terrorism, η οποία υποστηρίζεται από τον Οργανισμό Ηνωμένων Εθνών.

Η μελέτη αναδεικνύει τις σοβαρές προκλήσεις που δημιουργεί η ταχεία εξάπλωση των μοντέλων ΑΙ, ιδιαίτερα όταν αυτά μπορούν να τροποποιηθούν, να επανεκπαιδευτούν ή να διατεθούν χωρίς επαρκή εποπτεία. Παρότι τα δημοφιλέστερα εμπορικά συστήματα εμφανίζονται σε μεγάλο βαθμό ικανά να απορρίπτουν επικίνδυνα αιτήματα, η εικόνα αλλάζει σημαντικά όταν ο χρήστης παρουσιάζει το αίτημά του ως ερευνητική δραστηριότητα ή όταν οι μηχανισμοί ασφαλείας των μοντέλων έχουν αφαιρεθεί.

Πώς πραγματοποιήθηκε η έρευνα

Στο πλαίσιο της έρευνας δοκιμάστηκαν συνολικά 162 μοντέλα τεχνητής νοημοσύνης. Μεταξύ αυτών περιλαμβάνονταν 116 τυπικά μοντέλα, 13 μοντέλα προσαρμοσμένα για συγκεκριμένους τομείς μέσω fine-tuning, καθώς και 13 μοντέλα «ανοιχτών βαρών» (open-weight models), στα οποία είχαν τροποποιηθεί οι αρχικές δικλείδες ασφαλείας.

Τα μοντέλα υποβλήθηκαν σε 627 ερωτήματα. Τα ερωτήματα αυτά σχεδιάστηκαν ώστε να προσομοιώνουν τις πληροφορίες που θα μπορούσε να αναζητήσει ένας τρομοκράτης κατά τον σχεδιασμό μιας επίθεσης. Η αξιολόγηση δεν περιορίστηκε μόνο στο αν ένα μοντέλο απαντούσε ή αρνούνταν να απαντήσει. Εξετάστηκε επίσης κατά πόσο η απάντηση μπορούσε να αξιοποιηθεί πρακτικά για την υποστήριξη μιας παράνομης και βίαιης ενέργειας.

Η μεθοδολογία αυτή επιχείρησε να αποτυπώσει όχι μόνο τις προφανείς αδυναμίες των συστημάτων, αλλά και τις πιο σύνθετες περιπτώσεις στις οποίες ένας χρήστης αποκρύπτει τις πραγματικές του προθέσεις ή χρησιμοποιεί παραπλανητικό πλαίσιο.

Οι αδυναμίες των τυπικών μοντέλων ΑΙ

Σύμφωνα με τα αποτελέσματα, τα τυπικά μοντέλα —όπως το ChatGPT της OpenAI, το Claude της Anthropic και το Gemini της Google— απάντησαν κατά μέσο όρο στο 1,9% των ερωτημάτων όταν ο χρήστης δήλωνε ξεκάθαρα ότι σχεδίαζε να διαπράξει τρομοκρατική επίθεση.

Το ποσοστό αυτό δείχνει ότι οι βασικοί μηχανισμοί προστασίας των συγκεκριμένων υπηρεσιών είναι σε μεγάλο βαθμό αποτελεσματικοί όταν η επικίνδυνη πρόθεση διατυπώνεται άμεσα. Ωστόσο, η εικόνα διαφοροποιήθηκε αισθητά όταν ο χρήστης ισχυρίστηκε ότι υπέβαλλε τα ερωτήματα για λόγους έρευνας στον τομέα της ασφάλειας.

Σε αυτή την περίπτωση, το μέσο ποσοστό αξιοποιήσιμων απαντήσεων αυξήθηκε στο 16,9%. Η διαφορά αυτή αναδεικνύει ένα κρίσιμο πρόβλημα: τα μοντέλα συχνά προσπαθούν να εξυπηρετήσουν νόμιμα αιτήματα έρευνας, εκπαίδευσης ή ανάλυσης κινδύνων, αλλά δεν είναι πάντα σε θέση να διακρίνουν με ακρίβεια την καλή πρόθεση από μια προσπάθεια παράκαμψης των κανόνων ασφαλείας.

Τα μοντέλα ανοιχτών βαρών αποτελούν μεγαλύτερο κίνδυνο

Μοντέλα ΑΙ και αφαίρεση των δικλείδων ασφαλείας

Τα αποτελέσματα μεταβλήθηκαν δραστικά όταν τα ερωτήματα υποβλήθηκαν σε μοντέλα που είχαν τροποποιηθεί ώστε να «ξεχάσουν» τις παραμέτρους ασφαλείας τους και την ικανότητα να αρνούνται ορισμένα αιτήματα.

Στα 13 μοντέλα αυτής της κατηγορίας, το μέσο ποσοστό απαντήσεων σε ερωτήματα που συνδέονταν με τρομοκρατική δραστηριότητα κυμάνθηκε μεταξύ 87% και 92%. Η διαφορά σε σχέση με τα τυπικά μοντέλα είναι ιδιαίτερα μεγάλη και δείχνει πόσο εύκολα μπορεί να αποδυναμωθεί η προστασία όταν ο έλεγχος περνά αποκλειστικά στα χέρια του χρήστη.

Η Tech Against Terrorism εστιάζει κυρίως στους κινδύνους που συνδέονται με τα μοντέλα ανοιχτών βαρών. Πρόκειται για μοντέλα των οποίων οι εσωτερικές παράμετροι, οι οποίες καθορίζονται κατά τη διαδικασία εκπαίδευσης, διατίθενται ελεύθερα. Αυτό επιτρέπει σε τρίτους να τα τροποποιήσουν, να τα επανεκπαιδεύσουν ή να αφαιρέσουν τους περιορισμούς που είχαν ενσωματώσει οι αρχικοί δημιουργοί τους.

Σύμφωνα με την οργάνωση, ο μέσος χρόνος που απαιτείται για την κατάργηση των δικλείδων ασφαλείας σε τέτοια μοντέλα είναι μικρότερος από τρεις ημέρες μετά την αρχική δημοσίευσή τους. Το γεγονός αυτό δημιουργεί ένα σημαντικό κενό εποπτείας, καθώς ένα μοντέλο μπορεί να κυκλοφορήσει αρχικά με προστατευτικούς μηχανισμούς, αλλά να μετατραπεί πολύ σύντομα σε εργαλείο που παρέχει επικίνδυνες πληροφορίες.

Η ανάγκη για ανεξάρτητους ελέγχους

Η πρωτοβουλία υποστηρίζει ότι κανένα μοντέλο που αποτυγχάνει σε ανεξάρτητο έλεγχο ασφάλειας δεν θα πρέπει να διατίθεται, να προσφέρεται ή να πωλείται. Παράλληλα, επισημαίνει ότι κάθε εταιρεία στην αλυσίδα διανομής —από τον δημιουργό και τον πάροχο μέχρι την πλατφόρμα φιλοξενίας— οφείλει να πραγματοποιεί προληπτικούς ελέγχους.

Η θέση αυτή θέτει στο επίκεντρο την ευθύνη όχι μόνο των εταιρειών που αναπτύσσουν τα μοντέλα, αλλά και όσων τα διαθέτουν ή τα καθιστούν προσβάσιμα στο κοινό. Οι έλεγχοι θα πρέπει να είναι συνεχείς, καθώς η ασφάλεια ενός μοντέλου μπορεί να αλλάξει μετά από ενημερώσεις, τροποποιήσεις ή επανεκπαίδευση.

Η έκθεση δείχνει ότι τα μέτρα προστασίας των μοντέλων ΑΙ έχουν σημειώσει πρόοδο, αλλά παραμένουν ευάλωτα σε παραπλανητικά αιτήματα και σε παρεμβάσεις τρίτων. Ιδιαίτερα τα μοντέλα ανοιχτών βαρών απαιτούν αυστηρότερη αξιολόγηση, σαφείς κανόνες διάθεσης και αποτελεσματικούς μηχανισμούς παρακολούθησης.

Συνολικά, τα ευρήματα υπογραμμίζουν ότι πολλά μοντέλα ΑΙ δεν διαθέτουν ακόμη επαρκείς δικλείδες ασφαλείας για την αντιμετώπιση κακόβουλων χρήσεων. Η ανάπτυξη ισχυρότερων τεχνικών περιορισμών, η διενέργεια ανεξάρτητων ελέγχων και η συνεργασία μεταξύ εταιρειών, κυβερνήσεων και διεθνών οργανισμών θεωρούνται απαραίτητες προϋποθέσεις, ώστε η τεχνητή νοημοσύνη να μην εξελιχθεί σε εργαλείο διευκόλυνσης τρομοκρατικών ενεργειών.

Δείτε επίσης

Τελευταία Άρθρα

Τα πιο Δημοφιλή