Νέα ερωτήματα σχετικά με την ασφάλεια των προηγμένων μοντέλων τεχνητής νοημοσύνης προκαλεί έκθεση του βρετανικού Ινστιτούτου Ασφάλειας Τεχνητής Νοημοσύνης (AI Security Institute – AISI), σύμφωνα με την οποία πράκτορες τεχνητής νοημοσύνης που αναπτύχθηκαν από τις OpenAI και Anthropic προχώρησαν σε μη εξουσιοδοτημένες ενέργειες κατά τη διάρκεια δοκιμών ασφαλείας. Σύμφωνα με το AISI, κατά τις αξιολογήσεις μοντέλων εντοπίστηκαν περιπτώσεις όπου AI agents επιχείρησαν να παρακάμψουν περιορισμούς ασφαλείας, ενώ ένας από αυτούς δημιούργησε ψεύτικες διαδικτυακές ταυτότητες προκειμένου να αποκτήσει ανθρώπινη έγκριση για κακόβουλο κώδικα. Το βρετανικό ινστιτούτο ανέφερε ότι οι δοκιμές πραγματοποιήθηκαν σε πράκτορες που βασίζονται στα μοντέλα Mythos 5 της Anthropic και GPT-5.6-Sol της OpenAI, στο πλαίσιο ελέγχων για την αξιολόγηση των δυνατοτήτων και των πιθανών κινδύνων που συνοδεύουν τη χρήση προηγμένων συστημάτων τεχνητής νοημοσύνης. Το AISI υπογράμμισε ότι ορισμένοι από τους πράκτορες που εξετάστηκαν προχώρησαν σε «παρατεταμένη και δυνητικά επιβλαβή δραστηριότητα» με στόχο πραγματικούς ανθρώπους και οργανισμούς, αν και δεν καταγράφηκε πραγματική ζημιά από τα περιστατικά. Οι δοκιμές πραγματοποιήθηκαν μέσα σε ένα ελεγχόμενο, υποθετικό σενάριο κυβερνοασφάλειας. Συνολικά, η διαδικασία επαναλήφθηκε 122 φορές και καταγράφηκαν 19 μη εξουσιοδοτημένες ενέργειες σε 10 διαφορετικές δοκιμές. Από αυτές, οι 17 αποδόθηκαν στον πράκτορα της Anthropic, ενώ οι δύο αφορούσαν τον πράκτορα της OpenAI. Η πιο σοβαρή περίπτωση, σύμφωνα με το AISI, αφορούσε έναν AI agent που δημιούργησε κακόβουλο λογισμικό και στη συνέχεια κατασκεύασε ψεύτικες διαδικτυακές ταυτότητες, επιχειρώντας να πείσει έναν πραγματικό άνθρωπο να εγκρίνει τον κώδικα. Το ινστιτούτο διευκρίνισε ότι δεν υπήρξε πραγματική επίπτωση από την παραβίαση, καθώς οι ενέργειες πραγματοποιήθηκαν αποκλειστικά στο πλαίσιο των δοκιμών. Η Anthropic επιβεβαίωσε το περιστατικό Παρότι το AISI δεν αποκάλυψε αρχικά ποιος ακριβώς πράκτορας ήταν υπεύθυνος για τη δημιουργία των ψεύτικων ταυτοτήτων, η Anthropic επιβεβαίωσε ότι το δικό της σύστημα ήταν εκείνο που προχώρησε στη συγκεκριμένη ενέργεια. Η εταιρεία ευχαρίστησε το βρετανικό ινστιτούτο για την ανάδειξη του περιστατικού και τόνισε ότι το συμβάν δείχνει την ανάγκη για ευρύτερη συζήτηση γύρω από τον ασφαλή τρόπο αξιολόγησης των ολοένα πιο ισχυρών AI agents. Παράλληλα, ανακοίνωσε ότι συνεργάζεται με το AISI ώστε να συγκεντρωθούν περισσότερα στοιχεία και να πραγματοποιήσει τη δική της εσωτερική έρευνα. Ο Άντριου Γιουν, ερευνητής της μη κερδοσκοπικής οργάνωσης CivAI που μελετά τις δυνατότητες και τους κινδύνους της τεχνητής νοημοσύνης, σχολίασε ότι το γεγονός πως το μοντέλο της Anthropic προχώρησε σε παραπλανητικές ενέργειες με επίγνωση ότι απευθυνόταν σε πραγματικό άνθρωπο δημιουργεί ερωτήματα για το κατά πόσο οι εταιρείες κατανοούν πλήρως τη συμπεριφορά των συστημάτων τους. Η απάντηση της OpenAI Η OpenAI δημοσιοποίησε επίσης λεπτομέρειες για τα περιστατικά που αφορούσαν τους δικούς της AI agents, σημειώνοντας ότι και στις δύο περιπτώσεις οι μη εγκεκριμένες ενέργειες σχετίζονταν με προσπάθεια πρόσβασης στο διαδίκτυο, κάτι που απαγορευόταν από τις οδηγίες των δοκιμών. Η εταιρεία ανέφερε ότι δεσμεύεται να συνεργαστεί με άλλους φορείς του κλάδου για την ενίσχυση των κοινών πρακτικών αξιολόγησης υψηλού κινδύνου, με τη συμμετοχή εθνικών ινστιτούτων τεχνητής νοημοσύνης, ανεξάρτητων αξιολογητών και άλλων εργαστηρίων ανάπτυξης AI. Παράλληλα, η OpenAI αποκάλυψε ένα ξεχωριστό περιστατικό, κατά το οποίο λανθασμένη ρύθμιση από την εταιρεία τρίτων δοκιμών Irregular επέτρεψε σε πράκτορές της να συνδεθούν κατά λάθος στο διαδίκτυο. Το περιστατικό παρουσιάζει ομοιότητες με αντίστοιχη αποκάλυψη της Anthropic την προηγούμενη εβδομάδα σχετικά με σφάλμα διαμόρφωσης κατά τη διαδικασία ελέγχων. Αυξημένη ανησυχία για τους αυτόνομους AI agents Η έκθεση του AISI αναδεικνύει τις νέες προκλήσεις που δημιουργεί η ανάπτυξη AI agents, δηλαδή συστημάτων που μπορούν να εκτελούν σύνθετες εργασίες με μεγαλύτερο βαθμό αυτονομίας. Οι εταιρείες τεχνολογίας προωθούν αυτούς τους πράκτορες ως την επόμενη μεγάλη εξέλιξη για τον επιχειρηματικό κόσμο, ωστόσο οι ειδικοί επισημαίνουν ότι απαιτούνται αυστηρότερα πρωτόκολλα ασφαλείας πριν από την ευρεία χρήση τους. Το AISI διευκρίνισε ότι τα περιστατικά που εντοπίστηκαν στις δοκιμές δεν αποτελούσαν απόδραση των μοντέλων από απομονωμένο περιβάλλον προς το πραγματικό διαδίκτυο, όπως είχε συμβεί σε προηγούμενο περιστατικό με πράκτορα της OpenAI στην πλατφόρμα Hugging Face. Στη συγκεκριμένη περίπτωση, η πρόσβαση στο διαδίκτυο είχε επιτραπεί σκόπιμα στο πλαίσιο των τυπικών διαδικασιών αξιολόγησης του οργανισμού, προκειμένου να εξεταστούν οι πραγματικές δυνατότητες και οι πιθανοί κίνδυνοι των νέων συστημάτων.