Το Kimi K3, ένα από τα ισχυρότερα AI models της κινεζικής Moonshot, κατάφερε να «δραπετεύσει» από το απομονωμένο περιβάλλον στο οποίο δοκιμαζόταν από το UK AI Security Institute (AISI), προκαλώντας νέο προβληματισμό για την ασφάλεια των σύγχρονων AI agents.
Το περιστατικό αποκαλύφθηκε από την αμερικανική εταιρεία κυβερνοασφάλειας Frontier, η οποία συμμετείχε στην αξιολόγηση των δυνατοτήτων του Kimi K3 στον τομέα της κυβερνοασφάλειας. Σύμφωνα με την εταιρεία, το μοντέλο δεν εκμεταλλεύτηκε κάποια zero-day ευπάθεια, αλλά αξιοποίησε μια λανθασμένη ρύθμιση στο sandbox του περιβάλλοντος δοκιμών. Το ενδιαφέρον στοιχείο είναι ότι το Kimi K3 δεν επιτέθηκε σε κάποιο τρίτο website ή υπηρεσία. Αντίθετα, κατάφερε να αποκτήσει πρόσβαση στο Internet και να χρησιμοποιήσει το GitHub για να βρει τη λύση στο πρόβλημα που του είχε ανατεθεί. Με άλλα λόγια, δεν χρειάστηκε να «χακάρει» κάτι για να ξεφύγει από το περιβάλλον του, απλώς εντόπισε μια διαθέσιμη διαδρομή προς το Internet και την αξιοποίησε. Σύμφωνα με τον CEO της Frontier Security, Yaron Singer, το περιστατικό δείχνει ότι το Kimi K3 δεν διέθετε επαρκείς εσωτερικούς περιορισμούς ώστε να αποτρέψει μια τέτοια συμπεριφορά. Το μοντέλο φαίνεται πως αναζήτησε τον ευκολότερο τρόπο για να ολοκληρώσει την αποστολή του, αντί να ακολουθήσει αποκλειστικά τη διαδικασία που είχαν προβλέψει οι ερευνητές.

Το περιστατικό θυμίζει αντίστοιχα συμβάντα που έχουν καταγραφεί κατά τις δοκιμές μοντέλων των OpenAI, Anthropic και Meta, όπου AI agents κατάφεραν επίσης να ξεφύγουν από απομονωμένα περιβάλλοντα εξαιτίας προβλημάτων στην υποδομή των δοκιμών. Η Frontier υπογραμμίζει ότι το συμπέρασμα είναι ιδιαίτερα σημαντικό: αν ένα αρκετά ισχυρό AI agent έχει πρόσβαση στο Internet, είναι πιθανό να βρει τρόπο να την αξιοποιήσει. Καθώς τα μοντέλα γίνονται ολοένα πιο ικανά, οι ερευνητές θα χρειαστεί να δημιουργούν πολύ αυστηρότερα και πραγματικά απομονωμένα περιβάλλοντα δοκιμών, χωρίς «παραθυράκια» που μπορούν να εκμεταλλευτούν.



