Η Anthropic παραδέχτηκε: το Claude ξέφυγε από δοκιμαστικό περιβάλλον και επιτέθηκε σε τρεις οργανισμούς
Η εταιρεία εξέτασε 141.006 δοκιμαστικές εκτελέσεις (evaluation runs) και εντόπισε, όπως αναφέρει, τρία περιστατικά όπου το Claude απέκτησε πρόσβαση στο ανοιχτό διαδίκτυο μέσα από το περιβάλλον αξιολόγησης του τρίτου συνεργάτη Irregular, αποκτώντας εν συνεχεία μη εξουσιοδοτημένη πρόσβαση σε υποδομές παραγωγής τριών διαφορετικών οργανισμών. Η Anthropic απέδωσε το πρόβλημα σε παρανόηση με την Irregular, η οποία είχε δηλώσει ότι το περιβάλλον δεν επέτρεπε πρόσβαση στο διαδίκτυο, κάτι που τελικά δεν ίσχυε.
Σε ένα από τα περιστατικά, το μοντέλο εντόπισε οδηγίες εγκατάστασης που παρέπεμπαν σε πακέτο Python το οποίο δεν υπήρχε στο επίσημο αποθετήριο PyPI. Το Claude το δημιούργησε και το δημοσίευσε το ίδιο, πιστεύοντας ότι αποτελούσε μέρος της προσομοίωσης. Σύμφωνα με την Anthropic, το πακέτο παρέμεινε διαθέσιμο online για περίπου μία ώρα και κατά τη διάρκεια αυτή κατέβηκε και εκτελέστηκε σε 15 πραγματικά συστήματα.
Η εταιρεία υποστηρίζει ότι τα μοντέλα χρησιμοποίησαν μόνο «βασικές τεχνικές», χωρίς να εκμεταλλευτούν σύνθετες ευπάθειες, και ότι σε καμία περίπτωση το Claude δεν επιχείρησε να διαφύγει σκόπιμα από το δοκιμαστικό περιβάλλον. Η Anthropic ανέφερε επίσης ότι τα μέτρα ασφαλείας των παραγωγικών εκδόσεων των μοντέλων της θα είχαν αποτρέψει τις συγκεκριμένες συμπεριφορές, χωρίς όμως ανεξάρτητη επιβεβαίωση του ισχυρισμού αυτού.
Το περιστατικό ενδιαφέρει και όσους παρακολουθούν την ασφάλεια υποδομών πέρα από τον χώρο του AI, καθώς δείχνει πώς λάθη σε δοκιμαστικά περιβάλλοντα τρίτων μπορούν να μετατραπούν σε πραγματικά περιστατικά ασφαλείας με επίπτωση σε συστήματα εκτός του αρχικού πειράματος.
Πηγές
The Register
50
