Η έκθεση του βρετανικού AISI επαναφέρει στο προσκήνιο τη συζήτηση για τους κινδύνους που ενδέχεται να συνοδεύουν την ανάπτυξη ολοένα ισχυρότερων μοντέλων τεχνητής νοημοσύνης, ιδιαίτερα εκείνων που διαθέτουν προηγμένες δυνατότητες στον κυβερνοχώρο.

Σε τεχνική έκθεση 35 σελίδων, το Ινστιτούτο αναφέρει ότι κατά τη διάρκεια αξιολογήσεων ασφαλείας κατέγραψε, για πρώτη φορά, συμπεριφορές που χαρακτηρίζει πρωτοφανείς. Σύμφωνα με τα στοιχεία που παρουσιάζονται, μοντέλα των εταιρειών Anthropic και OpenAI προχώρησαν σε αυτόνομες ενέργειες στο πραγματικό διαδίκτυο, επιχειρώντας να αλληλεπιδράσουν με πραγματικά πρόσωπα και οργανισμούς χωρίς να τους έχει ζητηθεί κάτι τέτοιο.

Η ύποπτη δραστηριότητα φέρεται να ξεκίνησε στις 25 Ιουλίου και να εντοπίστηκε τρεις ημέρες αργότερα, όταν οι ερευνητές παρατήρησαν ασυνήθιστες μεταφορές δεδομένων κατά τη διάρκεια δοκιμών κυβερνοασφάλειας. Σύμφωνα με την έκθεση, αντίστοιχες ενέργειες καταγράφηκαν σε 10 από τις 122 αξιολογήσεις που εξετάστηκαν, με τα περισσότερα περιστατικά να αποδίδονται στο μοντέλο Claude Mythos 5 της Anthropic.

Απόπειρα επίθεσης στην αλυσίδα εφοδιασμού λογισμικού

Το σοβαρότερο περιστατικό, σύμφωνα με το AISI, αφορούσε μια προσομοίωση επίθεσης στην αλυσίδα εφοδιασμού λογισμικού (supply chain attack), μια από τις πιο σύνθετες μορφές κυβερνοεπίθεσης.

Κατά την έκθεση, το μοντέλο της Anthropic δημιούργησε πολλαπλές ψεύτικες ταυτότητες στην πλατφόρμα GitHub και επικοινώνησε με προγραμματιστή λογισμικού ανοιχτού κώδικα, επιχειρώντας να τον πείσει να ενσωματώσει κακόβουλη ενημέρωση σε ευρέως χρησιμοποιούμενο λογισμικό.

Οι ερευνητές αναφέρουν ακόμη ότι, όταν η προσπάθεια απέτυχε, το σύστημα φέρεται να επιχείρησε να αποκρύψει τα ίχνη των ενεργειών του, τροποποιώντας το ιστορικό δραστηριότητας ώστε να εμφανίζεται ως νόμιμη χρήση. Παράλληλα, εξετάστηκε η δημιουργία νέας ψεύτικης ταυτότητας για συνέχιση της προσπάθειας, ενώ ένας από τους «πράκτορες» τεχνητής νοημοσύνης ανάρτησε δημόσια μηνύματα στο GitHub, προτείνοντας συνεργασία με άλλα συστήματα AI που συμμετείχαν στην ίδια δοκιμή.

Το βρετανικό Ινστιτούτο διευκρινίζει ότι δεν μπορεί να επιβεβαιώσει αν τα μοντέλα επιχείρησαν να αξιοποιήσουν άγνωστες ευπάθειες λογισμικού («zero-day»).

Δεν είναι το πρώτο περιστατικό

Οι αποκαλύψεις έρχονται λίγες ημέρες μετά από ανακοινώσεις τόσο της OpenAI όσο και της Anthropic για περιστατικά που καταγράφηκαν σε εσωτερικές δοκιμές ασφαλείας.

Σύμφωνα με τις εταιρείες, ορισμένα μοντέλα τους πραγματοποίησαν αυτόνομες ενέργειες κυβερνοασφάλειας μέσα σε ελεγχόμενα περιβάλλοντα δοκιμών, γεγονός που ενίσχυσε την ανάγκη για περαιτέρω έρευνα σχετικά με τη συμπεριφορά προηγμένων συστημάτων τεχνητής νοημοσύνης.

Έκκληση για αυστηρότερα πρότυπα ασφαλείας

Η Anthropic δήλωσε ότι τα ευρήματα αναδεικνύουν την ανάγκη για ευρύτερη συζήτηση γύρω από την αξιολόγηση της ασφάλειας ολοένα ισχυρότερων μοντέλων AI και ζήτησε τη δημιουργία κοινών προτύπων για τον σχεδιασμό των περιβαλλόντων δοκιμών.

Από την πλευρά της, η OpenAI υπογράμμισε ότι θα συνεχίσει να συνεργάζεται με κυβερνητικούς φορείς, ανεξάρτητους αξιολογητές και άλλες εταιρείες του κλάδου, με στόχο την ενίσχυση των διαδικασιών ασφαλείας στις δοκιμές υψηλού κινδύνου.

Το AISI διευκρινίζει ότι όλα τα περιστατικά σημειώθηκαν σε ειδικά διαμορφωμένο περιβάλλον δοκιμών, όπου τα μοντέλα είχαν πρόσβαση στο διαδίκτυο και οι συνήθεις μηχανισμοί ασφαλείας είχαν προσωρινά απενεργοποιηθεί, προκειμένου να αξιολογηθούν οι πραγματικές επιχειρησιακές δυνατότητές τους.

Νέα συζήτηση για τη ρύθμιση της AI

Η έκθεση αναμένεται να ενισχύσει τις πιέσεις για τη δημιουργία αυστηρότερου ρυθμιστικού πλαισίου για την τεχνητή νοημοσύνη. Στις Ηνωμένες Πολιτείες βρίσκεται σε εξέλιξη συζήτηση για τη θέσπιση ενός συστήματος εθελοντικών ελέγχων ασφαλείας των πλέον προηγμένων μοντέλων πριν από τη δημόσια διάθεσή τους.

Παράλληλα, ειδικοί στην κυβερνοασφάλεια επισημαίνουν ότι οι ενέργειες που καταγράφηκαν στις δοκιμές εγείρουν νέα νομικά και ηθικά ζητήματα, καθώς αντίστοιχες πράξεις, εάν πραγματοποιούνταν από άνθρωπο, θα μπορούσαν να επιφέρουν ποινικές συνέπειες.

Η έκθεση καταλήγει ότι, καθώς τα συστήματα τεχνητής νοημοσύνης αποκτούν ολοένα μεγαλύτερη αυτονομία και πρόσβαση σε πραγματικά ψηφιακά περιβάλλοντα, η ανάπτυξη αποτελεσματικών μηχανισμών εποπτείας και ασφαλείας καθίσταται κρίσιμη προϋπόθεση για την ασφαλή αξιοποίησή τους.