Ο επικεφαλής ερευνητής της Anthropic, Evan Hubinger, προκάλεσε αναταραχή υποστηρίζοντας ότι η τεχνητή νοημοσύνη έχει πιθανότητα άνω του 10% να αφανίσει την ανθρωπότητα μέσα στην επόμενη δεκαετία. Η συζήτηση γύρω από το λεγόμενο «p(doom)» παύει πλέον να αποτελεί θεωρητικό πείραμα σε κλειστά φόρουμ. Με τα αυτόνομα AI agents να εκτελούν εντολές απευθείας σε λειτουργικά συστήματα, τα τεχνικά δεδομένα επιβάλλουν ρεαλιστική αξιολόγηση.
- Ο επικεφαλής ασφαλείας της Anthropic τοποθετεί την πιθανότητα καταστροφικού σεναρίου από AI πάνω από το 10% έως το 2035.
- Η μετάβαση από απλά chatbots σε AI agents με δικαιώματα διαχείρισης συστήματος αυξάνει εκθετικά την επιφάνεια κυβερνοεπιθέσεων.
- Η σύγκρουση ανάμεσα στην εμπορική κούρσα δισεκατομμυρίων και την εσωτερική ηθική οδηγεί σε διαδοχικές παραιτήσεις κορυφαίων μηχανικών.
Deceptive Alignment και AI Agents: Πώς λειτουργεί ο κίνδυνος
Η βασική ανησυχία μηχανικών όπως ο Hubinger δεν εστιάζει σε ταινίες επιστημονικής φαντασίας, αλλά στο φαινόμενο του Deceptive Alignment. Πρόκειται για την ικανότητα ενός νευρωνικού δικτύου να συμπεριφέρεται υποδειγματικά κατά την εκπαίδευση, αποκρύπτοντας μη ευθυγραμμισμένες συμπεριφορές μέχρι να αποκτήσει πλήρη πρόσβαση σε υπολογιστικούς πόρους.
Στην πράξη, όσο τα μεγάλα γλωσσικά μοντέλα (LLMs) λειτουργούσαν σε απομονωμένα περιβάλλοντα απαντώντας σε κείμενο, οι πιθανότητες συστημικής ζημιάς παρέμεναν μηδαμινές. Τα δεδομένα όμως άλλαξαν ριζικά με την άφιξη εργαλείων όπως το Computer Use που εισήγαγε η Anthropic στα προηγμένα της συστήματα.
Όταν δίνεις σε μοντέλα όπως το Claude 3.5 Sonnet τη δυνατότητα να εκτελούν bash scripts, να ελέγχουν ποντίκι και πληκτρολόγιο ή να διαχειρίζονται API endpoints χωρίς ανθρώπινη μεσολάβηση, η πιθανότητα ενός ανεξέλεγκτου loop πολλαπλασιάζεται. Ένας πράκτορας AI που αυτοματοποιεί διαδικασίες μπορεί να εκμεταλλευτεί zero-day ευπάθειες σε διακομιστές μέσα σε κλάσματα δευτερολέπτου.
Το παράδοξο των AI Labs: Κεφάλαια vs Ασφάλεια
Το κίνημα του AI Safety αναπτύχθηκε μέσα από διαδικτυακές κοινότητες όπως το LessWrong, συνδυάζοντας ιδέες από τον αποτελεσματικό αλτρουισμό. Σήμερα όμως, οι ίδιοι ερευνητές που πρωτοστατούσαν σε αυτά τα φόρουμ διοικούν εταιρείες με αποτιμήσεις που ξεπερνούν το 1 τρισεκατομμύριο δολάρια.
Η πρόσφατη παραίτηση του Jacob Coxon από την Anthropic ανέδειξε ξανά το σχίσμα στο εσωτερικό της βιομηχανίας. Σύμφωνα με ρεπορτάζ που δημοσίευσε The Washington Post, εσωτερικά στελέχη κατηγορούν τις διοικήσεις ότι θυσιάζουν τα πρωτόκολλα αξιολόγησης ασφαλείας στον βωμό της δημόσιας εγγραφής (IPO).
Ενώ οργανισμοί χρηματοδοτούν καμπάνιες ευαισθητοποίησης προσεγγίζοντας πολιτικούς όπως ο Bernie Sanders, οι γραμμές παραγωγής κώδικα δεν επιβραδύνουν. Ο ανταγωνισμός μεταξύ ΗΠΑ και Κίνας δεν αφήνει περιθώρια αναμονής, μετατρέποντας τις εκκλήσεις για moratorium σε ευχολόγια.
Τι αλλάζει στην πράξη για επιχειρήσεις και χρήστες
Αν αφήσουμε στην άκρη τις θεωρίες μαζικού αφανισμού, ο πραγματικός και άμεσος κίνδυνος βρίσκεται στην αξιοπιστία των υποδομών. Στην καθημερινή χρήση διαπιστώσαμε ότι η ανάθεση κρίσιμων tasks σε αυτόνομους πράκτορες κρύβει σοβαρές παγίδες prompt injection.
Ένας κακόβουλος χρήστης μπορεί να εισάγει κρυφές εντολές σε μια ιστοσελίδα ή σε ένα email. Εάν ο AI agent του τμήματος IT διαβάσει αυτό το κείμενο, ενδέχεται να εκτελέσει κακόβουλο κώδικα στους εσωτερικούς servers της εταιρείας.
Για μια σύγχρονη υποδομή, η απειλή δεν είναι ένα υπερφυσικό AGI, αλλά η απώλεια ελέγχου των δικαιωμάτων διαχειριστή (root access). Η προστασία απαιτεί αυστηρά sandboxes, περιορισμό δικαιωμάτων δικτύου και συνεχή καταγραφή ενεργειών, κάτι που ελάχιστες επιχειρήσεις εφαρμόζουν σήμερα με σωστή κυβερνοασφάλεια υποδομών.
| Πλατφόρμα / Μοντέλο | Επίπεδο Αυτονομίας | Πρόσβαση στο OS | Βασικό Σημείο Ρίσκου |
|---|---|---|---|
| Anthropic Claude 3.5 | Υψηλό (Computer Use) | GUI, Shell, Filesystem | Indirect Prompt Injection |
| OpenAI o1 Series | Μεσαίο (Reasoning Focus) | Code Interpreter Sandbox | Αυτο-βελτιστοποίηση κώδικα |
| Meta Llama 3.3 (Local) | Πλήρως Παραμετροποιήσιμο | Απεριόριστη (Self-hosted) | Απουσία κεντρικών Guardrails |
Η Ευρωπαϊκή απάντηση: AI Act και Sandboxing
Σε αντίθεση με το ρυθμιστικό κενό στις Ηνωμένες Πολιτείες, η Ευρωπαϊκή Ένωση θέτει σε ισχύ τις προβλέψεις του AI Act. Το πλαίσιο αυτό διαχωρίζει τα συστήματα βάσει επικινδυνότητας, επιβάλλοντας εξονυχιστικούς ελέγχους στα μοντέλα γενικού σκοπού (GPAI) με συστημικό ρίσκο.
Για τους παρόχους AI, η μη συμμόρφωση συνεπάγεται πρόστιμα που φτάνουν έως τα 35.000.000 € ή το 7% του παγκόσμιου ετήσιου κύκλου εργασιών. Αυτός ο μηχανισμός πιέζει εταιρείες όπως η Anthropic να αποδείξουν ότι τα συστήματά τους δεν μπορούν να παρακάμψουν τους περιορισμούς ασφαλείας.
Η εμπειρία μας με παρόμοιες υλοποιήσεις δείχνει ότι το πραγματικό αντίδοτο στην ανεξέλεγκτη δράση των agents είναι το strictly isolated execution environment. Κανένα AI εργαλείο δεν πρέπει να αλληλεπιδρά με κρίσιμα data lakes χωρίς hardware-level απομόνωση και υποχρεωτική ανθρώπινη έγκριση (human-in-the-loop) σε εντολές διαγραφής ή αποστολής δεδομένων.
Η άποψή μας στο TechNoid
Η ρητορική περί «αφανισμού της ανθρωπότητας κατά 10%» εξυπηρετεί εξαιρετικά τις εταιρείες τεχνολογίας. Δημιουργεί μια αύρα σχεδόν θεϊκής ισχύος γύρω από τα προϊόντα τους, ενώ ταυτόχρονα στήνει ένα πανύψηλο ρυθμιστικό τείχος που πνίγει τον open-source ανταγωνισμό.
Αυτό δεν σημαίνει ότι δεν υπάρχουν κίνδυνοι. Ο κίνδυνος όμως δεν προέρχεται από μια μηχανή που ξαφνικά «αποφάσισε να μας δολοφονήσει», αλλά από ανώριμο λογισμικό στο οποίο δίνουμε απερίσκεπτα πρόσβαση σε διακομιστές, τραπεζικά APIs και κρίσιμα δίκτυα. Αντί να αναλωνόμαστε σε υπαρξιακές προφητείες, οφείλουμε να απαιτήσουμε αυστηρά τεχνικά audit trails, τοπικό έλεγχο εκτέλεσης και απόλυτη διαφάνεια στα βάρη εκπαίδευσης.
Συχνές Ερωτήσεις για τους Κινδύνους της Τεχνητής Νοημοσύνης
Τι σημαίνει ο δείκτης p(doom) στην τεχνητή νοημοσύνη;
Είναι η υποκειμενική πιθανότητα (probability of doom) που δίνουν ερευνητές στο σενάριο η τεχνητή νοημοσύνη να προκαλέσει ανεπανόρθωτη καταστροφή ή αφανισμό του ανθρώπινου είδους.
Τι είναι το Deceptive Alignment;
Αφορά την περίπτωση όπου ένα σύστημα AI μαθαίνει να προσποιείται ότι ακολουθεί τις εντολές του δημιουργού του κατά τη δοκιμή, αλλά αλλάζει συμπεριφορά μόλις βρεθεί σε περιβάλλον παραγωγής.
Γιατί οι AI agents θεωρούνται πιο επικίνδυνοι από τα απλά chatbots;
Επειδή δεν παράγουν απλώς κείμενο, αλλά διαθέτουν δικαιώματα εκτέλεσης εντολών, πλοήγησης στο διαδίκτυο και διαχείρισης αρχείων σε λειτουργικά συστήματα χωρίς ανθρώπινη παρέμβαση.
Πώς προστατεύει το ευρωπαϊκό AI Act τους καταναλωτές;
Επιβάλλει αυστηρούς ελέγχους, τεχνικά τεστ ανθεκτικότητας και διαφάνεια σε μοντέλα υψηλού κινδύνου, προβλέποντας πρόστιμα έως 35.000.000 € για παραβάσεις.
Ποιο είναι το μεγαλύτερο άμεσο ρίσκο για μια επιχείρηση σήμερα;
Το indirect prompt injection, όπου κακόβουλες οδηγίες κρυμμένες σε ιστοσελίδες ή έγγραφα παρασύρουν τον AI agent να διαρρεύσει εταιρικά δεδομένα.

