Πώς το SynthID του Claude αλλάζει τους κανόνες
Η Anthropic ενσωματώνει αόρατο watermarking στα κείμενα του Claude, συμμορφώνοντας ολόκληρη τη γεννήτρια με το νέο ευρωπαϊκό ρυθμιστικό πλαίσιο, γνωστό ως EU AI Act. Σε αντίθεση με όσα φαντάζεσαι για τα ψηφιακά υδατογραφήματα, δεν μιλάμε για κρυφούς χαρακτήρες ή Unicode κόλπα που χαλάνε το copy σου. Η τεχνολογία βασίζεται στο Google DeepMind SynthID-Text και επεμβαίνει απευθείας στον αλγόριθμο τυχαιότητας (token sampling) την ώρα ακριβώς που παράγεται το κείμενο.
- Το υδατογράφημα της Anthropic είναι απολύτως αόρατο στον τελικό αναγνώστη και δεν αλλοιώνει τη ροή ή το ύφος του Claude.
- Εφαρμόζεται παγκοσμίως από την Anthropic, καθώς δεν υπάρχει τεχνικά αξιόπιστος τρόπος γεωγραφικού περιορισμού κατά την παραγωγή.
- Κώδικας και αυστηρά τεχνικά δεδομένα μένουν ανέπαφα, καθώς το σύστημα δεν μπορεί να αλλοιώσει απαντήσεις με μονόδρομη λογική.
Ο μηχανισμός SynthID πίσω από το Claude
Όταν το Claude επιλέγει ποια λέξη θα έξει στην πρόταση, βασίζεται σε πιθανότητες. Κανονικά, η διαδικασία επιστρατεύει μια τυ γεννήτρια αριθμών. Με το SynthID, η γεννήτρια αυτή αντικαθίσταται από ένα κρυπτογραφικό κλειδί και τις προηγούμενες λέξεις της πρότασης, δημιουργώντας μια στατιστική υπογραφή.
Όπως εξήγησε η εταιρεία στο επίσημο blog post της Anthropic, η επιλογή παραμένει τυχαία αλλά υπακούει σε ένα κρυφό μοτίβο. Αν έχεις το σωστό κλειδί αποκωδικοποίησης, μπορείς να διαπιστώσεις μαθηματικά αν το κείμενο προέρχεται από το Claude. Αν όμως κάνεις ολική επανεγγραφή ή αλλάξεις τη συντριπτική πλειοψηφία των λέξεων, το ίχνος χάνεται οριστικά.
Πρακτικά σενάρια και περιορισμοί στην πράξη
Αν είσαι developer ή διαχειρίζεσαι τεχνικό documentation, έχεις έναν σοβαρό λόγο να μην ανησυχείς. Σύμφωνα με την Anthropic, ο αλγόριθμος δεν εφαρμόζεται σε περιπτώσεις όπου υπάρχει μόνο μία σωστή απάντηση, όπως στα μαθηματικά ή στον πηγαίο κώδικα.
Αν ο αλγόριθμος προσπαθούσε να βάλει “nudge” σε μια γραμμή κώδικα Python ή C++, το αποτέλεσμα θα ήταν σπασμένα προγράμματα και syntax errors. Αντίθετα, στα generative κείμενα μάρκετινγκ ή στα μεταφρασμένα άρθρα όπου το λεξιλόγιο έχει τεράστια ποικιλία (υψηλή εντροπία), το watermark αποτυπώνεται άψογα και ανιχνεύεται εύκολα από τα ειδικά εργαλεία πιστοποίησης.
Το API ανίχνευσης και τα κενά ασφαλείας
Η ανακοίνωση περιλαμβάνει τη δημιουργία ενός ειδικού API ανίχνευσης που θα υπολογίζει την πιθανότητα ανάμειξης του Claude. Εδώ όμως εμφανίζονται τα σοβαρότερα νομικά και τεχνικά ζητήματα που συζητούνται ευρέως σε fora ασφαλείας όπως το BleepingComputer. Ένα watermark δεν αποδεικνύει ποιος πάτησε το κουμπί της δημοσίευσης, αλλά μόνο ότι το εργαλείο συμμετείχε στη σύνταξη.
Αν ένας χρήστης πάρει την απάντηση του Claude και την περάσει από ελαφρύ proofreading, το ίχνος παραμένει ανιχνεύσιμο. Αν όμως γίνει εκτεταμένη ανθρώπινη επιμέλεια, τα δεδομένα εξανεμίζονται. Στα αρχεία εικόνας PNG ή SVG, η εταιρεία ακολουθεί διαφορετική οδό, ενσωματώνοντας metadata C2PA αντί για αλγοριθμικές παρεμβάσεις στα pixels.
Ο παράγοντας χαμηλής εντροπίας που αγνοούν οι άλλοι
Τα περισσότερα τεχνολογικά sites αναπαράγουν απλώς το δελτίο Τύπου της εταιρείας, παραλείποντας την κρίσιμη λεπτομέρεια της εντροπίας (entropy). Όταν το μοντέλο καλείται να γράψει σε ένα αυστηρά δομημένο πλαίσιο με περιορισμένο λεξιλόγιο, η στατισρευνα τυχαιότητας μηδενίζεται. Αυτό σημαίνει ότι τα μικρά σε έκταση κείμενα ή οι τυπικές απαντήσεις “ναι/όχι” είναι πρακτικά αδύνατο να υδατογραφηθούν με ασφάλεια.
Αν θες να ελέγξεις την αξιοπιστία ενός κειμένου, το API της Anthropic θα αποτύχει σε σώματα κάτω των μερικών εκατοντάδων λέξεων. Η πραγματική αξία του SynthID αναδεικνύεται μόνο σε εκτενλή δοκίμια, όπου το δείγμα των tokens επαρκεί για να βγει ασφαλές στατιστικό συμπέρασμα.
Η άποψή μας στο TechNoid
Στο TechNoid πιστεύουμε ότι το watermarking κειμένου είναι ένα αναγκαίο κακό για να ικανοποιηθούν οι γραφειοκράτες των Βρυξελλών, αλλά η πρακτική του αξία είναι εξαιρετικά περιορισμένη. Η ίδια η φύση των LLMs καθιστά τα υδατογραφήματα ευάλωτα σε απλές επεμβάσεις, όπως μια μαζική αντικατάσταση συνωνύμων μέσω ενός άλλου script. Η Anthropic κάνει σωστά που προστατεύει τον κώδικα από αλλοιώσεις, αλλά η αυταπάτη ότι τα σχολεία, οι πανεπιστημιακοί ή οι εργοδότες θα σταματήσουν το AI plagiarism με ένα μαθηματικό κλειδί είναι καταδικασμένη να αποτύχει. Οι λύσεις βρίσκονται στη μεθοδολογία αξιολόγησης και όχι σε αόρατα ψηφιακά φαντάσματα.
Συχνές Ερωτήσεις για το AI Watermarking του Claude
Φαίνεται το υδατογράφημα του Claude στον απλό αναγνώστη;
Όχι, το SynthID-Text λειτουργεί στο επίπεδο επιλογής λέξεων και παραμένει εντελώς αόρατο στο μάτι.
Επηρεάζει το watermark την ποιότητα ή τη δημιουργικότητα του κειμένου;
Σύμφωνα με τις δοκιμές της Anthropic, δεν υπάρχει καμία αρνητική επίπτωση στην ταχύτητα, το κόστος ή την αναγνωσιμότητα.
Εφαρμόζεται το υδατογράφημα στον κώδικα προγραμματισμού;
Όχι, εξαιρούνται τα σημεία όπου απαιτείται απόλυτη ακρίβεια, όπως ο κώδικας, για να αποφευχθούν σφάλματα εκτέλεσης.
Μπορεί το watermark να εντοπιστεί αν κάποιος κάνει editing στο κείμενο;
Μια ελαφριά διόρθωση δεν αρκεί για να το διαγράψει, αλλά μια ολική επανεγγραφής κάθε λέξης το εξαφανίζει.
Πώς θα γίνεται η ανίχνευση από τρίτους;
Η Anthropic σχεδιάζει να διαθέσει ένα ειδικό API ανίχνευσης για τον υπολογισμό πιθανοτήτων.
Ποια τεχνολογία χρησιμοποιεί η Anthropic για το σύστημα;
Βασίζεται στον αλγόριθμο SynthID-Text που ανέπτυξε αρχικά το τμήμα Google DeepMind.
Ισχύει το υδατογράφημα μόνο για χρήστες στην Ευρωπαϊκή Ένωση;
Όχι, εφαρμόζεται παγκοσμίως σε όλα τα νέα μοντέλα Claude λόγω αδυναμίας γεωγραφικού διαχωρισμού στην παραγωγή.

