ChatGPT: Υδατογράφημα στην Ευρώπη – Τα όρια του textGrain

Η OpenAI ξεκίνησε την αθόρυβη ενσωμάτωση του textGrain, ενός αόρατου στατιστικού υδατογραφήματος στις απαντήσεις των ChatGPT και Codex αποκλειστικά για τους χρήστες στην Ευρωπαϊκή Ένωση. Η κίνηση αυτή στοχεύει στη συμμόρφωση με τις απαιτήσεις διαφάνειας του ευρωπαϊκού AI Act. Στην πράξη όμως, η τεχνολογία αυτή αποδεικνύεται εξαιρετικά ευάλωτη στην ανθρώπινη παρέμβαση.

✂️ Σύνοψη άρθρου

  • Η OpenAI ενεργοποιεί το textGrain στην ΕΕ, ενσωματώνοντας ένα στατιστικό σήμα επιλογής λέξεων χωρίς ορατή αλλοίωση στην ποιότητα του κειμένου.
  • Η ανίχνευση καταρρέει αν αλλάξεις μόλις το 10% έως 25% των λέξεων με συνώνυμα ή αν το κείμενο πέσει κάτω από τα 200 tokens.
  • Το εργαλείο ελέγχου παραμένει κλειδωμένο για το ευρύ κοινό και διατίθεται μόνο σε επιλεγμένους ερευνητές για την αποφυγή ψευδών κατηγοριών λογοκλοπής.

Πώς λειτουργεί το textGrain στο ChatGPT

Κάθε φορά που ένα γλωσσικό μοντέλο παράγει κείμενο, υπολογίζει τις πιθανότητες για το επόμενο token (λέξη ή συλλαβή). Το textGrain παρεμβαίνει ανεπαίσθητα σε αυτή τη μαθηματική διανομή. Ευνοεί συγκεκριμένες υπο-ομάδες λέξεων, δημιουργώντας ένα κρυφό μαθηματικό μοτίβο που παραμένει αόρατο στο ανθρώπινο μάτι.

Σύμφωνα με τα επίσημα στοιχεία στην τεχνική αναφορά της OpenAI, η διαδικασία δεν ρίχνει την ποιότητα της απάντησης. Σε συνθετικά benchmarks όπως το GPQA Diamond, η απόκλιση μεταξύ υδατογραφημένου και καθαρού κειμένου έμεινε κάτω από 0,5%. Στις δοκιμές μας με σύνθετες τεχνικές αναλύσεις, η ροή του λόγου διατηρείται ακριβώς όπως την περιμένεις.

Ενώ στην Ευρώπη το μέτρο γίνεται υποχρεωτικό για όλους τους web χρήστες, οι επιχειρήσεις που αξιοποιούν το API παγκοσμίως διατηρούν δικαίωμα επιλογής (opt-in). Μπορούν δηλαδή να αποφασίσουν μόνες τους αν θα ενεργοποιήσουν τη σήμανση στα δικά τους συστήματα.

Γιατί καταρρέει το watermarking στην πράξη

Η θεωρία απέχει σημαντικά από την πραγματικότητα. Το textGrain απαιτεί ικανό όγκο λέξεων και υψηλή λεξιλογική ελευθερία για να αποδώσει αξιόπιστα αποτελέσματα. Αν του ζητήσεις να αναλύσει ένα κείμενο ψυχολογίας 400 λέξεων, η ακρίβεια αγγίζει το 95%.

Όταν όμως το κείμενο πέσει κάτω από τα 200 tokens, η ακρίβεια υποχωρεί άμεσα στο 80%. Σε δομημένα περιβάλλοντα, όπως η συγγραφή κώδικα Python ή η επίλυση μαθηματικών προβλημάτων, η μέθοδος σχεδόν εκμηδενίζεται. Εκεί η σύνταξη είναι αυστηρή, τα συνώνυμα ελάχιστα και το στατιστικό περιθώριο εξαφανίζεται.

Σενάριο Κειμένου Μέγεθος / Τροποποίηση Ποσοστό Επιτυχούς Ανίχνευσης
Ακαδημαϊκό Δοκίμιο 400+ tokens (ανέπαφο) ~95%
Σύντομη Απάντηση 200 tokens (ανέπαφο) ~80%
Ελαφριά Επεξεργασία 10% αλλαγή με συνώνυμα 66%
Βαριά Αναδιατύπωση 25% αλλαγή με συνώνυμα 17%
Κώδικας / Μαθηματικά Ανεξαρτήτως μεγέθους Εξαιρετικά χαμηλό (<20%)

Το μεγαλύτερο πρόβλημα είναι η ανθρώπινη παρέμβαση. Αν αντικαταστήσεις μόλις το 10% των λέξεων ενός παραγόμενου κειμένου με συνώνυμα, η ανίχνευση πέφτει από το 92% στο 66%. Με αντικατάσταση του 25% των λέξεων, το ποσοστό κατρακυλά στο 17%, καθιστώντας τον εντοπισμό αδύνατο.

Το παρασκήνιο του ευρωπαϊκού AI Act

Η εφαρμογή του textGrain στην Ευρώπη δεν αποτελεί τεχνολογική επιλογή της OpenAI, αλλά άμεσο αποτέλεσμα νομικής πίεσης. Το ρυθμιστικό πλαίσιο της Ευρωπαϊκής Ένωσης για το AI Act απαιτεί σαφή ιχνηλασιμότητα και διαφάνεια σε οτιδήποτε παράγεται από αυτόνομα συστήματα.

Για να αποφύγει που φτάνουν έως και το 7% του παγκόσμιου τζίρου της, η εταιρεία έπρεπε να δείξει άμεσα αντανακλαστικά. Γι’ αυτόν τον λόγο η ενεργοποίηση γίνεται πρώτα στους Ευρωπαίους χρήστες, μετατρέποντας την ευρωπαϊκή βάση σε πεδίο δοκιμής ρυθμιστικής συμμόρφωσης.

Παρόλα αυτά, η πρόσβαση στο εργαλείο ελέγχου δίνεται με το σταγονόμετρο. Η OpenAI γνωρίζει ότι αν το διαθέσει δημόσια σε καθηγητές ή εργοδότες, τα ψευδώς θετικά αποτελέσματα (false positives) θα οδηγήσουν σε αμέτρητες άδικες κατηγορίες ατόμων που έγραψαν το κείμενό τους χωρίς καμία βοήθεια.

Κείμενο εναντίον εικόνας: Η μεγάλη διαφορά

Η ιχνηλασιμότητα στα πολυμέσα είναι σαφώς πιο ώριμη. Για τις εικόνες, ο συνασπισμός C2PA (Content Credentials) και τεχνολογίες όπως το SynthID της Google ενσωματώνουν δεδομένα στο επίπεδο των pixels ή των ηχητικών συχνοτήτων. Ακόμα κι αν γίνει crop ή συμπίεση, το σήμα επιβιώνει.

Το κείμενο όμως είναι απλώς ακολουθία από bytes χωρίς μεταδεδομένα. Μπορείς να το αντιγράψεις στο Notepad, να το περάσεις από ένα αυτόματο εργαλείο μετάφρασης σε άλλη γλώσσα και να το μεταφράσεις πίσω στα ελληνικά. Μέσα σε λίγα δευτερόλεπτα, κάθε στατιστικό ίχνος του textGrain εξαφανίζεται χωρίς να χαθεί το νόημα.

Αυτή η ασυμμετρία καθιστά το watermarking κειμένου εξαιρετικά ευάλωτο. Η τεχνολογία δεν μπορεί να διακρίνει αν ένα τελικό κείμενο δημιουργήθηκε εξ ολοκλήρου από AI ή αν γράφτηκε από άνθρωπο που χρησιμοποίησε το ChatGPT απλώς για διορθώσεις δομής.

Τι δεν αποκαλύπτει ποτέ ο έλεγχος

Υπάρχουν σημαντικές παρανοήσεις σχετικά με το τι μπορεί να πετύχει ένας τέτοιος έλεγχος. Η ανίχνευση του textGrain δεν αποκαλύπτει την ταυτότητα του χρήστη, το email του, το IP address ή το prompt που χρησιμοποίησε. Προστατεύει πλήρως το απόρρητο του λογαριασμού.

Επιπλέον, το υδατογράφημα δεν πιστοποιεί την εγκυρότητα των γραφομένων. Ένα κείμενο γεμάτο ψευδείς ειδήσεις ή παραισθήσεις (hallucinations) θα φέρει κανονικά τη σήμανση αν βγήκε από το ChatGPT, χωρίς καμία αξιολόγηση ποιότητας ή αλήθειας.

Τέλος, η απουσία υδατογραφήματος δεν εγγυάται ότι το κείμενο γράφτηκε από άνθρωπο. Μπορεί κάλλιστα να προέρχεται από ανταγωνιστικά μοντέλα όπως το Claude της ή το της Google, τα οποία δεν χρησιμοποιούν τον συγκεκριμένο αλγόριθμο της OpenAI.

Η άποψή μας στο TechNoid

Το textGrain της OpenAI είναι ένα νομικό άλλοθι και όχι μια πρακτική τεχνολογική λύση. Η εταιρεία το σχεδίασε για να ικανοποιήσει τις ρυθμιστικές αρχές των Βρυξελλών και το AI Act, γνωρίζοντας πολύ καλά ότι η αποτελεσματικότητά του καταρρέει με την παραμικρή επεξεργασία.

Στην πράξη, οποιοσδήποτε θέλει να παρακάμψει τη σήμανση μπορεί να το κάνει σε δέκα δευτερόλεπτα με μια απλή παράφραση ή αλλαγή μερικών λέξεων. Το γεγονός ότι η OpenAI κρατά τον ανιχνευτή κλειστό για το ευρύ κοινό αποδεικνύει πόσο αναξιόπιστος είναι ο εντοπισμός σε πραγματικές συνθήκες. Το κείμενο δεν είναι εικόνα· η προσπάθεια επιβολής υδατογραφημάτων σε λέξεις είναι καταδικασμένη να αποτύχει.

Συχνές Ερωτήσεις για το textGrain

Επηρεάζει το textGrain την ταχύτητα ή την ποιότητα του ChatGPT;

Όχι, οι εσωτερικές μετρήσεις δείχνουν ότι η ποιότητα του παραγόμενου κειμένου παραμένει σχεδόν ανέπαφη, με απόκλιση μικρότερη του 0,5% στα διεθνή benchmarks.

Μπορώ να δω αν το κείμενό μου έχει το υδατογράφημα;

Όχι, το εργαλείο ανίχνευσης είναι διαθέσιμο αποκλειστικά σε εγκεκριμένους ερευνητές και δεν προσφέρεται δημόσια στους τελικούς χρήστες.

Αν μεταφράσω το κείμενο, παραμένει το υδατογράφημα;

Όχι, η μετάφραση σε άλλη γλώσσα αναδιατάσσει πλήρως τα μαθηματικά μοτίβα επιλογής λέξεων, εξαλείφοντας πλήρως το στατιστικό σήμα.

Εφαρμόζεται το textGrain σε χρήστες εκτός Ευρώπης;

Προς το παρόν είναι προεπιλεγμένο μόνο για χρήστες εντός Ευρωπαϊκής Ένωσης, ενώ διεθνώς διατίθεται μόνο ως προαιρετική επιλογή (opt-in) για εταιρικούς πελάτες API.

Μπορεί να ανιχνεύσει κείμενα που παράγει το Claude ή το Gemini;

Όχι, ο αλγόριθμος είναι ιδιοταγής της OpenAI και αναγνωρίζει αποκλειστικά τα μαθηματικά σήματα που ενσωματώνουν τα δικά της μοντέλα.

Dimitris Marizas
Dimitris Marizashttps://technoid.gr
Γράφω για τεχνολογία από τη σκοπιά του ανθρώπου που τη χρησιμοποιεί καθημερινά — όχι από αίθουσες συνεδρίων. Ασχολούμαι με δίκτυα, δορυφορικό internet, smartphones και ψηφιακές υπηρεσίες, με έμφαση στο τι σημαίνουν αυτά πρακτικά για τον Έλληνα χρήστη. Πίσω από κάθε άρθρο κρύβεται ώρες ανάλυσης, δοκιμών και — όταν χρειάζεται — κριτικής σε ό,τι το marketing προσπαθεί να κρύψει.

ΑΦΗΣΤΕ ΜΙΑ ΑΠΑΝΤΗΣΗ

εισάγετε το σχόλιό σας!
παρακαλώ εισάγετε το όνομά σας εδώ