Η ταυτοποίηση AI-generated content είναι ένα από τα πιο κρίσιμα ζητήματα της σύγχρονης τεχνολογίας, και η Anthropic παρουσίασε μια από τις πιο ενδιαφέρουσες προσεγγίσεις μέχρι σήμερα. Το Claude θα ενσωματώνει ένα αόρατο watermark σε κάθε κείμενο που παράγει, ως συμμόρφωση με τους νέους κανόνες διαφάνειας της ΕΕ για το AI.
Και ο τρόπος που λειτουργεί είναι σχεδόν αόρατος για τον αναγνώστη.
Πώς λειτουργεί η αόρατη υπογραφή
Δεν πρόκειται για κάτι που θα βλέπεις ή θα νιώθεις όταν διαβάζεις. Δεν υπάρχουν εμφανείς σχεδιαστικές παρεμβάσεις, δεν αλλάζει η στίξη και δεν μπαίνουν κρυφοί χαρακτήρες. Αντ’ αυτού, η Anthropic αφήνει ένα μοτίβο μέσα στο ίδιο το κείμενο που μπορεί να διαβαστεί μόνο από κάποιον που έχει το κατάλληλο κλειδί.
Για να καταλάβεις τη μηχανική, τα language models επιλέγουν μία λέξη τη φορά όταν παράγουν κείμενο, ξεκινώντας από μια λίστα υποψηφίων λέξεων που ταιριάζουν στο context. Κανονικά, η επιλογή γίνεται μέσω ενός τυχαίου number generator. Με το watermarking ενεργό, το Claude χρησιμοποιεί ένα κρυφό κλειδί για να αποφασίσει την επόμενη λέξη.
Στο παράδειγμα της Anthropic, το κλειδί βασίζεται στα ψηφία του π. Αν το κλειδί ξεκινάει από το 2, η επόμενη λέξη είναι η έκτη στη λίστα των επιλογών, μετά η πέμπτη, μετά η τρίτη και μετά ξανά η πέμπτη. Είναι μια εξέλιξη της SynthID-Text μεθόδου του Google DeepMind που δημοσιεύθηκε στο Nature. Το καλύτερο κομμάτι είναι ότι δεν επηρεάζει την ποιότητα, δεν επιβραδύνει το output και δεν κοστίζει επιπλέον tokens.
Τι πιάνει και τι όχι
Οι περιορισμοί της μεθόδου είναι εξίσου ενδιαφέροντες. Το watermarking μπορεί να πιάσει πότε το Claude συμμετείχε σε ένα κείμενο, αλλά όχι πότε ακριβώς το έγραψε από την αρχή. Αν του δώσεις να επιμεληθεί κάτι δικό σου, ακόμα και το edit θα φέρει την υπογραφή του. Το ίδιο ισχύει και για μεταφράσεις. Αν όμως το κείμενο είναι πολύ σύντομο ή το Claude απλά έκανε ένα ελαφρύ proofreading, το watermark μπορεί να μην είναι αρκετό για να ανιχνευτεί.
Και το πιο σημαντικό. Οι ελαφρές επεξεργασίες πάνω σε Claude-generated text συνήθως δεν αφαιρούν το watermark. Για να είσαι σίγουρος ότι έχει φύγει, χρειάζεται πλήρες rewrite από την αρχή. Στον τομέα του code η κατάσταση είναι διαφορετική. Ο κώδικας απαιτεί πολύ συγκεκριμένο output, οπότε υπάρχουν λιγότερες επιλογές για κάθε token και το watermarking είναι πιο αραιό ή σε ορισμένες περιπτώσεις αδύνατο.
Η Anthropic θα κυκλοφορήσει και ένα API με τα κλειδιά αποκωδικοποίησης, ώστε να μπορεί κανείς να ελέγξει αν ένα κείμενο προήλθε από το Claude. Παράλληλα, οι εικόνες που παράγονται από το ίδιο το Claude θα φέρουν κρυπτογραφικά υπογεγραμμένη σημείωση στα metadata τους.
Τι αλλάζει για τους χρήστες
Η μεγαλύτερη αλλαγή είναι ότι δεν θα υπάρχει διαχωρισμός ανά περιοχή. Η Anthropic θα εφαρμόσει το watermarking σε όλο το output του Claude παγκοσμίως, όχι μόνο στην ΕΕ. Ο λόγος είναι πρακτικός. Δεν υπάρχει σαφής τρόπος να εφαρμοστούν αλλαγές μόνο σε συγκεκριμένες γεωγραφικές αγορές.
Οι αλλαγές θα ισχύουν σε όλα τα Claude products με μοντέλα που έχουν κυκλοφορήσει μετά τις αρχές Αυγούστου, ενώ η υποστήριξη για παλαιότερα μοντέλα θα προστεθεί σταδιακά τους επόμενους μήνες. Πρακτικά, από δω και πέρα κάθε φορά που κάτι γράφτηκε με τη βοήθεια του Claude, θα υπάρχει ένας αόρατος τρόπος να αποδειχθεί. Και για μια εποχή που ο διαχωρισμός AI και ανθρώπινου content γίνεται όλο και πιο δύσκολος, αυτό ίσως αποδειχθεί από τα πιο σημαντικά εργαλεία που θα δούμε τα επόμενα χρόνια.
