Η τεχνητή νοημοσύνη περνάει επιτέλους από τα εντυπωσιακά chat bots σε πραγματικά προσβάσιμες λύσεις προσβασιμότητας. Η Google DeepMind παρουσίασε το Sign Language to Text (SL2T), ένα μοντέλο που μεταφράζει πολύπλοκες κινήσεις σώματος σε κείμενο. Στις δικές μας δοκιμές σε παρόμοια AI εργαλεία, η αναγνώριση κίνησης έπασχε από latency, αλλά η Google φαίνεται να παρακάμπτει αυτόν τον σκόπελο.
- Το νέο μοντέλο SL2T της Google DeepMind μετατρέπει τη νοηματική γλώσσα σε κείμενο σε πραγματικό χρόνο.
- Αξιοποιεί το MediaPipe Holistic για να αποστέλλει μόνο γεωμετρικές συντεταγμένες και όχι οπτικό υλικό, διασφαλίζοντας το απόλυτο privacy.
- Ενσωματώνεται στα Google Pixel 11 για την αμερικανική νοηματική, με ευρύτερη διάθεση να ακολουθεί.
Συχνές Ερωτήσεις για το Google SL2T
Τι ακριβώς είναι το Sign Language to Text (SL2T);
Είναι ένα προηγμένο μοντέλο τεχνητής νοημοσύνης που εκπαιδεύτηκε σε πάνω από 100.000 ώρες δεδομένων για να μεταφράζει τις οπτικές κινήσεις της νοηματικής σε γραπτό λόγο.
Σε ποιες συσκευές είναι διαθέσιμο τώρα;
Αυτή τη στιγμή κάνει το ντεμπούτο του αποκλειστικά στα νέα Google Pixel 11 smartphones.
Πώς προστατεύεται η ιδιωτικότητα του χρήστη;
Το σύστημα δεν στέλνει βίντεο στο cloud, αλλά μετατρέπει την εικόνα σε γεωμετρικές συντεταγμένες μέσω του MediaPipe Holistic και διαγράφει αμέσως το αρχικό καρέ.
Πού μπορεί να αξιοποιηθεί καθημερινά;
Ενσωματώνεται στο Gboard και το Live Transcribe για αναζητήσεις, μηνύματα, επεξεργασία εγγράφων και αλληλεπίδραση με το Gemini.
Πώς λειτουργεί τεχνολογικά το SL2T
Η μετάφραση της νοηματικής γλώσσας δεν είναι μια απλή αντιστοίχιση λέξεων. Στο εργαστήριο του TechNoid παρατηρήσαμε ότι τα παραδοσιακά συστήματα όρασης αποτυγχάνουν διότι η νοηματική διαθέτει αυτόνομη γραμματική, εκφράσεις προσώπου και στάση σώματος.
Η DeepMind εκπαίδευσε το μοντέλο της σε πάνω από 50 διαφορετικά είδη νοηματικής και 100.000 ώρες υλικού. Το αποτέλεσμα είναι ένας αλγόριθμος που κατανοεί την ταυτόχρονη μετάδοση νοήματος από χέρια, κεφάλι και μορφασμούς.
https://pagead2.googlesyndication.com/pagead/js/adsbygoogle.js?client=ca-pub-9816651697894810
(adsbygoogle = window.adsbygoogle || []).push({});
Απόρρητο μέσω MediaPipe Holistic
Το μεγαλύτερο αγκάθι σε τέτοιες τεχνολογίες είναι η αποστολή ευαίσθητων οπτικών δεδομένων σε servers τ τρίτων. Η προσέγγιση της Google εδώ είναι υποδειγματική χάρη στο MediaPipe Holistic.
Αντί να ανεβαίνει ολόκληρο το βίντεο της κάμερας, η συσκευή απομονώνει μόνο τα γεωμετρικά σημεία αναφοράς. Το raw video καταστρέφεται αμέσως τοπικά, αφήνοντας μηδαμινό περιθόριο διαρροής προσωπικών δεδομένων.
Πρακτική χρήση σε Gboard και Gemini
Η ενσωμάτωση του SL2T απευθείας στο Gboard και το Live Transcribe αλλάζει τα δεδομένα για τους χρήστες. Μπορείς πλέον να κάνεις web browsing, να συντάξεις email ή να στείλεις μηνύματα χωρίς να αγγίξεις πληκτρολόγιο.
Η διασύνδεση με το AI οικοσύστημα της Google, όπως το Gemini, σημαίνει πως η φωνή (ή καλύτερα, οι κινήσεις) των ατόμων με προβλήματα ακοής αποκτούν άμεση πρόσβαση σε προηγμένα εργαλεία παραγωγικότητας.
https://pagead2.googlesyndication.com/pagead/js/adsbygoogle.js?client=ca-pub-9816651697894810
(adsbygoogle = window.adsbygoogle || []).push({});
Η άποψή μας στο TechNoid
Επιτέλους μια σοβαρή εφαρμογή της τεχνητής νοημοσύνης που δεν βασίζεται σε άχρηστα γκρίζα gimmicks αλλά λύνει πραγματικά προβλήματα. Η επιλογή της Google να επεξεργάζεται τα δεδομένα κίνησης τοπικά μέσω του MediaPipe δείχνει ωριμότητα στον τομέα του privacy. Το γεγονός ότι ξεκινά από τα Pixel 11 περιορίζει προσωρινά το κοινό, αλλά η τεχνολογία αυτή είναι μονόδρομος για το μέλλον των smartphone OS.

