- Τα νέα AI μοντέλα συλλογισμού o3-mini και DeepSeek-R1 αναπαράγουν σοβαρά φυλετικά και έμφυλα στερεότυπα στην ιατρική περίθαλψη, ξεπερνώντας τα ποσοστά ανακρίβειας του GPT-4.
- Η έρευνα του Πανεπιστημίου Flinders έδειξε ότι το DeepSeek-R1 παρουσίασε σημαντική ανακρίβεια στο 89% των παθήσεων ως προς τη φυλή.
- Οι αλγόριθμοι βασίζονται σε προεπιλεγμένα στερεότυπα και όχι σε πραγματικά επιδημιολογικά δεδομένα, απειλώντας την κλινική διάγνωση.
Ο μύθος της καθαρής λογικής στα LLMs
Πιστεύαμε αφελή, εμείς στο TechNoid, ότι η μετάβαση στα μοντέλα τεχνητής νοημοσύνης νέας γενιάς με δυνατότητες συλλογισμού θα λειτουργούσε ως ψηφιακό ταμπλέτο αποτοξίνωσης από τις ανθρώπινες προκαταλήψεις. Όταν τα OpenAI o3-mini και DeepSeek-R1 έκαναν την εμφάνισή τους με βελτιωμένες ικανότητες λογικής επεξεργασίας, θεωρήσαμε λανθασμένα ότι η ωμή μαθηματική ισχύς θα διόρθωνε τα προβλήματα του GPT-4.
Η πραγματικότητα, όπως αποκαλύπτει πρόσφατη μελέτη από το College of Medicine and Public Health του Πανεπιστημίου Flinders που δημοσιεύθηκε στο Eurekalert, αποδεικνύει το αντίθετο. Τα συστήματα αυτά δεν πάσχουν από έλλειψη εξυπνάδας, αλλά από δομική εξάρτηση σε τοξικά στερεότυπα που είναι κρυμμένα στα δεδομένα εκπαίδευσής τους.
Όταν τροφοδοτείς ένα μοντέλο με δισεκατομμύρια γραμμές ιατρικού κειμένου χωρίς αυστηρό φιλτράρισμα, δεν δημιουργείς έναν ψηφιακό γιατρό. Δημιουργείς έναν απολογητή της μέσης στατιστικής που επαναλαμβάνει τα λάθη των προηγούμενων δεκαετιών, αγνοώντας την πραγματική επιδημιολογία των ασθενειών.
Πώς αντιδρούν o3-mini και DeepSeek-R1
Οι ερευνητές στην Αυστραλία έβαλε τα μοντέλα να παράξουν 36.000 μοναδικά κλινικά σενάρια για να μετρήσουν το μέγεθος της στρέβλωσης. Τα νούμερα προκαλούν σοκ σε όσους παρακολουθούν τις εξελίξεις στα δίκτυα και τις ψηφιακές υπηρεσίες υγείας.
Το GPT-4 είχε ήδη αποτύχει παταγωδώς, ξεπερνώντας το όριο σημαντικής ανακρίβειας στο 67% των παθήσεων ως προς τη φυλή και το φύλο. Ωστόσο, το o3-mini ανέβασε το ποσοστό φυλετικής ανακρίβειας στο 78%, ενώ το DeepSeek-R1 εκτοξεύτηκε στο εντυπωσιακό 89% για τη φυλή και στο 67% για το φύλο.
Αυτό συμβαίνει επειδή τα μοντέλα συλλογισμού δεν ανατρέχουν σε πραγματικές δημογραφικές βάσεις δεδομένων όταν σκέφτονται. Αντίθετα, όπως έδειξε η ποιοτική ανάλυση του DeepSeek-R1, τα LLMs ανατρέχουν σε στερεοτυπικές συσχετίσεις λέξεων. Αν για παράδειγμα ζητήσεις ένα περιστατικό σαρκοείδωσης ή προεκλαμψίας, ο αλγόριθμος “προεπιλέγει” συγκεκριμένες δημογραφικές ομάδες επειδή απλά εμφανίζονται συχνότερα μαζί στα εγχειρίδια που διάβασε.
Οι κίνδυνοι για την κλινική διάγνωση
Το πρόβλημα παίρνει επικίνδυνες διαστάσεις όταν αυτά τα εργαλεία ενσωματώνονται σταδιακά στα νοσοκομεία και στις διαγνωστικές πλατφόρμες. Η συστηματική υπερεκπροσώπηση συγκεκριμένων πληθυσμών σε παθήσεις όπως ο συστηματικός ερυθηματώδης λύκος ή η ιδιοπαθής υπέρταση αλλοιώνει τον τρόπο που οι επαγγελματίες υγείας εκπαιδεύονται να σκέφτονται.
Όταν ο νέος γιατρός βασίζεται σε ένα AI που τουρμπίζει στερεότυπα, η διαφοροδιάγνωση πάει περίπατο. Οι ασθενείς που δεν ταιριάζουν στο “πρωτότυπο” προφίλ που κατασκεύασε ο αλγόριθμος κινδυνεύουν με λανθασμένη ή καθυστερημένη διάγνωση.
Δεν μιλάμε απλώς για ένα θεωρητικό ζήτημα ηθικής της τεχνητής νοημοσύνης. Μιλάμε για έμπρακτη υποβάθμιση της ποιότητας περίθαλψης σε ευάλωτες ομάδες, κάτι που αποδεικνύει ότι η τεχνολογία, χωρίς ρυθμιστικό πλαίσιο, δημιουργεί περισσότερα προβλήματα από αυτά που υπόσχεται να λύσει.
Η άποψή μας στο TechNoid
Εμείς στο TechNoid πιστεύουμε ακράδαντα ότι η βιομηχανία της τεχνητής νοημοσύνης κρύβεται πίσω από το δάχτυλό της. Η εμμονή των εταιρειών να λανσάρουν ταχύτατα μοντέλα συλλογισμού για να κερδίσουν την κούρσα των benchmarks έχει μετατρέψει τα LLMs σε επικίνδυνα κουτιά ταχύτητας που παράγουν προκατάληψη με υψηλή ταχύτητα.
Δεν αρκεί να προσθέτουμε απλώς περισσότερους servers ή να βελτιώνουμε το reinforcement learning. Αν η βάση δεδομένων είναι μολυσμένη με κοινωνικές παθογένειες και οι προγραμματιστές δεν ενσωματώσουν υποχρεωτικά επιδημιολογικά φίλτρα αλήθειας, τα νέα μοντέλα θα συνεχίσουν να είναι χειρότερα από τους προκατόχους τους. Αν σχεδιάζεις να χρησιμοποιήσεις εργαλεία AI για κλινική υποστήριξη, καλά θα κάνεις να κρατάς τεράστιο καλάθι.
Συχνές Ερωτήσεις για τις προκαταλήψεις των AI μοντέλων στην υγεία
Γιατί τα νέα μοντέλα συλλογισμού εμφανίζουν περισσότερες προκαταλήψεις από τα παλαιότερα;
Επειδή δίνουν έμφαση στη δημιουργία τυπικών ή πρωτότυπων περιστατικών βάσει των συχνοτήτων στα δεδομένα εκπαίδευσής τους, αντί να ανατρέχουν σε πραγματικά επιδημιολογικά δεδομένα.
Ποια μοντέλα αξιολογήθηκαν στη συγκεκριμένη μελέτη του Πανεπιστημίου Flinders;
Η έρευνα αξιολόγησε τα OpenAI o3-mini και DeepSeek-R1, συγκρίνοντας τα αποτελέσματά τους με τα δεδομένα του παλαιότερου GPT-4.
Ποιο μοντέλο παρουσίασε το υψηλότερο ποσοστό φυλετικής ανακρίβειας;
Το DeepSeek-R1 κατέγραψε το υψηλότερο ποσοστό, φτάνοντας το 89% σε ανακρίψεις εκπροσώπησης ως προς τη φυλετική κατανομή των παθήσεων.
Ποιες ιατρικές παθήσεις επηρεάζονται περισσότερο από αυτά τα στερεότυπα;
Η σαρκοείδωση, ο συστηματικός ερυθηματώδης λύκος, η προεκλαμψία και η ιδιοπαθής υπέρταση είναι μερικές από τις παθήσεις όπου παρατηρείται συστηματική υπερεκπροσώπηση συγκεκριμένων ομάδων.
Μπορεί η ενσωμάτωση αυτών των LLMs στα νοσοκομεία να επηρεάσει τη διάγνωση;
Ναι, υπάρχει σοβαρός κίνδυνος ενίσχυσης περιορισμένων δημογραφικών αντιλήψεων στους κλινικούς γιατρούς, οδηγώντας πιθανόν σε εσφαλμένες διαγνώσεις.
Είναι το πρόβλημα αποκλειστικά φυλετικό ή αφορά και άλλους παράγοντες;
Εκτός από τα φυλετικά στερεότυπα, η έρευνα απέδειξε εξίσου σημαντικά ποσοστά ανακρίβειας και στην αναπαραγωγή έμφυλων στερεοτύπων.
Πώς μπορούν οι εταιρείες AI να διορθώσουν αυτό το πρόβλημα;
Απαιτείται αυστηρός καθαρισμός των δεδομένων εκπαίδευσης και ενσωματωμένα αλγοριθμικά φίλτρα που να βασίζονται σε πραγματικά, επικυρωμένα επιδημιολογικά στοιχεία.


