ΕπιστημονικάΙατρική AI: 36.000 περιστατικά αποκάλυψαν φυλετικές αποκλίσεις

Ιατρική AI: 36.000 περιστατικά αποκάλυψαν φυλετικές αποκλίσεις

- Advertisement -

Ακόμη και τα νεότερα μοντέλα Τεχνητής Νοημοσύνης με προηγμένες δυνατότητες συλλογισμού μπορεί να αναπαράγουν στερεότυπα όταν δημιουργούν ιατρικό περιεχόμενο. Μελέτη του Flinders University, που εξέτασε τα o3-mini και DeepSeek-R1 σε 36.000 εικονικά κλινικά περιστατικά, διαπίστωσε συστηματικές αποκλίσεις ως προς τη φυλή και το φύλο των ασθενών που «επέλεγαν» τα μοντέλα για διαφορετικές παθήσεις. Οι ερευνητές προειδοποιούν ότι η μεγαλύτερη ικανότητα συλλογισμού ενός συστήματος AI δεν συνεπάγεται αυτομάτως και μικρότερη μεροληψία.

Ακόμη και τα νεότερα μοντέλα Τεχνητής Νοημοσύνης με προηγμένες δυνατότητες συλλογισμού μπορεί να αναπαράγουν στερεότυπα όταν δημιουργούν ιατρικό περιεχόμενο
Photo healthpharma

ΔΩΡΕΑΝ ΕΓΓΡΑΦΗ ΣΤΟ NEWSLETTER

Νέα ερωτήματα σχετικά με την ασφαλή χρήση της Τεχνητής Νοημοσύνης στην ιατρική εγείρει μελέτη ερευνητών του Flinders University, σύμφωνα με την οποία ακόμη και σύγχρονα μοντέλα AI που έχουν σχεδιαστεί για πιο σύνθετο συλλογισμό εξακολουθούν να αναπαράγουν φυλετικά και έμφυλα στερεότυπα όταν καλούνται να δημιουργήσουν κλινικά περιστατικά.

Οι επιστήμονες αξιολόγησαν δύο μοντέλα νέας γενιάς, το o3-mini και το DeepSeek-R1, ζητώντας τους να περιγράψουν φανταστικούς ασθενείς με κοινές παθήσεις.

Συνολικά δημιουργήθηκαν 36.000 διαφορετικά κλινικά σενάρια.

Όταν οι ερευνητές συνέκριναν τα δημογραφικά χαρακτηριστικά των ασθενών που παρήγαγαν τα μοντέλα με την πραγματική κατανομή των παθήσεων στον πληθυσμό, διαπίστωσαν ότι σε πολλές περιπτώσεις υπήρχε σημαντική υπερεκπροσώπηση συγκεκριμένων φυλετικών ή έμφυλων ομάδων.

Το αποτέλεσμα, σύμφωνα με τους συγγραφείς, δείχνει ότι η βελτίωση των συλλογιστικών ικανοτήτων των μοντέλων δεν οδηγεί απαραίτητα σε πιο δίκαιη ή αντιπροσωπευτική παραγωγή ιατρικού περιεχομένου.

Ο κίνδυνος της AI να ενισχύσει υπάρχουσες ανισότητες

Τα μεγάλα γλωσσικά μοντέλα —Large Language Models ή LLMs— χρησιμοποιούνται ολοένα περισσότερο σε εφαρμογές που σχετίζονται με την Υγεία.

Μπορούν να βοηθήσουν στη σύνταξη κλινικών σημειωμάτων, στην αναζήτηση πληροφοριών, στην εκπαίδευση επαγγελματιών Υγείας, στην προετοιμασία εκπαιδευτικών περιστατικών και, υπό συγκεκριμένες προϋποθέσεις, στην υποστήριξη της κλινικής λήψης αποφάσεων.

Ακριβώς γι’ αυτό όμως η ύπαρξη συστηματικών προκαταλήψεων αποκτά ιδιαίτερη σημασία.

«Τα μεγάλα γλωσσικά μοντέλα έχουν τη δυνατότητα να μεταμορφώσουν την υγειονομική περίθαλψη, αλλά υπάρχει ο κίνδυνος να επιδεινώσουν τις ανισότητες στην Υγεία εάν διαιωνίζουν προκαταλήψεις», επισημαίνει ο επικεφαλής ερευνητής Joshua Docking, από το College of Medicine and Public Health του Flinders University.

Τι είχε βρεθεί παλαιότερα στο GPT-4

Το ζήτημα δεν εμφανίζεται για πρώτη φορά.

Προηγούμενες έρευνες είχαν εντοπίσει πιθανές φυλετικές και έμφυλες προκαταλήψεις στα κλινικά σενάρια που δημιουργούσε το GPT-4.

Μεταξύ άλλων, είχε παρατηρηθεί υπερεκπροσώπηση μαύρων ασθενών σε παθήσεις που έχουν ιστορικά ή εκπαιδευτικά συνδεθεί στερεοτυπικά με συγκεκριμένες φυλετικές ομάδες.

Έκτοτε εμφανίστηκε μία νέα γενιά μοντέλων με πιο εξελιγμένες δυνατότητες συλλογισμού και υψηλότερες επιδόσεις σε πολλά benchmarks.

Οι ερευνητές θέλησαν λοιπόν να εξετάσουν ένα κρίσιμο ερώτημα:

Η καλύτερη «λογική» ενός μοντέλου σημαίνει και μικρότερη δημογραφική προκατάληψη;

Τα αποτελέσματα δείχνουν ότι η απάντηση, τουλάχιστον με βάση αυτή τη μελέτη, είναι αρνητική.

36.000 κλινικά περιστατικά στο μικροσκόπιο

Για τη μελέτη, τα μοντέλα δημιούργησαν συνολικά 36.000 μοναδικά κλινικά σενάρια.

Οι επιστήμονες εξέτασαν στη συνέχεια εάν τα χαρακτηριστικά φυλής και φύλου των εικονικών ασθενών αντανακλούσαν με ρεαλιστικό τρόπο τη δημογραφική κατανομή των συγκεκριμένων παθήσεων.

Οι αποκλίσεις ήταν συχνές.

Στην προηγούμενη ανάλυση του GPT-4 είχε εντοπιστεί στατιστικά σημαντική λανθασμένη αντιπροσώπευση:

  • στο 67% των παθήσεων ως προς τη φυλή
  • και στο 67% ως προς το φύλο.

Στα νεότερα reasoning models τα ποσοστά δεν παρουσίασαν συνολική βελτίωση.

o3-mini: Απόκλιση στο 78% των παθήσεων ως προς τη φυλή

Σύμφωνα με τους ερευνητές, το o3-mini εμφάνισε σημαντική λανθασμένη δημογραφική αντιπροσώπευση:

  • στο 78% των παθήσεων ως προς τη φυλή
  • και στο 56% ως προς το φύλο.

Το DeepSeek-R1 εμφάνισε ακόμη υψηλότερο ποσοστό ως προς τη φυλετική αντιπροσώπευση:

  • 89% για τη φυλή
  • και 67% για το φύλο.

«Τα αποτελέσματά μας δείχνουν συγκρίσιμα ή υψηλότερα ποσοστά για τα o3-mini και DeepSeek-R1, γεγονός που υποδηλώνει ότι δεν υπήρξε βελτίωση στην αντιπροσώπευση με τα νεότερα reasoning models», εξηγεί ο καθηγητής Michael Sorich, καθηγητής Κλινικής Φαρμακολογίας στο Flinders University και επικεφαλής συγγραφέας της έρευνας.

Οι αριθμοί αυτοί αφορούν τον συγκεκριμένο πειραματικό σχεδιασμό και δεν σημαίνουν ότι τα μοντέλα είναι λανθασμένα στο ίδιο ποσοστό σε γενικές ιατρικές ερωτήσεις. Αξιολογούν ειδικά τη δημογραφική αντιπροσώπευση στα κλινικά σενάρια που δημιουργήθηκαν.

Πού εμφανίστηκαν τα πιο χαρακτηριστικά φυλετικά στερεότυπα

Ιδιαίτερο ενδιαφέρον παρουσιάζει το είδος των αποκλίσεων.

Όπως είχε παρατηρηθεί προηγουμένως στο GPT-4, τόσο το o3-mini όσο και το DeepSeek-R1 εμφάνισαν τάση να παρουσιάζουν δυσανάλογα συχνά μαύρους ασθενείς σε συγκεκριμένες παθήσεις.

Μεταξύ αυτών ήταν:

  • η σαρκοείδωση,
  • ο συστηματικός ερυθηματώδης λύκος,
  • η προεκλαμψία,
  • και η ιδιοπαθής υπέρταση.

Οι συγκεκριμένες παθήσεις μπορεί πράγματι να εμφανίζουν διαφορετικούς επιδημιολογικούς δείκτες μεταξύ πληθυσμιακών ομάδων.

Το πρόβλημα, όμως, σύμφωνα με τους ερευνητές, αρχίζει όταν μία στατιστική συσχέτιση μετατρέπεται από το μοντέλο σε σχεδόν αυτόματο δημογραφικό «πρότυπο» του ασθενούς.

Έτσι δημιουργείται ο κίνδυνος μία νόσος που στην πραγματικότητα επηρεάζει διαφορετικούς πληθυσμούς να παρουσιάζεται επανειλημμένα σαν να αφορά κυρίως μία συγκεκριμένη ομάδα.

Μεγαλύτερη απόκλιση στα νεότερα μοντέλα

Η διάμεση φυλετική λανθασμένη αντιπροσώπευση στις συγκεκριμένες στερεοτυπικά συνδεδεμένες παθήσεις ήταν, σύμφωνα με τη μελέτη:

  • περίπου 15% στο GPT-4,
  • 44% στο o3-mini,
  • και 31% στο DeepSeek-R1.

Το εύρημα προβλημάτισε τους ερευνητές, καθώς δείχνει ότι οι νεότερες δυνατότητες συλλογισμού δεν εξάλειψαν το φαινόμενο και σε ορισμένες περιπτώσεις οι αποκλίσεις ήταν μεγαλύτερες.

Τι έδειξε η ανάλυση του DeepSeek-R1

Ιδιαίτερο ενδιαφέρον είχε και η ποιοτική εξέταση των συλλογιστικών ιχνών του DeepSeek-R1.

Σύμφωνα με τους συγγραφείς, το μοντέλο σε αρκετές περιπτώσεις επικαλούνταν ρητά συσχετίσεις ανάμεσα σε μία νόσο και μια δημογραφική ομάδα προκειμένου να αποφασίσει ποια χαρακτηριστικά θα έδινε στον φανταστικό ασθενή.

Ωστόσο, δεν παρέπεμπε σε συγκεκριμένα ποσοτικά επιδημιολογικά στοιχεία που να τεκμηριώνουν αυτή την επιλογή.

Οι επιστήμονες θεωρούν ότι αυτό μπορεί να αποτελεί ένδειξη πως το μοντέλο δεν προσπαθεί απαραίτητα να δημιουργήσει ένα αντιπροσωπευτικό δείγμα του πραγματικού πληθυσμού.

Αντίθετα, ίσως παράγει ένα «πρωτοτυπικό» ή χαρακτηριστικό περιστατικό, βασισμένο στα μοτίβα που έχει μάθει από τα δεδομένα εκπαίδευσης.

Το πρόβλημα των «τυπικών» ασθενών

Στην ιατρική εκπαίδευση χρησιμοποιούνται συχνά χαρακτηριστικά παραδείγματα.

Ένας φοιτητής μπορεί, για παράδειγμα, να μαθαίνει ότι μια νόσος εμφανίζεται συχνότερα σε μια συγκεκριμένη ηλικία, φύλο ή πληθυσμιακή ομάδα.

Αυτή η γνώση μπορεί να είναι χρήσιμη για τη διαφορική διάγνωση.

Γίνεται όμως προβληματική όταν μετατρέπεται σε απόλυτη προσδοκία.

Ένας ασθενής που δεν ταιριάζει στο «τυπικό προφίλ» μπορεί τότε να θεωρηθεί λιγότερο πιθανό ότι πάσχει από τη συγκεκριμένη νόσο, ακόμη και όταν τα συμπτώματά του το υποδεικνύουν.

Αν μια Τεχνητή Νοημοσύνη παράγει ξανά και ξανά τα ίδια δημογραφικά πρότυπα, υπάρχει κίνδυνος να ενισχύει αυτή τη νοητική συντόμευση στους ανθρώπους που χρησιμοποιούν το σύστημα.

Ο κίνδυνος για την κλινική σκέψη

Οι συγγραφείς προειδοποιούν ότι η συστηματική υπερεκπροσώπηση συγκεκριμένων πληθυσμιακών ομάδων μπορεί να περιορίσει τον τρόπο με τον οποίο οι επαγγελματίες Υγείας αντιλαμβάνονται ποιοι ασθενείς είναι πιθανό να εμφανίσουν μία νόσο.

«Η σταθερή υπερεκπροσώπηση συγκεκριμένων δημογραφικών ομάδων, ιδιαίτερα για παθήσεις που στην πράξη επηρεάζουν διαφορετικούς πληθυσμούς, ενέχει τον κίνδυνο ενίσχυσης περιορισμένων δημογραφικών υποθέσεων», επισημαίνουν οι ερευνητές.

Το πρόβλημα μπορεί να είναι ιδιαίτερα σημαντικό όταν τα συστήματα AI χρησιμοποιούνται για:

  • εκπαίδευση φοιτητών Ιατρικής,
  • δημιουργία κλινικών περιστατικών,
  • υποστήριξη διαφορικής διάγνωσης,
  • προετοιμασία εξετάσεων,
  • ή κλινικά εργαλεία υποστήριξης αποφάσεων.

Και στερεότυπα σχετικά με το φύλο

Το φαινόμενο δεν περιορίστηκε στη φυλή.

Οι ερευνητές εντόπισαν επίσης συστηματικές αποκλίσεις στη δημογραφική κατανομή του φύλου.

Σε πολλές παθήσεις τα μοντέλα είχαν την τάση να υπερτονίζουν το φύλο που αποτελεί την πλειονότητα των ασθενών, παρουσιάζοντας λιγότερο συχνά περιστατικά στο άλλο φύλο από όσο θα δικαιολογούσαν τα πραγματικά επιδημιολογικά δεδομένα.

Αυτό συνάδει, σύμφωνα με τους ερευνητές, με προηγούμενα ευρήματα που δείχνουν ότι τα LLMs μπορούν να ενισχύουν έμφυλα στερεότυπα στην Υγεία.

Και εδώ το πρόβλημα δεν είναι ότι κάποιες παθήσεις εμφανίζονται πράγματι συχνότερα στους άνδρες ή στις γυναίκες.

Το πρόβλημα εμφανίζεται όταν η πραγματική διαφορά στη συχνότητα μεγεθύνεται από το μοντέλο σε βαθμό που δεν αντανακλά την πραγματικότητα.

Γιατί αυτό έχει σημασία στην πραγματική ιατρική

Οι δημογραφικοί παράγοντες έχουν πραγματική θέση στην ιατρική.

Η ηλικία, το βιολογικό φύλο, το οικογενειακό ιστορικό, το περιβάλλον, η γενετική καταγωγή και κοινωνικοοικονομικοί παράγοντες μπορούν να επηρεάζουν τον κίνδυνο εμφάνισης συγκεκριμένων νοσημάτων.

Αλλά η φυλή δεν αποτελεί απλή βιολογική μεταβλητή και δεν πρέπει να χρησιμοποιείται ως εύκολη συντόμευση για την πρόβλεψη της νόσου.

Πολλές παρατηρούμενες διαφορές στην Υγεία συνδέονται με έναν πολύπλοκο συνδυασμό παραγόντων, όπως:

  • κοινωνικοοικονομικές συνθήκες,
  • πρόσβαση στις υπηρεσίες Υγείας,
  • περιβαλλοντική έκθεση,
  • διατροφή,
  • χρόνια επιβάρυνση από στρες,
  • ιστορικές ανισότητες,
  • γενετικούς και βιολογικούς παράγοντες.

Η υπερβολικά απλουστευμένη σύνδεση μιας πάθησης με μία φυλετική κατηγορία μπορεί επομένως να είναι επιστημονικά παραπλανητική.

Η AI μαθαίνει από ανθρώπινα δεδομένα

Ένα από τα βασικότερα προβλήματα στη μεροληψία των μεγάλων γλωσσικών μοντέλων βρίσκεται στα δεδομένα πάνω στα οποία εκπαιδεύονται.

Τα μοντέλα μαθαίνουν από τεράστιες ποσότητες ανθρώπινης γλώσσας.

Σε αυτές περιλαμβάνονται επιστημονικά άρθρα, βιβλία, εκπαιδευτικό υλικό, διαδικτυακό περιεχόμενο και άλλες πηγές που μπορεί να περιέχουν τόσο ακριβείς επιστημονικές παρατηρήσεις όσο και ιστορικές προκαταλήψεις ή υπεραπλουστευμένα στερεότυπα.

Ένα LLM μπορεί να μάθει την ισχυρή γλωσσική σύνδεση μεταξύ ενός δημογραφικού χαρακτηριστικού και μιας νόσου και να την αναπαράγει πολύ συχνότερα από όσο δικαιολογούν τα πραγματικά δεδομένα.

Με άλλα λόγια, η Τεχνητή Νοημοσύνη δεν χρειάζεται να έχει κάποια «πρόθεση» για να παράγει προκατειλημμένο αποτέλεσμα.

Αρκεί να αναπαράγει με μεγάλη συνέπεια τα μοτίβα που βρίσκονται στα δεδομένα και στον τρόπο με τον οποίο έχει εκπαιδευτεί.

Καλύτερη AI δεν σημαίνει αυτομάτως δικαιότερη AI

Η νέα μελέτη αναδεικνύει ένα ευρύτερο ζήτημα για την εξέλιξη των συστημάτων Τεχνητής Νοημοσύνης.

Οι επιδόσεις ενός μοντέλου μπορούν να βελτιώνονται θεαματικά σε μαθηματικά, προγραμματισμό, επιστημονική συλλογιστική ή σύνθετες εργασίες χωρίς να βελτιώνονται στον ίδιο βαθμό άλλες ιδιότητες, όπως:

  • η αμεροληψία,
  • η αντιπροσωπευτικότητα,
  • η αξιοπιστία,
  • η διαφάνεια,
  • η ασφάλεια σε κλινικές εφαρμογές.

«Οι εξελίξεις στις δυνατότητες των LLMs δεν εγγυώνται παράλληλες βελτιώσεις σε όλες τις διαστάσεις, συμπεριλαμβανομένης της δικαιοσύνης και της αντιπροσώπευσης στην Υγεία», επισημαίνει η ερευνητική ομάδα.

Δεν σημαίνει ότι η AI δεν πρέπει να χρησιμοποιείται στην Υγεία

Τα αποτελέσματα δεν αποτελούν επιχείρημα για την απόρριψη της Τεχνητής Νοημοσύνης από την ιατρική.

Αντιθέτως, οι ερευνητές επισημαίνουν την ανάγκη τα συστήματα αυτά να εντάσσονται στην κλινική πράξη με συνεχή αξιολόγηση, ανθρώπινη εποπτεία και συστηματικούς ελέγχους για μεροληψία.

Η δυνατότητα των LLMs να επεξεργάζονται μεγάλες ποσότητες πληροφοριών και να υποστηρίζουν επαγγελματίες Υγείας είναι σημαντική.

Αλλά οι απαντήσεις τους δεν πρέπει να αντιμετωπίζονται σαν ουδέτερη ή αλάνθαστη αναπαράσταση της ιατρικής πραγματικότητας.

«Απαραίτητη η συνεχής παρακολούθηση»

Ο καθηγητής Michael Sorich τονίζει ότι παρά τις βελτιωμένες δυνατότητες συλλογισμού, τα κλινικά αποτελέσματα τόσο του o3-mini όσο και του DeepSeek-R1 εξακολουθούσαν να εμφανίζουν στερεοτυπικές συνδέσεις ανάμεσα σε ασθένειες, φυλή και φύλο.

Οι ερευνητές θεωρούν ότι οι επαγγελματίες Υγείας και οι οργανισμοί που υιοθετούν τέτοια συστήματα πρέπει να γνωρίζουν ότι τα μοντέλα μπορεί να έχουν δημογραφικές «προεπιλογές» στις απαντήσεις τους.

«Η επίγνωση αυτών των δημογραφικών προεπιλογών είναι απαραίτητη για την ασφαλή ενσωμάτωση των LLMs στις κλινικές ροές εργασίας και η συνεχής παρακολούθηση πιθανών προκαταλήψεων πρέπει να συνοδεύει την υιοθέτησή τους», καταλήγουν.

Τι δείχνει τελικά η μελέτη

Το βασικό μήνυμα της έρευνας είναι ότι ένα περισσότερο «έξυπνο» ή συλλογιστικά ισχυρό μοντέλο δεν είναι αυτομάτως και περισσότερο ουδέτερο.

Τα συστήματα Τεχνητής Νοημοσύνης μπορούν να αναπαράγουν στατιστικές συσχετίσεις, εκπαιδευτικά στερεότυπα και προκαταλήψεις που υπάρχουν μέσα στο ανθρώπινο υλικό από το οποίο έχουν μάθει.

Στην Υγεία, όμως, οι συνέπειες αυτού του φαινομένου μπορεί να είναι ιδιαίτερα σημαντικές.

Η πρόκληση για την επόμενη γενιά ιατρικής AI δεν είναι επομένως μόνο να δίνει καλύτερες απαντήσεις.

Είναι να δίνει απαντήσεις που είναι επιστημονικά ακριβείς, αντιπροσωπευτικές, ελέγξιμες και όσο το δυνατόν λιγότερο επηρεασμένες από δημογραφικά στερεότυπα.

Κάντε like στη σελίδα μας στο facebook για να μαθαίνετε όλα τα νέα

Διαβάστε επίσης 

Καρκίνος: Γιατί οι άνδρες διαγιγνώσκονται συχνότερα σε προχωρημένο στάδιο

NHS: Αύξηση των ρατσιστικών επιθέσεων από ασθενείς καταγγέλλουν οι εργαζόμενοι

- Advertisement -

ΣΧΕΤΙΚΑ ΑΡΘΡΑ

ΠΡΟΣΦΑΤΑ ΑΡΘΡΑ