Un enjeu qui dépasse la seule performance technique

L’intégration de l’intelligence artificielle en dermatologie soulève une question qui déborde largement le seul terrain technique : celle de l’équité de ses performances selon les populations. Cette question a pris une dimension concrète et mesurable à partir de 2021, lorsque plusieurs équipes de recherche ont commencé à documenter, avec des chiffres précis, l’ampleur des écarts de performance entre phototypes.

Un déficit de représentation documenté depuis 2021

Une revue de portée publiée en 2021 dans JAMA Dermatology par Daneshjou et al. a mis en évidence un manque de transparence et un biais potentiel dans les jeux de données et algorithmes d’IA en dermatologie. Les auteurs y montrent que la grande majorité des bases d’images publiques utilisées pour entraîner ces modèles — y compris des références largement citées comme HAM10000 — ne documentent pas systématiquement la répartition des phototypes de Fitzpatrick de leurs images, et que celles qui le font sous-représentent fortement les phototypes IV à VI.

Des écarts de performance chiffrés sur un jeu de données dédié

Pour objectiver ce constat au-delà de la seule absence de documentation, la même équipe a constitué le jeu de données DDI (Diverse Dermatology Images) — la première base d’images publique, expertement curée et confirmée histologiquement par biopsie, incluant une diversité réelle de phototypes. Publiée dans Science Advances en 2022, cette étude a testé sur ces 656 images les modèles d’IA dermatologique les plus cités : leur aire sous la courbe ROC chute de 27 à 36 % par rapport à leurs résultats originaux annoncés.

Le détail par algorithme est particulièrement parlant : DeepDerm (développé à Stanford) affiche une sensibilité de 0,69 sur peau claire contre seulement 0,23 sur peau foncée — un facteur 3 environ. ModelDerm, entraîné sur une population mixte caucasienne et asiatique, passe de 0,41 à 0,12 dans les mêmes conditions. Ces écarts reflètent la sous-représentation des phototypes foncés dans les données d’entraînement plutôt qu’une limite méthodologique intrinsèque des algorithmes eux-mêmes.

Une piste de correction identifiée, pas une fatalité technologique

Point déterminant pour la suite : ce même travail montre qu’un ré-entraînement (fine-tuning) des modèles sur des images diversifiées referme largement l’écart de performance entre phototypes clairs et foncés, et peut même conduire certains algorithmes à surpasser les dermatologues pour l’identification de lésions malignes sur peau foncée. Le biais observé est donc avant tout un problème de représentativité des données, et non un plafond technologique indépassable — un message porteur d’espoir, à condition que la constitution de jeux de données diversifiés devienne une priorité et non une option.

Un problème qui dépasse la seule dermatologie

Ce constat n’est pas isolé à la dermatologie. Une étude de référence publiée dans Science en 2019 par Obermeyer et al. a mis en évidence un biais racial dans un algorithme largement utilisé aux États-Unis pour orienter des millions de patients vers des programmes de soins complémentaires : à niveau de risque égal, les patients noirs étaient en réalité significativement plus malades que les patients blancs. Ce biais provenait du choix du coût des soins passés comme indicateur des besoins de santé — un proxy biaisé, puisque moins d’argent est historiquement dépensé pour des patients noirs à état de santé équivalent. Corriger cette variable a réduit le biais de 84 %, et aurait porté la part de patients noirs orientés vers une aide renforcée de 17,7 % à 46,5 % si elle avait été appliquée d’emblée. Cet exemple, bien qu’extérieur à la dermatologie, illustre un mécanisme générique : le biais d’un algorithme de santé reflète presque toujours un biais dans le choix des données ou des proxys utilisés pour l’entraîner, pas une intention malveillante.

Un cadre méthodologique désormais disponible

Face à ces constats, l’International Skin Imaging Collaboration (ISIC) a publié en 2022 les lignes directrices CLEAR Derm (Checklist for Evaluation of Artificial Intelligence Reports in Dermatology), qui formalisent les éléments qu’un rapport de recherche en IA dermatologique doit documenter pour être jugé fiable : composition démographique et répartition des phototypes du jeu de données d’entraînement et de test, méthode de confirmation diagnostique des images (biopsie ou non), et performance rapportée séparément par sous-groupe plutôt qu’en moyenne globale. Ce type de grille de lecture permet désormais aux cliniciens et aux revues scientifiques d’évaluer un algorithme au-delà du seul chiffre de performance globale mis en avant par ses concepteurs.

L’autre versant : l’acceptabilité par les patients

Sur le plan de l’acceptabilité, une revue narrative portant sur 48 articles relatifs aux perspectives des patients sur l’IA et la télémédecine en dermatologie, publiée en 2025, rapporte une réticence significative envers un diagnostic entièrement automatisé sans implication d’un dermatologue — quel que soit le niveau de performance technique affiché par l’algorithme. Cette réticence varie toutefois selon l’âge, le motif de consultation et l’exposition préalable aux outils numériques, ce qui plaide pour une communication adaptée plutôt qu’un rejet ou une adoption uniformes.

Conclusion et perspectives

Ces constats convergent vers une exigence commune : le déploiement de l’IA en dermatologie doit rester encadré par des jeux de données représentatifs, audités selon des grilles de lecture explicites comme CLEAR Derm, et systématiquement associé à un jugement clinique humain. La bonne nouvelle, documentée par les données de fine-tuning du jeu DDI, est que ce biais n’est pas une impasse technologique — c’est un choix de priorité dans la constitution des données, qui reste entièrement entre les mains des équipes de recherche et des régulateurs.