Éthique & limites Ethics & Limits
Le biais des algorithmes sur les peaux foncées, documenté chiffres à l’appui, reste le principal défi éthique de l’IA dermatologique. Algorithmic bias on darker skin, documented with hard numbers, remains the main ethical challenge for dermatology AI.
Un enjeu qui dépasse la seule performance technique An issue that goes beyond technical performance alone
L’intégration de l’intelligence artificielle en dermatologie soulève une question qui déborde largement le seul terrain technique : celle de l’équité de ses performances selon les populations. Cette question a pris une dimension concrète et mesurable à partir de 2021, lorsque plusieurs équipes de recherche ont commencé à documenter, avec des chiffres précis, l’ampleur des écarts de performance entre phototypes. Integrating artificial intelligence into dermatology raises a question that extends well beyond technical performance: the fairness of its results across populations. This question took on a concrete, measurable dimension starting in 2021, when several research teams began documenting, with precise figures, the extent of performance gaps between phototypes.
Un déficit de représentation documenté depuis 2021 An underrepresentation documented since 2021
Une revue de portée publiée en 2021 dans JAMA Dermatology par Daneshjou et al. a mis en évidence un manque de transparence et un biais potentiel dans les jeux de données et algorithmes d’IA en dermatologie. Les auteurs y montrent que la grande majorité des bases d’images publiques utilisées pour entraîner ces modèles — y compris des références largement citées comme HAM10000 — ne documentent pas systématiquement la répartition des phototypes de Fitzpatrick de leurs images, et que celles qui le font sous-représentent fortement les phototypes IV à VI. A scoping review published in 2021 in JAMA Dermatology by Daneshjou et al. identified a lack of transparency and potential bias in dermatology AI datasets and algorithms. The authors showed that the vast majority of public image datasets used to train these models — including widely cited references such as HAM10000 — do not systematically document the Fitzpatrick phototype distribution of their images, and that those that do substantially underrepresent phototypes IV to VI.
Des écarts de performance chiffrés sur un jeu de données dédié Quantified performance gaps on a dedicated dataset
Pour objectiver ce constat au-delà de la seule absence de documentation, la même équipe a constitué le jeu de données DDI (Diverse Dermatology Images) — la première base d’images publique, expertement curée et confirmée histologiquement par biopsie, incluant une diversité réelle de phototypes. Publiée dans Science Advances en 2022, cette étude a testé sur ces 656 images les modèles d’IA dermatologique les plus cités : leur aire sous la courbe ROC chute de 27 à 36 % par rapport à leurs résultats originaux annoncés. To move beyond the mere absence of documentation, the same team built the DDI (Diverse Dermatology Images) dataset — the first publicly available, expertly curated image dataset with biopsy-confirmed diagnoses spanning genuinely diverse phototypes. Published in Science Advances in 2022, this study tested the most widely cited dermatology AI models on these 656 images: their ROC-AUC dropped by 27-36% compared to their originally reported results.
Le détail par algorithme est particulièrement parlant : DeepDerm (développé à Stanford) affiche une sensibilité de 0,69 sur peau claire contre seulement 0,23 sur peau foncée — un facteur 3 environ. ModelDerm, entraîné sur une population mixte caucasienne et asiatique, passe de 0,41 à 0,12 dans les mêmes conditions. Ces écarts reflètent la sous-représentation des phototypes foncés dans les données d’entraînement plutôt qu’une limite méthodologique intrinsèque des algorithmes eux-mêmes. The per-algorithm breakdown is particularly telling: DeepDerm (developed at Stanford) shows a sensitivity of 0.69 on light skin versus just 0.23 on dark skin — roughly a threefold gap. ModelDerm, trained on a mixed Caucasian and Asian population, drops from 0.41 to 0.12 under the same conditions. These gaps reflect underrepresentation of darker phototypes in training data rather than an intrinsic methodological limit of the algorithms themselves.
Une piste de correction identifiée, pas une fatalité technologique An identified path to correction, not a technological dead end
Point déterminant pour la suite : ce même travail montre qu’un ré-entraînement (fine-tuning) des modèles sur des images diversifiées referme largement l’écart de performance entre phototypes clairs et foncés, et peut même conduire certains algorithmes à surpasser les dermatologues pour l’identification de lésions malignes sur peau foncée. Le biais observé est donc avant tout un problème de représentativité des données, et non un plafond technologique indépassable — un message porteur d’espoir, à condition que la constitution de jeux de données diversifiés devienne une priorité et non une option. Critically, the same study shows that fine-tuning models on diverse images largely closes the performance gap between lighter and darker phototypes, and can even lead some algorithms to outperform dermatologists at identifying malignancy on dark skin. The observed bias is therefore primarily a data-representativeness problem, not an insurmountable technological ceiling — an encouraging message, provided that building diverse datasets becomes a priority rather than an afterthought.
Un problème qui dépasse la seule dermatologie A problem that extends beyond dermatology alone
Ce constat n’est pas isolé à la dermatologie. Une étude de référence publiée dans Science en 2019 par Obermeyer et al. a mis en évidence un biais racial dans un algorithme largement utilisé aux États-Unis pour orienter des millions de patients vers des programmes de soins complémentaires : à niveau de risque égal, les patients noirs étaient en réalité significativement plus malades que les patients blancs. Ce biais provenait du choix du coût des soins passés comme indicateur des besoins de santé — un proxy biaisé, puisque moins d’argent est historiquement dépensé pour des patients noirs à état de santé équivalent. Corriger cette variable a réduit le biais de 84 %, et aurait porté la part de patients noirs orientés vers une aide renforcée de 17,7 % à 46,5 % si elle avait été appliquée d’emblée. Cet exemple, bien qu’extérieur à la dermatologie, illustre un mécanisme générique : le biais d’un algorithme de santé reflète presque toujours un biais dans le choix des données ou des proxys utilisés pour l’entraîner, pas une intention malveillante. This finding is not isolated to dermatology. A landmark study published in Science in 2019 by Obermeyer et al. identified racial bias in an algorithm widely used in the US to direct millions of patients toward complementary care programs: at an equal risk score, Black patients were in fact significantly sicker than white patients. This bias stemmed from using past healthcare costs as a proxy for health needs — a biased proxy, since historically less money has been spent on Black patients with equivalent health status. Correcting this variable reduced the bias by 84%, and would have raised the share of Black patients directed to enhanced care from 17.7% to 46.5% had it been applied from the outset. This example, though outside dermatology, illustrates a generic mechanism: bias in a health algorithm almost always reflects a bias in the data or proxy chosen to train it, not malicious intent.
Un cadre méthodologique désormais disponible A methodological framework now available
Face à ces constats, l’International Skin Imaging Collaboration (ISIC) a publié en 2022 les lignes directrices CLEAR Derm (Checklist for Evaluation of Artificial Intelligence Reports in Dermatology), qui formalisent les éléments qu’un rapport de recherche en IA dermatologique doit documenter pour être jugé fiable : composition démographique et répartition des phototypes du jeu de données d’entraînement et de test, méthode de confirmation diagnostique des images (biopsie ou non), et performance rapportée séparément par sous-groupe plutôt qu’en moyenne globale. Ce type de grille de lecture permet désormais aux cliniciens et aux revues scientifiques d’évaluer un algorithme au-delà du seul chiffre de performance globale mis en avant par ses concepteurs. In response to these findings, the International Skin Imaging Collaboration (ISIC) published the CLEAR Derm guidelines (Checklist for Evaluation of Artificial Intelligence Reports in Dermatology) in 2022, formalizing what a dermatology AI research report must document to be considered reliable: the demographic composition and phototype distribution of training and test datasets, the method used to confirm diagnoses (biopsy or not), and performance reported separately by subgroup rather than as a single overall figure. This type of framework now allows clinicians and journals to evaluate an algorithm beyond the single headline performance figure highlighted by its developers.
L’autre versant : l’acceptabilité par les patients The other side: patient acceptance
Sur le plan de l’acceptabilité, une revue narrative portant sur 48 articles relatifs aux perspectives des patients sur l’IA et la télémédecine en dermatologie, publiée en 2025, rapporte une réticence significative envers un diagnostic entièrement automatisé sans implication d’un dermatologue — quel que soit le niveau de performance technique affiché par l’algorithme. Cette réticence varie toutefois selon l’âge, le motif de consultation et l’exposition préalable aux outils numériques, ce qui plaide pour une communication adaptée plutôt qu’un rejet ou une adoption uniformes. On acceptability, a 2025 narrative review of 48 articles on patient perspectives on AI and telemedicine in dermatology reports significant reluctance toward a fully automated diagnosis without dermatologist involvement — regardless of the algorithm’s stated technical performance. This reluctance varies, however, by age, reason for consultation, and prior exposure to digital tools, arguing for tailored communication rather than uniform rejection or adoption.
Conclusion et perspectives Conclusion and outlook
Ces constats convergent vers une exigence commune : le déploiement de l’IA en dermatologie doit rester encadré par des jeux de données représentatifs, audités selon des grilles de lecture explicites comme CLEAR Derm, et systématiquement associé à un jugement clinique humain. La bonne nouvelle, documentée par les données de fine-tuning du jeu DDI, est que ce biais n’est pas une impasse technologique — c’est un choix de priorité dans la constitution des données, qui reste entièrement entre les mains des équipes de recherche et des régulateurs. These findings point to a shared requirement: deploying AI in dermatology must remain governed by representative datasets, audited against explicit frameworks such as CLEAR Derm, and systematically paired with human clinical judgment. The encouraging news, documented by the DDI fine-tuning data, is that this bias is not a technological dead end — it is a data-priority choice, one that remains entirely within the hands of research teams and regulators.