Aide au diagnostic Diagnostic Support
De l’étude fondatrice de 2017 aux dispositifs approuvés aujourd’hui : où en est réellement l’IA diagnostique en dermatologie. From the foundational 2017 study to today’s approved devices: where diagnostic AI in dermatology really stands.
Un champ de recherche en expansion rapide A rapidly expanding research field
L’aide au diagnostic est, historiquement, la première et la plus étudiée des applications de l’intelligence artificielle en dermatologie. En moins d’une décennie, le champ est passé d’une preuve de concept académique à des dispositifs commercialisés et réglementairement approuvés — une trajectoire qu’il est utile de retracer pour en comprendre les acquis réels et les limites persistantes. Diagnostic support is, historically, the first and most studied application of artificial intelligence in dermatology. In under a decade, the field has moved from an academic proof of concept to commercialized, regulatory-approved devices — a trajectory worth retracing to understand its real achievements and persistent limitations.
Origines : la preuve de concept de 2017 Origins: the 2017 proof of concept
L’essor de l’IA diagnostique en dermatologie est généralement daté de l’étude d’Esteva et al., publiée dans Nature en 2017. Les auteurs y entraînaient un réseau de neurones convolutif de bout en bout sur 129 450 images cliniques couvrant 2 032 diagnostics différents, et montraient que l’algorithme atteignait une compétence comparable à celle de 21 dermatologues certifiés pour distinguer lésions bénignes et malignes, kératoses et carcinomes, nævus et mélanomes. Cette étude, aujourd’hui citée plus de 11 000 fois, a servi de preuve de concept fondatrice pour tout le champ et a directement inspiré la constitution de jeux de données publics de grande taille (HAM10000, ISIC) qui structurent encore la recherche actuelle. The rise of diagnostic AI in dermatology is generally traced to the study by Esteva et al., published in Nature in 2017. The authors trained a convolutional neural network end-to-end on 129,450 clinical images covering 2,032 different diagnoses, and showed the algorithm achieved competence comparable to 21 board-certified dermatologists in distinguishing benign from malignant lesions, keratoses from carcinomas, and nevi from melanomas. This study, now cited more than 11,000 times, served as the founding proof of concept for the entire field and directly inspired the creation of large public datasets (HAM10000, ISIC) that still structure current research.
Des dispositifs désormais approuvés en clinique Devices now approved in clinical practice
Depuis, le passage du laboratoire à la clinique s’est concrétisé : une revue de 2025 publiée dans l’International Journal of Dermatology recense quinze dispositifs d’IA dermatologique approuvés par des autorités réglementaires à travers le monde, dont trois validés par la FDA aux États-Unis. Ces dispositifs sont principalement centrés sur la détection du mélanome et des carcinomes cutanés, et se répartissent entre systèmes matériels dédiés (dermatoscopes connectés) et applications logicielles autonomes utilisables sur smartphone. Since then, the move from lab to clinic has become concrete: a 2025 review published in the International Journal of Dermatology counts fifteen dermatology AI devices approved by regulatory authorities worldwide, including three FDA-approved systems in the US. These devices are primarily focused on detecting melanoma and skin carcinomas, split between dedicated hardware systems (connected dermatoscopes) and standalone software applications usable on smartphones.
Ce que disent les méta-analyses What the meta-analyses show
Les données de performance restent toutefois à interpréter avec prudence méthodologique. Une méta-analyse portant sur plus de 70 000 images de test rapporte une sensibilité regroupée de 0,91 (IC95% 0,74-0,97) mais une spécificité de seulement 0,64 (IC95% 0,47-0,78), soit une aire sous la courbe ROC de 0,88 — avec une hétérogénéité substantielle selon que les images sont cliniques, dermoscopiques ou prises au smartphone. Une seconde méta-analyse, comparant directement l’IA aux cliniciens sur la classification des cancers cutanés à partir de 53 études systématiquement revues (dont 19 incluses dans l’analyse quantitative finale), ne démontre pas de supériorité systématique de l’IA en conditions réelles : les performances sont globalement comparables, avec une variabilité importante selon le niveau d’expertise du clinicien de référence utilisé comme comparateur. Performance data still warrant methodological caution. A meta-analysis of more than 70,000 test images reports a pooled sensitivity of 0.91 (95% CI 0.74-0.97) but a specificity of only 0.64 (95% CI 0.47-0.78), corresponding to an ROC-AUC of 0.88 — with substantial heterogeneity depending on whether images are clinical, dermoscopic, or smartphone-based. A second meta-analysis directly comparing AI to clinicians on skin cancer classification, drawing on 53 systematically reviewed studies (19 included in the final quantitative analysis), found no systematic AI superiority under real-world conditions: performance was broadly comparable, with notable variability depending on the expertise level of the reference clinician used as comparator.
Une revue systématique indépendante confirme la prudence de rigueur An independent systematic review confirms the need for caution
Une revue systématique publiée dans le BMJ dès 2020 sur les applications smartphone de dépistage du risque de cancer cutané concluait déjà que la qualité méthodologique des études de validation était globalement faible, avec un risque de biais de sélection important — nombre de ces applications étant évaluées sur des images sélectionnées a posteriori plutôt que sur des cohortes prospectives représentatives de la pratique réelle. Cette mise en garde méthodologique reste largement d’actualité pour les dispositifs plus récents. A systematic review published in the BMJ as early as 2020 on smartphone applications for skin cancer risk screening already concluded that the methodological quality of validation studies was generally poor, with significant selection bias risk — many of these applications being evaluated on retrospectively selected images rather than prospective cohorts representative of real-world practice. This methodological warning remains largely relevant to more recent devices.
Un accès élargi, mais pas encore équitable Wider access, but not yet equitable
Une revue systématique de 2025 centrée sur les pays à revenu faible ou intermédiaire souligne le potentiel de ces outils pour pallier la pénurie de dermatologues dans les régions sous-médicalisées, tout en rappelant que la majorité des modèles évalués restent entraînés sur des populations et des contextes d’acquisition d’image très différents de ceux où leur déploiement serait le plus utile — un enjeu directement lié à la question de l’équité algorithmique traitée par ailleurs sur ce site. A 2025 systematic review focused on low- and middle-income countries highlights the potential of these tools to offset dermatologist shortages in underserved regions, while noting that most evaluated models remain trained on populations and image-acquisition contexts very different from those where their deployment would be most useful — an issue directly connected to the algorithmic equity question addressed elsewhere on this site.
En pratique In practice
Ces résultats convergent vers une conclusion prudente : l’IA diagnostique dermatologique a franchi un cap réglementaire réel depuis 2017, mais ses performances restent hétérogènes et dépendantes du contexte d’acquisition des images, ainsi que de la rigueur méthodologique des études de validation. Cela justifie son usage actuel comme outil d’aide à la décision — en triage ou en second avis, en complément de l’examen clinique — plutôt que comme dispositif de diagnostic autonome. These findings converge on a cautious conclusion: diagnostic AI in dermatology has crossed a real regulatory threshold since 2017, but its performance remains heterogeneous and dependent on image-acquisition context, as well as on the methodological rigor of validation studies. This supports its current use as a decision-support tool — for triage or second opinion, alongside clinical examination — rather than as a standalone diagnostic device.