Un champ de recherche en expansion rapide

L’aide au diagnostic est, historiquement, la première et la plus étudiée des applications de l’intelligence artificielle en dermatologie. En moins d’une décennie, le champ est passé d’une preuve de concept académique à des dispositifs commercialisés et réglementairement approuvés — une trajectoire qu’il est utile de retracer pour en comprendre les acquis réels et les limites persistantes.

Origines : la preuve de concept de 2017

L’essor de l’IA diagnostique en dermatologie est généralement daté de l’étude d’Esteva et al., publiée dans Nature en 2017. Les auteurs y entraînaient un réseau de neurones convolutif de bout en bout sur 129 450 images cliniques couvrant 2 032 diagnostics différents, et montraient que l’algorithme atteignait une compétence comparable à celle de 21 dermatologues certifiés pour distinguer lésions bénignes et malignes, kératoses et carcinomes, nævus et mélanomes. Cette étude, aujourd’hui citée plus de 11 000 fois, a servi de preuve de concept fondatrice pour tout le champ et a directement inspiré la constitution de jeux de données publics de grande taille (HAM10000, ISIC) qui structurent encore la recherche actuelle.

Des dispositifs désormais approuvés en clinique

Depuis, le passage du laboratoire à la clinique s’est concrétisé : une revue de 2025 publiée dans l’International Journal of Dermatology recense quinze dispositifs d’IA dermatologique approuvés par des autorités réglementaires à travers le monde, dont trois validés par la FDA aux États-Unis. Ces dispositifs sont principalement centrés sur la détection du mélanome et des carcinomes cutanés, et se répartissent entre systèmes matériels dédiés (dermatoscopes connectés) et applications logicielles autonomes utilisables sur smartphone.

Ce que disent les méta-analyses

Les données de performance restent toutefois à interpréter avec prudence méthodologique. Une méta-analyse portant sur plus de 70 000 images de test rapporte une sensibilité regroupée de 0,91 (IC95% 0,74-0,97) mais une spécificité de seulement 0,64 (IC95% 0,47-0,78), soit une aire sous la courbe ROC de 0,88 — avec une hétérogénéité substantielle selon que les images sont cliniques, dermoscopiques ou prises au smartphone. Une seconde méta-analyse, comparant directement l’IA aux cliniciens sur la classification des cancers cutanés à partir de 53 études systématiquement revues (dont 19 incluses dans l’analyse quantitative finale), ne démontre pas de supériorité systématique de l’IA en conditions réelles : les performances sont globalement comparables, avec une variabilité importante selon le niveau d’expertise du clinicien de référence utilisé comme comparateur.

Une revue systématique indépendante confirme la prudence de rigueur

Une revue systématique publiée dans le BMJ dès 2020 sur les applications smartphone de dépistage du risque de cancer cutané concluait déjà que la qualité méthodologique des études de validation était globalement faible, avec un risque de biais de sélection important — nombre de ces applications étant évaluées sur des images sélectionnées a posteriori plutôt que sur des cohortes prospectives représentatives de la pratique réelle. Cette mise en garde méthodologique reste largement d’actualité pour les dispositifs plus récents.

Un accès élargi, mais pas encore équitable

Une revue systématique de 2025 centrée sur les pays à revenu faible ou intermédiaire souligne le potentiel de ces outils pour pallier la pénurie de dermatologues dans les régions sous-médicalisées, tout en rappelant que la majorité des modèles évalués restent entraînés sur des populations et des contextes d’acquisition d’image très différents de ceux où leur déploiement serait le plus utile — un enjeu directement lié à la question de l’équité algorithmique traitée par ailleurs sur ce site.

En pratique

Ces résultats convergent vers une conclusion prudente : l’IA diagnostique dermatologique a franchi un cap réglementaire réel depuis 2017, mais ses performances restent hétérogènes et dépendantes du contexte d’acquisition des images, ainsi que de la rigueur méthodologique des études de validation. Cela justifie son usage actuel comme outil d’aide à la décision — en triage ou en second avis, en complément de l’examen clinique — plutôt que comme dispositif de diagnostic autonome.