Segmentation d’anomalies sur scanner guidée par des comptes-rendus de radiologie : apports des modèles vision-langage
Poster Abstract

Objectifs

L’intelligence artificielle (IA) transforme la radiologie en assistant les médecins dans la détection et la segmentation de lésions sur les images. Ces modèles d’IA reposent sur de vastes ensembles de données, nécessitant un long et coûteux travail d’annotation manuel par des radiologues. Pourtant, les comptes-rendus de radiologie contiennent des informations qui pourraient guider les outils d’annotation automatique, par exemple la localisation et la taille des lésions en oncologie.

Le Visual Grounding (VG) désigne la capacité d’un modèle à établir des connexions entre une description textuelle et les régions d’intérêt correspondantes dans l’image. De nombreux modèles spécialisés dans le VG médical, reposant notamment sur des modèles de fondation multimodaux, permettent de détecter et de segmenter différentes régions anatomiques à partir de texte.

Nous proposons (i) une évaluation de ces modèles de l’état de l’art sur la tâche de segmentation d’anomalies sur images de scanner guidée par les rapports de radiologie et (ii) un pipeline de segmentation guidée par le texte.

Matériel et méthode

Nous introduisons une évaluation de ces modèles sur une tâche de détection et segmentation d’anomalies sur des CT-scans guidés par des extraits de comptes-rendus de radiologie sémantiquement riches. Pour cela, nous utilisons le jeu de données ReXGrounding-CT (Baharoon et al., 2025) comprenant des triplets CT-scan/segmentation/extraits de comptes-rendus de radiologie. Nous confrontons les modèles spécialisés pour le Visual Grounding médical à des modèles multimodaux textes-images généralistes et des modèles fondés sur l’information visuelle uniquement (Auto3DSeg (Cardoso et al., 2022)). Les modèles ont été évalués avec, dans un premier temps, le texte brut, tel que présent dans les comptes-rendus, puis avec des textes normalisés via un LLM (Large Language Model) pour se rapprocher des classes définies par les modèles. Plusieurs métriques ont été utilisées pour évaluer la pertinence de la segmentation (DICE, HIT5%) et de la détection (précision, rappel, f1-score).

Notre chaîne de traitements repose sur un modèle de segmentation d’anomalies couplé à un VLM (Vision‑Language Model), qui permet d’associer les segmentations aux éléments décrits dans le compte-rendu de radiologie. Les segmentations associées à une description textuelle seront sélectionnées alors que les autres, considérées comme des faux positifs, seront éliminées. 

Résultats

Les résultats préliminaires sur le jeu de validation de ReXGrounding-CT (Baharoon et al., 2025) sont les suivants : (i) en zéro-shot, les modèles spécialisés comme BioMedParse (Zhao et al., 2025), SAT (Zhao et al., 2025) ne sont pas robustes à des descriptions plus verbeuses ou à l’utilisation d’un vocabulaire ouvert ; (ii) après normalisation des descriptions, les performances n’augmentent que très peu. Leurs classes pré-définies restent trop limitées pour couvrir la diversité des éléments décrits dans les comptes rendus. (iii) les modèles entrainés sur une majorité d’images naturelles ne généralisent pas très bien sur des images hors-domaine.  

Conclusion

Même si leur capacité de localisation d’objets dans l’image reste limitée en imagerie médicale, les modèles vision-langage marquent un tournant dans l’intelligence artificielle appliquée à la radiologie en intégrant des données de natures différentes. 

Le Visual Grounding offre des perspectives prometteuses en radiologie en liant données visuelles et textuelles. Cependant, les modèles de l’état de l’art peinent encore à détecter précisément les lésions à partir des comptes-rendus de radiologie. Ce travail présente une évaluation de ces modèles et propose une chaîne de traitements de segmentation guidée par le texte appliquée à la segmentation de lésions sur des images de scanner.

Master, M2 Recherche d'Université ou thèse de Médecine ?

32332

Résumé suggéré en Radiologie Interventionnelle (RI)

32334