RECHERCHE
ClinFusion : un MLLM centré vision pour la compréhension médicale globale
Un nouveau modèle multimodal médical unifie imagerie 2D/3D et surpasse GPT-5.2 et Gemini-3-Flash sur la plupart des benchmarks testés.
arXiv cs.AI · cs.LG · cs.CL·Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu·27 juillet 2026
ClinFusion propose un encodeur visuel en cascade capable de traiter conjointement des images médicales 2D et 3D natives, ainsi qu'un cadre d'évaluation ancré dans la pratique clinique (MedIF-Bench, évaluation par région d'intérêt). Le modèle établit un nouvel état de l'art sur 20 des 24 benchmarks médicaux multimodaux testés, devançant des modèles open-source comme Hulu-Med et Lingshu, ainsi que des modèles propriétaires comme GPT-5.2 et Gemini-3-Flash sur 13 des 16 comparaisons.