Thèse Modèles de Langage Multimodaux Compacts pour l'Extraction d'Informations Sémantiques dans le Domaine Médical H/F - Doctorat.Gouv.Fr
- Avignon - 84
- CDD
- Doctorat.Gouv.Fr
Les missions du poste
Établissement : Avignon Université École doctorale : Agrosciences et Sciences Laboratoire de recherche : LIA - Laboratoire d'Informatique d'Avignon Direction de la thèse : Mickaël ROUVIER Début de la thèse : 2026-09-01 Date limite de candidature : 2026-08-31T23:59:59 Les modèles de langage multimodaux récents sont désormais capables de traiter conjointement du texte, de la parole et différents types de signaux audio. Des approches telles que SpeechGPT [1], AudioPaLM [2] ou SALMONN [3] ont notamment montré qu'il était possible d'étendre les capacités des grands modèles de langage à la compréhension et à la génération de la parole. Cependant, ces architectures restent généralement coûteuses en mémoire, en calcul et en énergie, ce qui limite leur déploiement local sur des équipements disposant de ressources réduites.Cette thèse vise à concevoir des modèles de langage multimodaux compacts capables d'analyser des documents médicaux contenant du texte et de la parole, afin d'en extraire automatiquement des informations sémantiques pertinentes. Les travaux porteront sur la représentation et la fusion des différentes modalités, ainsi que sur la conception d'architectures adaptées au traitement de données médicales multimodales. Une attention particulière sera accordée à la réduction de la taille et du coût de calcul des modèles, en s'appuyant notamment sur des architectures compactes telles que MobileLLM [4] ou TinyLlama [5].Des méthodes de compression, de quantification, de distillation de connaissances et d'adaptation efficace des paramètres seront étudiées. Des techniques de quantification à faible précision, telles qu'AWQ [6], pourront notamment être exploitées afin de faciliter le déploiement des modèles sur des smartphones ou d'autres dispositifs à ressources limitées. Une exécution locale permettrait de réduire les temps de traitement, de limiter la transmission des informations sensibles vers des infrastructures distantes et de renforcer la confidentialité des données de santé.Les modèles développés devront également être robustes à des données incomplètes, bruitées, hétérogènes ou issues de contextes cliniques variés. Leurs performances seront évaluées sur différentes tâches d'extraction d'informations, de compréhension de documents médicaux et de traitement multimodal de la parole. Enfin, les travaux étudieront les compromis entre précision, taille des modèles, coût de calcul, consommation énergétique, explicabilité et protection des données médicales. La personne rejoindra l'équipe Speech and Language Group (SLG) du Laboratoire Informatique d'Avignon et disposera de tous les matériels techniques nécessaires pour mener à bien ses travaux de recherche. Elle disposera d'un ordinateur personnel et d'un accès au cluster de calcul du LIA.
Le profil recherché
Le candidat retenu devra être titulaire d'un Master en informatique (ou équivalent) et avoir une expérience solide en apprentissage automatique et/ou traitement automatique de la parole. Il devra également maîtriser l'anglais tant à l'oral qu'à l'écrit. Nous recherchons des candidats fortement motivés.The candidate should have a Master's degree in computer science (or equivalent) and have a solid background in machine learning and/or automatic speech processing. He must also be fluent in English both orally and in writing. We are looking for highly motivated candidates.