Thèse Ensemble Robuste dans une Classification Prudente H/F - Doctorat.Gouv.Fr
- Compiègne - 60
- CDD
- Doctorat.Gouv.Fr
Les missions du poste
Établissement : Université de Technologie de Compiègne École doctorale : Sciences pour l'ingénieur Laboratoire de recherche : Heuristique et diagnostic des systèmes complexes Direction de la thèse : Vu Linh NGUYEN ORCID 0000000316424468 Début de la thèse : 2026-10-01 Date limite de candidature : 2026-12-31T23:59:59 L'un des principaux défis de l'apprentissage d'ensemble est la faible couverture au niveau individuel. Ce problème survient lorsque, pour une instance donnée, seuls quelques membres, voire aucun, de l'ensemble ne font de prédictions correctes. Par conséquent, l'information soutenant la classe correcte est souvent insuffisante pour qu'elle soit sélectionnée comme prédiction finale.Ce projet de thèse est consacré au développement d'un nouveau cadre d'apprentissage d'ensemble spécifiquement conçu pour pallier le problème de la faible couverture au niveau individuel. Nous autorisons les membres de l'ensemble à effectuer des prédictions ensemblistes afin d'améliorer simultanément la diversité et la précision, deux facteurs essentiels pour garantir de bonnes performances au niveau de la population. De plus, cette approche permet d'atténuer significativement le problème de la faible couverture au niveau individuel.Le candidat retenu devrait initialement être utilisé dans le cadre de la classification multiclasse. En fonction des progrès réalisés, le candidat pourra être invité ultérieurement à étendre le cadre à des contextes plus complexes, notamment la classification multi-label et la classification multidimensionnelle.Le candidat retenu sera accompagné dans l'utilisation de méthodes de pointe pour les prédictions ensemblistes dans ces tâches de classification, afin d'entraîner les membres de l'ensemble. Le problème de l'agrégation des prédictions des membres de l'ensemble en prédictions finales sera reformulé comme l'agrégation d'informations incomplètes et abordé à l'aide de résultats pertinents de la théorie de l'évidence. Les résultats de cette thèse seront traduits en articles scientifiques et en bibliothèques logicielles libres. Le cadre résultant sera évalué à l'aide d'ensembles de données de référence provenant de dépôts publics. Ensemble learning is a common practice to achieve robustness and improved generalization in machine learning [7]. In classification tasks, explored in this thesis project, ensemble learning typically consists of two phases: Generation and aggregation. The former trains a set of predictive models that seek a diversity accurateness trade-off. During the latter, for each instance, the predictions of predictive models are aggregated into the final prediction.Although conventional ensemble learning is advantageous in various application domains, the assumption that predictive models always produce singleton predictions, which should be, in turn, aggregated into a final singleton prediction, can lead to challenging problems in the presence of low coverage in ensemble aggregation. By low coverage, we refer to the scenario in which, for the current instance, only a minority or none of the predictive models provide the correct prediction. In fact, low coverage is difficult to handle given the voting nature of the aggregation phase [7], and may lead to an unsatisfactory correctness level of the final predictions.Low coverage is an issue even in the simple multiclass classification (MCC) setting, where one has to predict a single class variable. This issue is significantly amplified in the following more challenging classification tasks that require large data sets: multilabel classification (MLC), that is, predicting multiple binary variables simultaneously [5], and multidimensional classification (MDC), that is, predicting multiple categorical variables simultaneously [6]. We aim to construct a new ensemble learning framework, specifically designed to tackle the low coverage issue, aiming at both coverage and diversity. We aim to construct a new ensemble learning framework, specifically designed to tackle the low coverage issue, aiming at both coverage and diversity:- Generation: Train a set of set-valued classifiers [4, 5, 7] that seek both coverage, i.e., the true outcome is included in the set-valued predictions, and diversity.- Aggregation: For each instance, the set-valued predictions of predictive models are aggregated into the final prediction, which can be either a single outcome or a set of outcomes.We shall focus on addressing the two crucial questions:- Can we eventually achieve both coverage and diversity?- If so, how could these improvements translate into an enhanced predictive performance of the ensemble?We plan to generalize contributions on combining partial information following the evidential approach [1, 2, 3], and set-valued classification [4, 5, 7] to seek theoretically sound answers to these questions. We also plan to focus on the mathematical aspects of optimization problems to gain the scalability of the framework.
Le profil recherché
- Diplôme de Master 2 ou diplôme d'ingénieur avec une spécialisation en informatique.- Bonnes compétences en programmation (Python, PyTorch, TensorFlow, etc.) et/ou solides connaissances en mathématiques.- Autonomie, rigueur et esprit critique.