Thèse Modèles de Fondation Tabulaires pour les Données Hétérogènes H/F - Doctorat.Gouv.Fr
- Paris - 75
- CDD
- Doctorat.Gouv.Fr
Les missions du poste
Établissement : Institut Polytechnique de Paris École polytechnique École doctorale : Ecole Doctorale de l'Institut Polytechnique de Paris Laboratoire de recherche : Centre INRIA Saclay - Île-de-France Direction de la thèse : Marine LE MORVAN ORCID 000000019899221X Début de la thèse : 2026-11-01 Date limite de candidature : 2026-10-31T23:59:59 Les modèles de fondation tabulaires (Tabular Foundation Models, TFMs) exploitant l'apprentissage en contexte (In-Context Learning), tels que TabICL et TabPFN, ont récemment remis en question la domination des arbres de décision boostés par gradient sur les données tabulaires. Cependant, les TFMs actuels à l'état de l'art sont limités aux données numériques et rencontrent des difficultés pour traiter nativement des variables hétérogènes telles que le texte, les dates et les identifiants catégoriels.
Ce projet de thèse vise à dépasser cette limitation en concevant la prochaine génération de TFMs capables de traiter des données tabulaires de types mixtes. Le défi central consiste à développer de nouveaux générateurs de données synthétiques de pré-entraînement adaptés à ces différents types de données, à faire évoluer l'architecture lorsque cela est nécessaire en fonction de la nature des données, et à comprendre comment des tokens présentant des géométries fondamentalement différentes peuvent interagir au sein d'une même architecture. Tabular data, where rows represent individual observa- tions and columns represent features, is a very common data type across various domains. For the last decade, supervised learning on tabular data has been dominated by gradient-boosted trees. However, a major paradigm shift has recently occurred with the advent of Tabular Foun- dation Models (TFMs) leveraging In-Context Learning (ICL). By processing a context of labeled samples (Xtrain,ytrain) and unlabeled queries Xtest in a single forward pass, these pretrained Transformers can now offer state-of-the-art predictions without the need for per-dataset training and hyperparameter tuning. This approach was pioneered by TabPFN (Hollmann et al., 2022) and later scaled up with TabPFNv2 (Hollmann et al., 2025). Concurrently, our team intro- duced TabICL (Qu et al., 2025), followed by TabICLv2 (Qu et al., 2026), which outperforms TabPFNv2.5 on major benchmarks while being fully open-source and computationally more efficient. TabICL has gained significant traction with a rapid adoption, establishing a strong foundation for future TFM research, including from academia.
While TFMs like TabPFN and TabICL excel on purely numerical data, real-world datasets are inherently heterogeneous, often mixing numerical features with text, categorical variables, dates, and identifiers (IDs). Currently, these models lack native support for such mixed-type data. The core objective of this PhD is to design the next generation of open-source tabular foundation models capable of natively and efficiently process- ing non-numerical features, unlocking the rich semantic information they contain for downstream predictive tasks. A key scientific challenge is to understand how heterogeneous embeddings (nu- merical, textual, categorical), which give rise to tokens with different geometries and information content, can be jointly processed within a single in-context learning architecture.
Le profil recherché
Le candidat idéal doit être titulaire (ou être en voie d'obtention) d'un master en apprentissage automatique, informatique, mathématiques appliquées ou dans un domaine connexe, et démontrer de solides compétences dans les domaines suivants :
- Solides bases en apprentissage profond et bonne connaissance des modèles Transformer ainsi que de leurs mécanismes sous-jacents.
- Bonnes compétences en programmation (Python) et expérience pratique avec un framework d'apprentissage profond (PyTorch ou TensorFlow).
- Bon bagage mathématique (probabilités, statistiques, algèbre linéaire) et capacité à aborder les aspects théoriques du projet.
- Intérêt marqué pour la conduite de travaux de recherche de manière autonome, la rédaction d'articles scientifiques de qualité et la production de code open source partageable sur GitHub.
- Solides bases en apprentissage profond et bonne connaissance des modèles Transformer ainsi que de leurs mécanismes sous-jacents.
- Bonnes compétences en programmation (Python) et expérience pratique avec un framework d'apprentissage profond (PyTorch ou TensorFlow).
- Bon bagage mathématique (probabilités, statistiques, algèbre linéaire) et capacité à aborder les aspects théoriques du projet.
- Intérêt marqué pour la conduite de travaux de recherche de manière autonome, la rédaction d'articles scientifiques de qualité et la production de code open source partageable sur GitHub.