Thèse Consistance et Évaluation Empirique des Forêts Aléatoires dans des Champs Spatiaux Urbains Localement Stationnaires H/F - Doctorat.Gouv.Fr
- Compiègne - 60
- CDD
- Doctorat.Gouv.Fr
Les missions du poste
Établissement : Université de Technologie de Compiègne École doctorale : Sciences pour l'ingénieur Laboratoire de recherche : Laboratoire de mathématiques appliquées de Compiègne Direction de la thèse : Salim BOUZEBDA ORCID 0000000178014945 Début de la thèse : 2026-10-01 Date limite de candidature : 2026-11-22T23:59:59 Les forêts aléatoires, introduites par Leo Breiman, constituent aujourd'hui une méthode d'apprentissage statistique largement utilisée en raison de leurs remarquables performances prédictives et de leur grande flexibilité pour modéliser des relations complexes et non linéaires. Des travaux théoriques fondateurs, notamment ceux consacrés à la consistance des forêts aléatoires, ont permis d'établir des résultats de consistance dans des cadres reposant sur l'hypothèse d'observations indépendantes et identiquement distribuées (i.i.d.), ainsi que pour certaines classes de modèles de régression additive. Toutefois, ces hypothèses sont fréquemment mises en défaut dans les applications réelles, en particulier dans les contextes spatiaux et urbains, où les observations présentent généralement des structures de dépendance ainsi qu'une forte hétérogénéité spatiale.
Des avancées récentes, notamment dans les travaux portant sur les forêts aléatoires pour données spatialement dépendantes, ont permis d'étendre certains résultats de consistance à des situations dans lesquelles les observations sont corrélées dans l'espace. Ces contributions montrent que des estimateurs de type forêt aléatoire peuvent conserver des propriétés de consistance en présence de dépendance spatiale, sous des hypothèses appropriées sur la structure de cette dépendance. Néanmoins, ces résultats reposent le plus souvent sur l'hypothèse d'une fonction de régression globalement stationnaire, c'est-à-dire sur l'invariance, à travers l'espace, de la relation entre les variables explicatives et la variable réponse.
Or, les données urbaines sont intrinsèquement caractérisées par une importante hétérogénéité spatiale et par l'existence de structures locales au sein desquelles les relations entre variables peuvent varier d'une zone géographique à une autre. À titre d'exemple, l'influence de facteurs économiques, démographiques ou environnementaux sur un phénomène donné peut différer sensiblement d'un quartier à l'autre. De telles configurations sont plus naturellement décrites à l'aide de modèles de régression spatiale localement stationnaires, dans lesquels la fonction de régression est autorisée à évoluer progressivement et de manière régulière dans l'espace.
Malgré l'importance de ces situations dans de nombreuses applications contemporaines, il n'existe, à notre connaissance, aucun cadre théorique général permettant d'établir la consistance des estimateurs fondés sur les forêts aléatoires en présence simultanée de dépendance spatiale et d'hétérogénéité locale de la fonction de régression. Cette lacune limite la portée des garanties théoriques actuellement disponibles et leur transposition à des contextes spatiaux réalistes, notamment dans l'étude des phénomènes urbains.
L'objectif de ce projet de recherche est précisément de combler cette lacune en développant un cadre théorique et méthodologique unifié pour l'étude des forêts aléatoires dans des champs spatiaux localement stationnaires. Il s'agira, en particulier, d'établir des résultats de consistance pour des estimateurs de type forêt aléatoire lorsque les observations présentent à la fois une dépendance spatiale et une variation locale de la fonction de régression. Une attention particulière sera portée à la formulation des conditions probabilistes et statistiques permettant de garantir ces propriétés asymptotiques.
Le volet théorique sera complété par une étude empirique approfondie reposant sur des jeux de données urbaines réelles, afin d'évaluer la pertinence des résultats obtenus dans des configurations applicatives caractérisées par une forte hétérogénéité spatiale. Ce travail vise ainsi à établir un lien entre la théorie de l'apprentissage statistique, l'analyse des données spatiales et la science des données urbaines, tout en fournissant des garanties théoriques adaptées à l'utilisation des forêts aléatoires dans des environnements spatiaux complexes et non stationnaires.
This research aligns with the Department of Science and Technology's (DOST) Harmonized National Research and Development Agenda (HNRDA), particularly in Artificial Intelligence (AI), Data Science, and Socioeconomic Development. Its significance includes:
a)
Advancement of Statistical Learning Theory in Spatial Contexts: Extends existing consistency results (which account for spatial dependence) to more realistic settings involving local heterogeneity, thereby advancing the theoretical understanding of random forests.
b)
Improved Urban and Regional Modeling: Enhances modeling of spatial phenomena such as urban economic activity, crime distribution, housing markets, and regional inflation by incorporating location-specific relationships.
c)
Better Policy and Planning Support: Provides more accurate and spatially sensitive predictive tools for policymakers in urban planning and regional development.
d)
Enhanced Interpretability in Spatial Models: Facilitates understanding of how predictor-response relationships vary across space, improving interpretability and decision-making.
e)
Contribution to AI and Spatial Data Science: Bridges machine learning theory and spatial statistics, enabling robust modeling under both dependence and nonstationarity. i.
Theoretical Model Formulation
ii.
Development of Localized Random Forest Framework
iii.
Theoretical Analysis
iv.
Simulation Study
v.
Application to Urban or Regional Data
vi.
Model Evaluation and Validation
Des avancées récentes, notamment dans les travaux portant sur les forêts aléatoires pour données spatialement dépendantes, ont permis d'étendre certains résultats de consistance à des situations dans lesquelles les observations sont corrélées dans l'espace. Ces contributions montrent que des estimateurs de type forêt aléatoire peuvent conserver des propriétés de consistance en présence de dépendance spatiale, sous des hypothèses appropriées sur la structure de cette dépendance. Néanmoins, ces résultats reposent le plus souvent sur l'hypothèse d'une fonction de régression globalement stationnaire, c'est-à-dire sur l'invariance, à travers l'espace, de la relation entre les variables explicatives et la variable réponse.
Or, les données urbaines sont intrinsèquement caractérisées par une importante hétérogénéité spatiale et par l'existence de structures locales au sein desquelles les relations entre variables peuvent varier d'une zone géographique à une autre. À titre d'exemple, l'influence de facteurs économiques, démographiques ou environnementaux sur un phénomène donné peut différer sensiblement d'un quartier à l'autre. De telles configurations sont plus naturellement décrites à l'aide de modèles de régression spatiale localement stationnaires, dans lesquels la fonction de régression est autorisée à évoluer progressivement et de manière régulière dans l'espace.
Malgré l'importance de ces situations dans de nombreuses applications contemporaines, il n'existe, à notre connaissance, aucun cadre théorique général permettant d'établir la consistance des estimateurs fondés sur les forêts aléatoires en présence simultanée de dépendance spatiale et d'hétérogénéité locale de la fonction de régression. Cette lacune limite la portée des garanties théoriques actuellement disponibles et leur transposition à des contextes spatiaux réalistes, notamment dans l'étude des phénomènes urbains.
L'objectif de ce projet de recherche est précisément de combler cette lacune en développant un cadre théorique et méthodologique unifié pour l'étude des forêts aléatoires dans des champs spatiaux localement stationnaires. Il s'agira, en particulier, d'établir des résultats de consistance pour des estimateurs de type forêt aléatoire lorsque les observations présentent à la fois une dépendance spatiale et une variation locale de la fonction de régression. Une attention particulière sera portée à la formulation des conditions probabilistes et statistiques permettant de garantir ces propriétés asymptotiques.
Le volet théorique sera complété par une étude empirique approfondie reposant sur des jeux de données urbaines réelles, afin d'évaluer la pertinence des résultats obtenus dans des configurations applicatives caractérisées par une forte hétérogénéité spatiale. Ce travail vise ainsi à établir un lien entre la théorie de l'apprentissage statistique, l'analyse des données spatiales et la science des données urbaines, tout en fournissant des garanties théoriques adaptées à l'utilisation des forêts aléatoires dans des environnements spatiaux complexes et non stationnaires.
This research aligns with the Department of Science and Technology's (DOST) Harmonized National Research and Development Agenda (HNRDA), particularly in Artificial Intelligence (AI), Data Science, and Socioeconomic Development. Its significance includes:
a)
Advancement of Statistical Learning Theory in Spatial Contexts: Extends existing consistency results (which account for spatial dependence) to more realistic settings involving local heterogeneity, thereby advancing the theoretical understanding of random forests.
b)
Improved Urban and Regional Modeling: Enhances modeling of spatial phenomena such as urban economic activity, crime distribution, housing markets, and regional inflation by incorporating location-specific relationships.
c)
Better Policy and Planning Support: Provides more accurate and spatially sensitive predictive tools for policymakers in urban planning and regional development.
d)
Enhanced Interpretability in Spatial Models: Facilitates understanding of how predictor-response relationships vary across space, improving interpretability and decision-making.
e)
Contribution to AI and Spatial Data Science: Bridges machine learning theory and spatial statistics, enabling robust modeling under both dependence and nonstationarity. i.
Theoretical Model Formulation
ii.
Development of Localized Random Forest Framework
iii.
Theoretical Analysis
iv.
Simulation Study
v.
Application to Urban or Regional Data
vi.
Model Evaluation and Validation
Le profil recherché
Une connaissance des principales approches et méthodes d'apprentissage automatique (Machine Learning) est recommandée, ainsi que de bonnes compétences en programmation.