Recrutement Doctorat.Gouv.Fr

Thèse Apprentissage par Renforcement Profond Basé Modèle pour la Commande de Drones avec Intégration de Connaissances Physiques a Priori H/F - Doctorat.Gouv.Fr

  • Paris - 75
  • CDD
  • Doctorat.Gouv.Fr
Publié le 16 septembre 2026
Postuler sur le site du recruteur

Les missions du poste


Établissement : Université Paris-Saclay GS Sciences de l'ingénierie et des systèmes École doctorale : Sciences et Technologies de l'Information et de la Communication Laboratoire de recherche : ONERA - Département Traitement de l'information et systèmes Direction de la thèse : Julien MARZAT ORCID 000000025041272X Début de la thèse : 2026-11-01 Date limite de candidature : 2026-11-30T23:59:59 Concevoir et évaluer des méthodes d'apprentissage par renforcement profond basées-modèle et hybrides (modèle physique a priori + composante apprise) pour la commande autonome de drones ou robots, en intégrant explicitement des connaissances physiques afin d'améliorer l'échantillonnage, la robustesse, la sécurité et la transférabilité des politiques de contrôle. - Model-free deep RL : succès sur tâches complexes mais coûteux en données et peu sûrs pour expérimentation réelle.
- Model-based RL (MBRL) : utilise un modèle appris de la dynamique pour planifier et réduire le besoin d'échantillons ; exemples récents : PETS (probabilistic ensembles with trajectory sampling), TD-MPC (Temporal Difference Model Predictive Control).
- Modélisation hybride : combiner un modèle physique partiel avec une composante apprise est une tendance récente (physics-informed ML, hybrid identification).
- Applications drone : premiers résultats sur voilure fixe avec TD-MPC, mais sans intégration explicite de physique a priori.
- Techniques associées : RNN, Deep State Space Models pour dépendances temporelles longues ; Experience Replay (HER, bio-inspired ER) pour améliorer la sample efficiency. Simulateurs et benchmarks existants (Gymnasium, Isaac)
- Limitations actuelles : erreurs accumulées sur prédictions longues, incertitudes mal calibrées, temps de calcul parfois incompatible avec le contrôle temps réel.
- Efficacité d'échantillonnage : les approches deep RL standard demandent beaucoup d'interactions (temps d'entraînement élevé) ; nécessité d'accélérer l'apprentissage sur systèmes réels.
- Sécurité et exploration : explorations non contrôlées peuvent produire des manoeuvres dangereuses pour la plateforme et son environnement.
- Prédiction sur un long horizon spatial ou temporel : difficulté à prédire correctement quand la dynamique contient des constantes de temps différentes (ex. attitude vs guidage).
- Robustesse à l'observabilité partielle.
- Généralisation : méthode applicable à plusieurs tâches et types de robots, tolérante incertitudes paramétriques.

Le profil recherché

Profil et compétences recherchées :
Master 2 Recherche ou Diplôme d'ingénieur avec spécialisation en apprentissage et/ou robotique
Bon niveau rédactionnel, bon niveau d'anglais, expérience et goût pour la recherche appliquée.

Compétences : Connaissances en apprentissage automatique, notamment en apprentissage par renforcement ; Expérience avec la modélisation et la commande de systèmes dynamiques ; Intérêt pour la robotique en particulier aérienne

Outils : TensorFlow, PyTorch, Programmation Objet (Python, C++)
Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Parcourir plus d'offres d'emploi