Thèse Compromis dans l'Apprentissage Adversiel Tatoué et Efficace H/F - Doctorat.Gouv.Fr
- Paris - 75
- CDD
- Doctorat.Gouv.Fr
Les missions du poste
Établissement : Institut Polytechnique de Paris École polytechnique École doctorale : Mathématiques Hadamard Laboratoire de recherche : CMAP - Centre de Mathématiques appliquées Direction de la thèse : El Mahdi EL MHAMDI ORCID 0000000150411260 Début de la thèse : 2026-11-01 Date limite de candidature : 2026-10-14T23:59:59 L'apprentissage automatique est aujourd'hui déployé dans des environnements qui peuvent être adversiaux par nature. Les enjeux géopolitiques, la désinformation, le vol de données, la compétition industrielle ou encore les problématiques de cybersécurité conduisent à des situations dans lesquelles les différents acteurs ne peuvent pas nécessairement se faire confiance. Les données utilisées pour l'apprentissage peuvent notamment être volontairement manipulées ou empoisonnées, avec pour objectif d'influencer le comportement du modèle appris.
Parallèlement, l'augmentation de la taille des modèles et le développement de l'apprentissage à grande échelle posent des problèmes croissants d'efficacité. Les coûts de communication, mais également les coûts de calcul local, peuvent devenir importants. Des techniques de compression sont notamment utilisées afin de réduire ces coûts et de permettre un apprentissage plus efficace.
Une troisième problématique concerne la vérification de la propriété des données, ou Data Ownership Verification (DoV). L'objectif est de permettre à un propriétaire de vérifier qu'un ensemble de données a effectivement été utilisé pour entraîner un modèle. Une approche consiste à introduire dans les données une signature destinée à se propager au modèle au cours de l'apprentissage. De manière intéressante, des techniques de data poisoning, habituellement considérées sous l'angle adversarial, peuvent ainsi être utilisées de manière ciblée et contrôlée comme mécanisme de tatouage numérique des données.
La question centrale de cette thèse est d'étudier les compromis entre ces trois dimensions : peut-on construire des méthodes à la fois robustes dans un contexte adversarial, permettant de mettre en oeuvre des techniques de Data Ownership Verification, tout en utilisant des outils d'apprentissage efficace tels que la compression ? Il s'agira en particulier de comprendre comment ces différentes propriétés interagissent et dans quelle mesure elles peuvent être satisfaites simultanément.
Un premier projet, déjà engagé, porte sur SignSGD, une technique classique de compression pour l'apprentissage automatique distribué. Ce travail étudie dans quelle mesure SignSGD peut être démontré robuste au sens de la tolérance aux fautes byzantines (BFT). Il constitue un premier cas d'étude de l'interaction entre compression et contexte adversiel, avant d'étudier plus largement les compromis entre apprentissage adversarial, vérification de la propriété des données et apprentissage efficace. chaire ATLAS
vol des données par les grandes entreprises
Le profil recherché
Thèse destinée à Arthur Danjou qui a effectué son stage de M2 sous la supervision d'El Mahdi El Mhamdi avec un co-encadrement par Peva Blanchard (co-auteur de l'article le plus cité dans l'apprentissage distribué robuste) et Sébastien Rouault (co-auteur du second article le plus cité dans le même domaine), ces deux personnes seront impliqué dans le co-encadrement de la thèse.
Le stage a permis de vérifier la compatibilité du candidat avec l'équipe et la thématique et tout le monde est très satisfait des compétences d'Arthur qui est le profil idéal pour cette thèse.
Le stage a permis de vérifier la compatibilité du candidat avec l'équipe et la thématique et tout le monde est très satisfait des compétences d'Arthur qui est le profil idéal pour cette thèse.