Recrutement Doctorat.Gouv.Fr

Thèse Exploration Autotélique pour l'Évaluation Automatique de Grands Modèles d'IA Générative Découverte Adaptative et Cartographie des Capacités et Vulnérabilités H/F - Doctorat.Gouv.Fr

  • Bordeaux - 33
  • CDD
  • Doctorat.Gouv.Fr
Publié le 24 septembre 2026
Postuler sur le site du recruteur

Les missions du poste


Établissement : Université de Bordeaux École doctorale : Mathématiques et Informatique Laboratoire de recherche : Institut national de recherche en informatique et en automatique - Bordeaux - Sud-Ouest Direction de la thèse : Pierre-Yves OUDEYER Début de la thèse : 2026-10-01 Date limite de candidature : 2026-09-30T23:59:59 Contexte : L'équipe Flowers (Inria) est pionnière dans la recherche fondamentale sur l'apprentissage autotélique guidé par la curiosité et l'IA à finalité ouverte (Oudeyer et al., 2007 ; Colas et al., 2022 ; Gaven et al., 2025), avec des applications dans des domaines allant de la robotique (Forestier et al., 2022) aux technologies éducatives, et des publications à NeurIPS, ICLR et Nature Reviews. Ce projet vise à étendre cette recherche fondamentale sur l'IA autotélique et à finalité ouverte, et à l'appliquer au défi sociétal majeur qu'est la sécurité de l'IA et la découverte de défaillances et capacités émergentes.

L'évaluation des grands modèles de langage (LLM) représente un défi majeur compte tenu de leur évolution rapide. Les benchmarks traditionnels, souvent saturés et présents dans les données d'entraînement, peinent à révéler la véritable diversité des comportements. Ce projet propose d'utiliser des algorithmes de curiosité autotélique pour piloter l'exploration par des modèles d'IA générative (Pourcel et al., 2024), en s'inspirant de la curiosité humaine (Gottlieb & Oudeyer, 2018), afin de générer automatiquement des évaluations adaptatives qui co-évoluent avec les capacités des modèles.

Objectifs et méthodes. Nous visons à développer un cadre unifié combinant génération automatique de benchmarks et découverte de vulnérabilités. L'approche repose sur des algorithmes de curiosité autotélique, dont les algorithmes de qualité-diversité (QD) forment une famille particulière. Ces algorithmes explorent systématiquement un espace d'objectifs/problèmes en optimisant simultanément la qualité locale et la diversité globale selon des descripteurs sémantiques. Nous généraliserons les approches ACES (Pourcel et al., 2024) et ACD (Lu et al., 2025) pour créer des benchmarks adaptatifs couvrant plusieurs domaines et générant des problèmes à la fois diversifiés et peu susceptibles d'apparaître dans les données d'entraînement. Le processus itératif maintient une archive évolutive de problèmes/attaques : à chaque itération, le système échantillonne une niche cible, sélectionne des exemples dans l'archive, puis utilise un LLM générateur pour créer de nouveaux tests conditionnés par ces exemples. Nous adapterons ces principes aux approches de red teaming (Samvelyan et al., 2024 ; Lee et al., 2024), par exemple en utilisant les méthodes récemment développées pour caractériser les biais des grands modèles (Kovac et al., 2024 ; Perez et al., 2025).

Une contribution clé consiste à utiliser des LLM pour regrouper automatiquement les découvertes de vulnérabilités en catégories interprétables par l'humain et produire des rapports synthétiques détaillant les forces et faiblesses des modèles évalués. Nous intégrerons une dimension de méta-apprentissage permettant au système d'apprendre à prédire les niches les plus informatives à partir de l'historique passé, optimisant ainsi sa stratégie d'exploration. Sur le plan méthodologique, ce projet étend ACES et ACD à de nouveaux domaines, unifie génération de benchmarks et red teaming, et développe des méthodes auto-adaptatives qui évoluent par méta-apprentissage. L'impact pratique comprend la réduction des coûts d'évaluation, la découverte automatique de vulnérabilités avant déploiement, et l'identification proactive de comportements émergents dangereux. Ce projet propose ainsi un changement de paradigme : des systèmes d'évaluation qui explorent continuellement l'espace des comportements possibles (et leur diversité), restant pertinents face à l'évolution rapide de l'IA générative. The Flowers team (Inria) has pioneered fundamental research in curiosity-driven autotelic learning and open-ended AI (Oudeyer et al., 2007; Colas et al., 2022; Gaven et al., 2025), and applications in domains ranging from robotics (Forestier et al., 2022) to educational technologies, with publications at NeurIPS, ICLR, and Nature Reviews. This project aims to extend the fundamental research in autotelic and open-ended AI and apply it to the societally important challenge of AI safety and discovery of emergent failures and capabilities.

Evaluating large language models (LLMs) represents a major challenge given their rapid evolution. Traditional benchmarks, often saturated and present in training data, struggle to reveal the true diversity of behaviors. This project proposes using autotelic curiosity algorithms to drive exploration by genAI models (Pourcel et al., 2024), inspired by human curiosity (Gottlieb & Oudeyer, 2018), to automatically generate adaptive evaluations that co-evolve with model capabilities.
We aim to develop a unified framework combining automatic benchmark generation and vulnerability discovery. The approach relies on autotelic curiosity algorithms, of which quality-diversity (QD) algorithms form a particular family. These algorithms systematically explore a space of goals/problems by simultaneously optimizing local quality and global diversity according to semantic descriptors. We will generalize the ACES (Pourcel et al., 2024) and ACD (Lu et al., 2025) approaches to create adaptive benchmarks covering multiple domains and generating problems that are both diverse and unlikely to appear in training data. The iterative process maintains an evolving archive of problems/attacks: at each iteration, the system samples a target niche, selects examples from the archive, then uses a generator LLM to create new tests conditioned on those examples. We will adapt these principles to red teaming approaches (Samvelyan et al., 2024; Lee et al., 2024), e.g. by using the recently developed methods for characterizing biases in large models (Kovac et al., 2024; Perez et al., 2025).
A key contribution is the use of LLMs to automatically cluster vulnerability findings into human-interpretable categories and produce synthetic reports detailing the strengths and weaknesses of the evaluated models. We will integrate a meta-learning dimension allowing the system to learn to predict the most informative niches based on past history, thereby optimizing its exploration strategy. On the methodological side, this project extends ACES and ACD to new domains, unifies benchmark generation and red teaming, and develops self-adaptive methods that evolve through meta-learning. Practical impact includes reducing evaluation costs, automatically discovering vulnerabilities before deployment, and proactively identifying dangerous emergent behaviors. This project thus proposes a paradigm shift: evaluation systems that continuously explore the space of possible behaviors (and their diversity), remaining relevant in the face of the rapid evolution of generative AI.
See above

Le profil recherché

Solides bases mathématiques (probabilités, optimisation, algèbre linéaire) ; bonne maîtrise de Python et expérience en entraînement/fine-tuning de réseaux de neurones/IA générative ; bonne connaissance du post-entraînement, de l'apprentissage par renforcement et du NLP. Pour être éligible, le candidat doit être titulaire d'un diplôme de niveau master (ou équivalent).
Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Parcourir plus d'offres d'emploi