Recrutement Doctorat.Gouv.Fr

Thèse Classification Histologique Agnostique des Cancers de Primitif Inconnu Cup des Cancers Rares et des Sarcomes par Signatures Transcriptionnelles de la Cellule d'Origine H/F - Doctorat.Gouv.Fr

  • Paris - 75
  • CDD
  • Doctorat.Gouv.Fr
Publié le 27 juillet 2026
Postuler sur le site du recruteur

Les missions du poste


Établissement : Université Paris-Saclay GS Life Sciences and Health École doctorale : Cancérologie : Biologie - Médecine - Santé Laboratoire de recherche : Cancer Data Science Direction de la thèse : Sergey NIKOLAEV ORCID 0000000185872307 Début de la thèse : 2026-10-01 Date limite de candidature : 2026-09-24T23:59:59 Le phénotype cancéreux n'est pas seulement défini par les altérations somatiques et le microenvironnement tumoral, mais aussi par l'identité de la cellule normale dont provient la tumeur. L'identification systématique de la cellule d'origine du cancer demeure complexe, en particulier pour les cancers pédiatriques, les sarcomes et les cancers rares. Ce projet vise à développer un cadre basé sur le transcriptome qui utilise des atlas de cellules normales issus de séquençage ARN sur cellule unique (scRNA-seq) à grande échelle comme référence, afin d'inférer la cellule d'origine tumorale à travers diverses malignités via l'apprentissage automatique supervisé. L'objectif principal est d'améliorer la classification des cancers et le diagnostic moléculaire. S'appuyant sur une preuve de concept établie dans les carcinomes, où un atlas complet de scRNA-seq de cellules épithéliales normales provenant de 12 organes a été utilisé, ce projet étendra cette stratégie en une plateforme évolutive et cliniquement pertinente. Nous intégrerons l'appariement transcriptomique basé sur l'atlas avec des méthodes d'apprentissage automatique, notamment XGBoost et Random Forest, pour l'assignation de la cellule d'origine ainsi que pour l'identification des cancers de primitif inconnu (CUP). Un objectif translationnel majeur consiste à étendre cette inférence aux cancers pédiatriques, aux sarcomes et aux cancers rares. Un nouvel atlas de cellules mésenchymateuses et de lignées stromales développementales sera intégré pour cartographier les sarcomes sur des états cellulaires progéniteurs normaux candidats. Les transcriptomes des tumeurs pédiatriques seront analysés par rapport à des références développementales et liées à l'âge pour identifier les cellules d'origine et les programmes de lignée candidats. Un autre objectif clé est de découvrir les relations de lignée à travers des malignités mal caractérisées, étalonnées sur des échantillons de tumeurs métastatiques provenant des cohortes META-PRISM et Hartwig. Enfin, en tirant parti des données appariées de séquençage ADN et ARN de la cohorte TCGA, le projet analysera systématiquement si la lignée cellulaire dicte la sélection de mutations conductrices spécifiques et de dépendances de voies distinctes. En reliant les altérations oncogéniques récurrentes au contexte cellulaire normal inféré, ce cadre élucidera l'oncogenèse dépendante de la lignée, expliquant comment des mutations conductrices identiques peuvent produire des phénotypes tumoraux divergents en fonction de leur contexte cellulaire ancestral. While cancer phenotypes are heavily influenced by the normal cell of origin, identifying this cellular origin remains a significant challenge for rare malignancies, pediatric cancers, and sarcomas. Current standard adult tissue atlases insufficiently capture the lineage relationships necessary for these specific cancers. Unresolved tumor origins severely limit diagnostic resolution and therapeutic decision-making, particularly in advanced disease settings and Cancers of Unknown Primary (CUP) where conventional diagnostic resolution is often limited. ObjectifsDevelop a robust, machine-learning-based framework to infer tumor cell of origin using large-scale scRNA-seq normal cell atlases. Extend cell-of-origin inference beyond adult carcinomas to pediatric cancers, sarcomas, and rare cancers by integrating developmental stromal lineage atlases. Improve the molecular interpretation and biological classification of Cancers of Unknown Primary (CUP). Investigate lineage-dependent oncogenesis to understand how cellular context dictates driver mutation selection and pathway dependencies. The project will transform single-cell RNA-seq atlases of normal tissues, including new compilations of mesenchymal and developmental stromal lineages, into a clinically interpretable framework for tumor origin inference. Tumor transcriptomes will be analyzed against these references. Supervised machine learning algorithms, specifically XGBoost and Random Forest, will be trained to assign cell-of-origin and identify CUP. The predictive models will be benchmarked on advanced disease datasets, including the META-PRISM and Hartwig cohorts, alongside TCGA data.

Le profil recherché

Le candidat idéal doit posséder une solide expérience en bioinformatique, en biologie computationnelle ou en science des données. La maîtrise de Python ou de R est essentielle, ainsi qu'une expérience pratique de la modélisation statistique et des techniques d'apprentissage automatique supervisé (par exemple, Random Forest, XGBoost). Une expérience préalable du travail avec des données transcriptomiques à haut débit (RNA-seq, scRNA-seq) dans un environnement Linux/HPC est vivement souhaitée. Un vif intérêt pour la génomique du cancer et l'évolution tumorale est attendu.

Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Parcourir plus d'offres d'emploi