Mathématiques et Informatique Appliquées
du Génome à l'Environnement

 

 

Stage M2 : De l’analyse Bioinformatique à l'expérience utilisateur : amélioration full-stack d'un pipeline pour l'identification microbienne par MALDI-TOF

Contexte

La spectrométrie de masse MALDI-TOF est devenue la méthode de référence pour l'identification en routine des micro-organismes, en microbiologie clinique comme en microbiologie alimentaire et environnementale. Un spectre MALDI-TOF est dominé par des protéines abondantes de 2 à 20 kDa, majoritairement ribosomiques. On identifie une souche en comparant son spectre à une banque de spectres de référence. Ces banques, en grande partie propriétaires, ne couvrent que les taxons déjà isolés et cultivés, ce qui limite l'identification des micro-organismes peu étudiés.

 

Le projet européen MALDIBANK (Horizon Europe, 2025-2029, coordonné par MIRRI-ERIC) réunit quatre infrastructures de recherche européennes et une vingtaine de partenaires dans 11 pays. Il vise à construire une banque ouverte de spectres MALDI-TOF couvrant bactéries, levures, champignons filamenteux et microalgues (objectif : 100 000 spectres issus d'au moins 20 000 souches), ainsi que les services d'identification associés. INRAE y contribue par ses collections de ressources microbiennes et ses compétences en bioinformatique.

 

Une approche alternative et complémentaire consiste à prédire le spectre à partir du génome. GPMsDB (Sekiguchi et al., 2023) calcule les masses théoriques des protéines prédites dans environ 193 000 génomes bactériens et archéens publics, rattachés à la taxonomie GTDB (release 95), puis les confronte aux listes de pics mesurées. Plus de 90 % des spectres testés sont correctement identifiés, au rang de l'espèce voire de la sous-espèce. Deux outils libres en Python l'implémentent : GPMsDB-dbtk, qui construit la base (prédiction des gènes avec Prodigal, annotation avec HMMER, calcul des masses), et GPMsDB-tk, qui réalise l'identification. Trois points limitent aujourd'hui cette approche : une base de génomes datant de 2020, une prédiction simplifiée des masses protéiques et un score d'assignation perfectible.

Projet

Le stage s'inscrit dans les travaux de l'équipe StatInfOmics visant à intégrer l'identification fondée sur les génomes aux services de MALDIBANK. Il porte sur l'évolution de GPMsDB-dbtk et GPMsDB-tk selon trois axes : actualiser la base de référence, améliorer la fiabilité des assignations et rendre les résultats interprétables par des microbiologistes. Le travail s'appuiera sur des jeux de spectres dont l'identité est connue : les jeux d'évaluation publiés avec GPMsDB et les spectres rassemblés dans le cadre de MALDIBANK.

Objectifs

  • Mettre à la disposition des utilisateurs de MALDIBANK un outil d'identification de spectres performant et ergonomique.
  • Pour le ou la stagiaire : acquérir progressivement une expertise de l'outil, de son fonctionnement et des résultats qu'il produit, afin de concevoir et développer de nouvelles fonctionnalités, côté backend (workflow d'analyse) comme côté frontend (UI/UX).

Tâches associées

Prise en main

  • Mettre à jour la base de données de l'outil vers la dernière version de la GTDB. La release R232 (avril 2026) compte 901 341 génomes et 199 923 espèces, contre environ 32 000 espèces dans la base actuelle. La chaîne de construction sera adaptée au calcul intensif.
  • Évaluer l'impact de cette mise à jour sur les jeux de données de référence : exactitude aux rangs du genre, de l'espèce et de la souche, fréquence des identifications ambiguës ou erronées. Une base plus dense met davantage de génomes proches en concurrence, ce qui oriente directement la phase d'amélioration.

Amélioration

  • Améliorer l'annotation des protéines utilisées comme marqueurs (protéines ribosomiques et autres biomarqueurs) : sites d'initiation de la traduction, modifications post-traductionnelles, masses attendues.
  • Améliorer le score d'assignation des spectres à une souche, une espèce ou un genre : pondération des pics selon leur pouvoir discriminant, prise en compte de l'erreur de mesure sur les masses, niveau de confiance à chaque rang taxonomique.

Design UI/UX

  • Concevoir et implémenter une interface de visualisation contextuelle des résultats : pics appariés et protéines correspondantes, position des candidats dans la taxonomie, confiance de l'assignation.
  • Concevoir et intégrer des fonctionnalités additionnelles : correspondance entre les taxonomies GTDB et NCBI, historique des noms à travers les versions de la GTDB, etc.

Compétences

Requises

  • M2 en bioinformatique, ou en informatique avec une solide composante biologique.
  • Bonne maîtrise de Python et de l'environnement Linux (bash) ; pratique de Git.
  • Connaissances en génomique microbienne (annotation, taxonomie).
  • Rigueur dans l'évaluation des performances (métriques, jeux de test) et dans la documentation du code.

Appréciées

  • Calcul intensif (SGE / SLURM) et gestionnaires de workflows (Snakemake, Nextflow).
  • Développement d'interfaces web ou de visualisations interactives (Dash/Plotly, Streamlit, D3js, JavaScript).
  • Notions de spectrométrie de masse ou de protéomique.
  • Anglais scientifique, le projet se déroulant dans un consortium international.

Autonomie, curiosité et goût pour le dialogue avec des microbiologistes et des spectrométristes seront des atouts.

Environnement et encadrement

Le stage se déroulera au sein de l'équipe StatInfOmics de l'unité MaIAGE (INRAE, Université Paris-Saclay) à Jouy-en-Josas. L'équipe développe des méthodes statistiques et bioinformatiques pour l'analyse des données omiques, notamment en écologie microbienne. Le ou la stagiaire aura accès aux ressources de calcul de la plateforme bioinformatique Migale.
Le stage comprendra des interactions régulières avec des utilisateurs et collaborateurs étrangers dans le cadre du consortium européen MALDIBANK, notamment via des réunions de suivi et des échanges techniques en anglais..

 

Encadrement : Sylvain Marthey, Michel-Yves Mistou, Pierre Nicolas (MaIAGE, StatInfOmics).

Candidature

Envoyer un CV, une lettre de motivation et les relevés de notes de M1 à sylvain.marthey@inrae.fr et michel.mistou@inrae.fr, avec « Stage M2 GPMsDB » en objet. Un lien vers un dépôt de code (GitHub, GitLab) est bienvenu.

Références

Type
Stage
Durée
6 mois
Date de début
Date limite de candidature
Contact
sylvain.marthey@inrae.fr
michel.mistou@inrae.fr