Mathématiques et Informatique Appliquées
du Génome à l'Environnement

 

 

Meta2Graph

Intitulé du projet
Consolidation, validation et généralisation d’un workflow d’extraction automatisée de métadonnées à partir de
publications scientifiques pour l’exploitation de données omiques publiques
Nature du financement
INRAE
État du projet
Soumis
Année de soumission
2026
Programme / appel + année
IB27 dept SPE
Equipe(s) impliquée(s) dans le projet
Bibliome
Coordinateur·trice (nom et prénom)
Martine Da Rocha
Rôle de MaIAGE dans le projet
Partenaire (projet multipartenaires)
Nom(s) du(des) participant(s) - MaIAGE
NEDELLEC Claire, BOSSY Robert
Nom(s) du(des) partenaire(s) (nom, labo et localisation) - Hors MaIAGE
M. A Rocha - 1131 ; A. Velt - 1131 ; F. Legeai - 1349 ; M. Lahaye - 1349 ; S. Jaubert - 1355 ; C. Rustenholz - 1131 ; S. Bottini - 1355 ; N. Negre - 1333 ; A. Seassau - 1355 ; V. Doublet - 1333 ; V. Guigue - 0518
Résumé
Meta2Graph vise à automatiser l'extraction et la structuration de métadonnées biologiques décrites dans les publications scientifiques, afin de faciliter la réutilisation des données omiques publiques déjà produites. Un premier financement SPE (projet Text2Meta) obtenu en 2026, a permis de développer un workflow opérationnel : à partir d'un article scientifique au format PDF, il en extrait les métadonnées expérimentales, grâce à une approche de type RAG (Retrieval-Augmented Generation) : les passages du texte susceptibles de contenir la métadonnée recherchée sont d'abord repérés, puis un LLM en génère la valeur structurée à partir d'un prompt dédié.
Une évaluation rigoureuse, appuyée sur un gold standard de près de 2 500 échantillons RNA-seq de vigne annotés manuellement, a mis en évidence le verrou principal du projet : les métadonnées produites par l'IA sont le plus souvent correctes sur le fond, mais formulées de façon trop hétérogène par rapport à la référence pour être évaluées automatiquement de manière fiable.
Le projet Meta2Graph vise donc à développer et évaluer une démarche de normalisation en plusieurs étapes : identifier, pour chaque organisme, les ontologies pertinentes et les relier avec les métadonnées extraites ; normaliser le gold standard et les métadonnées générées par l'IA vers ces référentiels ; puis les intégrer dans un graphe de connaissances rapprochant chaque métadonnée des termes ontologiques correspondants. Dans un deuxième temps, la généralisation du workflow complet (PDF vers métadonnées normalisées) sera testée sur la tomate, avec un gold standard combinant données RNA-seq et métabolomiques, et sur l'insecte Spodoptera frugiperda. Ces métadonnées normalisées, validées et interrogeables ouvriront la voie à des méta-analyses à grande échelle; plus largement, elles fourniront à la communauté scientifique un workflow réutilisable, quel que soit l'organisme étudié.
Ce projet s'inscrit-il dans le périmètre scientifique du département MathNum ?