Passer au contenu principal
Publiée 21 août 2026

Doctorant F/H Compréhension de la parole préservant la vie privée à partir de signaux multimodaux pour les applications cliniques

Inria
Nancy, Grand-Est 54000, France CDI

A propos du centre ou de la direction fonctionnelle

L'employeur sera l'Université de Lorraine.

Contexte et atouts du poste

Le ou la doctorant(e) sera accueilli(e) au sein de l'équipe MULTISPEECH du LORIA, unité mixte de recherche Université de Lorraine / Inria / CNRS, à Villers-lès-Nancy. La thèse, financée pour trois ans par la chaire de recherche du Cluster IA Grand Est ENACT, s'inscrit dans un environnement de recherche reconnu en traitement automatique de la parole, apprentissage profond, vie privée vocale et intelligence artificielle appliquée à la santé.

Le projet bénéficie d'une collaboration interdisciplinaire avec le CHRU de Nancy, associant IA de la parole, médecine d'urgence, santé publique et recherche clinique, gouvernance des données, droit et éthique de la santé, ainsi qu'imagerie et signaux biomédicaux. La personne recrutée aura accès à des ressources de calcul dédiées, à des logiciels et frameworks d'apprentissage profond, ainsi qu'au soutien de l'équipe d'ingénierie IA de la chaire ENACT.

Les données cliniques seront traitées dans un cadre éthique et réglementaire adapté, sur une infrastructure sécurisée certifiée HDS. Le sujet offre des perspectives de publications internationales, de collaborations cliniques et de contributions à l'évaluation ouverte de la vie privée dans la parole clinique.

Mission confiée

La mission confiée au ou à la doctorant(e) est de développer et d'évaluer des méthodes de compréhension de la parole clinique respectueuses de la vie privée. Il ou elle étudiera le compromis entre la protection de l'identité vocale et du contenu identifiant, d'une part, et la préservation des informations cliniquement utiles, notamment les biomarqueurs paralinguistiques et la sémantique médicale, d'autre part.

La thèse s'appuiera sur des corpus cliniques parole+texte dé-identifiés, sur des modèles de langue pour la parole et l'audio (speech-LLM), et, selon les possibilités, sur une modalité additionnelle telle que des signaux physiologiques, de l'imagerie médicale ou des métadonnées de dossiers de santé. Le cas d'usage clinique précis et les données disponibles seront définis avec les partenaires cliniques. L'objectif est de proposer des méthodes et des protocoles d'évaluation conciliant rigoureusement vie privée vocale et utilité clinique.

Mots clés

Anonymisation de la parole ; vie privée vocale ; compréhension de la parole ; traitement automatique de la parole ; modèles de langage pour la parole et l'audio ; données de santé ; intelligence artificielle appliquée à la santé ; multimodalité ; apprentissage profond ; compromis vie privée-utilité ; évaluation de la protection de la vie privée.

Références bibliographiques
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    European Parliament and Council. Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence (Artificial Intelligence Act). Official Journal of the European Union, 2024.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    European Parliament and Council. Regulation (EU) 2016/679 (General Data Protection Regulation, GDPR). Official Journal of the European Union, 2016.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Tomashenko, N., et al. "Introducing the VoicePrivacy Initiative." Proceedings of Interspeech , 2020.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Tomashenko, N., et al. "The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization." Computer Speech & Language , 2026.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Srivastava, B. M. L., et al. "Privacy and Utility of x-Vector Based Speaker Anonymization." IEEE/ACM Transactions on Audio, Speech, and Language Processing , 2022.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Arasteh, S. T., et al. "Addressing Challenges in Speaker Anonymization to Maintain Utility While Ensuring Privacy of Pathological Speech." Communications Medicine , 2024.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Diaz-Asper, C., et al. "Navigating the Tradeoff Between Personal Privacy and Data Utility in Speech Anonymization for Clinical Research." npj Digital Medicine , 2025.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Cohn, I., et al. "Audio De-identification: A New Entity Recognition Task." Proceedings of NAACL-HLT , 2019.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Radford, A., et al. "Robust Speech Recognition via Large-Scale Weak Supervision." 2022.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Zhong, X., et al. "Considerations for Patient Privacy of Large Language Models in Health Care: Scoping Review." Journal of Medical Internet Research , 2025.


Principales activités

  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Sélectionner, curer et, si nécessaire, annoter un corpus clinique parole+texte dé-identifié, en concertation avec les partenaires cliniques.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Développer des méthodes de référence pour l'anonymisation vocale et la dé-identification du contenu parlé.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Concevoir des modèles de compréhension de la parole clinique opérant sur des entrées anonymisées et fondés sur des modèles de langage pour la parole et l'audio.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Étudier des représentations désintriquées afin de supprimer l'identité du locuteur et les informations identifiantes tout en préservant les informations cliniquement utiles.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Développer des méthodes d'évaluation combinant protection de la vie privée et utilité clinique : vérification du locuteur, attaques d'inférence d'appartenance et d'attributs, mesures de performance des tâches et évaluation experte.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Étendre les approches à une modalité additionnelle et développer des défenses respectueuses de la vie privée, selon les données et le cas d'usage définis avec les partenaires.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Tester, comparer et valider les méthodes développées ; rédiger la documentation technique, les rapports d'avancement et les publications scientifiques.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Présenter et diffuser les résultats auprès des partenaires scientifiques et cliniques, ainsi que dans des conférences et revues internationales.


Compétences

  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Solide maîtrise de Python.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Bonne connaissance des méthodes d'apprentissage automatique et d'apprentissage profond.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Maîtrise de PyTorch, PyTorch Lightning et de la bibliothèque Transformers (Hugging Face), ou d'un autre framework d'apprentissage profond.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Intérêt pour le traitement de la parole et les données multimodales : audio, texte et signaux.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Capacité à concevoir, entraîner, évaluer et comparer des modèles ; connaissances en statistiques d'évaluation.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Rigueur scientifique, autonomie, esprit critique et intérêt pour les projets interdisciplinaires à l'interface IA-santé.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Capacité à travailler avec des équipes cliniques et à traduire des questions médicales en problèmes de modélisation.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Compétences appréciées : traitement automatique de la parole et du langage naturel ; vie privée et anonymisation ; apprentissage fédéré ou confidentialité différentielle ; analyse multimodale ; IA explicable ; IA appliquée à la santé ; expérience avec des données sensibles ou cliniques.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">
    Une expérience de publication scientifique est appréciée, mais non obligatoire.
  • p]:pt-0 [&>p]:mb-2 [&>p]:my-0">Capacité à communiquer efficacement en français ou en anglais, à l'oral comme à l'écrit.


Rémunération

La rémunération brute mensuelle est fixée à 2 300 €.

S’inscrire aux alertes d’offres d’emploi