Thèse OT-30646
Thèse - Apprentissage par renforcement observationnel : théorie, architectures et dynamique d'apprentissage social
31320 Castanet-Tolosan
Retour à la liste des résultats
Présentation INRAE
L’Institut national de recherche pour l’agriculture, l’alimentation et l’environnement (INRAE) est un établissement public de recherche rassemblant une communauté de travail de 12 000 personnes, avec 272 unités de recherche, de service et expérimentales, implantées dans 18 centres sur toute la France. INRAE se positionne parmi les tout premiers leaders mondiaux en sciences agricoles et alimentaires, en sciences du végétal et de l’animal. Ses recherches visent à construire des solutions pour des agricultures multi-performantes, une alimentation de qualité et une gestion durable des ressources et des écosystèmes.
Environnement de travail, missions et activités
Le/la doctorant.e sera recruté·e par le laboratoire INRAE-MIAT à Toulouse et sera rattaché·e à l'axe de recherche Decision-Making Agents (DeCA), un environnement pluridisciplinaire combinant intelligence artificielle, économie et approche par simulation pour modéliser la prise de décision dans les systèmes socio-agro-environnementaux.
La thèse sera co-encadrée par Meritxell Vinyals (CR@INRAE) et Régis Sabbadin (DR@INRAE, HDR), qui disposent tous deux d'une solide expérience dans les modèles formels et les algorithmes d'aide à la décision. L'équipe d'encadrement comprend également Léo Saulières (CR@INRAE), qui apportera son expertise en apprentissage par renforcement et explicabilité.
L'apprentissage par renforcement (RL) est largement considéré comme le paradigme du machine learning qui reflète le plus fidèlement l'apprentissage humain : un agent artificiel y apprend à maximiser une récompense cumulée en interagissant avec son environnement, en équilibrant continuellement exploration et exploitation. Néanmoins, malgré des avancées considérables — comme les agents de RL profond atteignant des performances surhumaines dans des jeux complexes —, les agents de RL restent en retrait par rapport aux humains dans de nombreuses capacités d'apprentissage critiques, notamment la généralisation, l'efficacité échantillonnelle et le transfert d'apprentissage.
Cela soulève une question fondamentale et encore non résolue : par quels mécanismes les humains parviennent-ils à apprendre à agir aussi efficacement à partir d'un nombre minimal d'expériences ? Des études récentes en sciences cognitives sociales attribuent ce succès à la capacité très développée des humains pour l'apprentissage social. Ce projet de thèse se concentre plus particulièrement sur l'apprentissage observationnel, un mécanisme d'apprentissage social central largement utilisé par plusieurs espèces intelligentes, dont l'humain, dans lequel un apprenant acquiert des connaissances en observant d'autres individus interagir avec l'environnement.
L'apprentissage par renforcement observationnel (ORL) a émergé récemment comme un domaine de recherche à l'intersection du RL et de l'apprentissage observationnel (OL). Cependant, les méthodes existantes reposent principalement sur des architectures de RL profond avec des fondements théoriques limités, ce qui restreint l'interprétabilité et la généralisation. Les exceptions à cette tendance se concentrent plutôt sur des cadres plus simples, à savoir le problème du bandit, et ne traitent pas de la complexité accrue de la prise de décision séquentielle en RL.
Dans ce contexte, l'objectif principal de ce projet de thèse est de développer de nouvelles architectures d'ORL bien fondées, permettant aux agents non seulement d'apprendre de leur propre expérience directe, mais aussi d'exploiter efficacement l'expérience observationnelle — c'est-à-dire l'observation du comportement de leurs pairs —, dans le but de combler l'écart entre les agents de RL artificiels et les apprenants humains. Contrairement aux travaux antérieurs, les architectures proposées s'appuieront à la fois sur des théories cognitives sociales et sur des cadres de prise de décision rigoureux, permettant une caractérisation théorique fondée des méthodes qui en découlent.
Formations et compétences recherchées
Nous recherchons un.e étudiant.e disposant d’une solide formation méthodologique en intelligence artificielle ou en mathématiques, ainsi que de bonnes bases en modélisation mathématique et en développement algorithmique. Le/la candidat.e devra être titulaire d’un diplôme de Master dans l’une de ces disciplines. Il/elle devra également manifester un réel intérêt pour la recherche à l’interface entre la modélisation mathématique, l’implémentation logicielle et l’étude de cas concrets dans le domaine de l’agroécologie.
Votre qualité de vie à INRAE
En rejoignant INRAE, vous bénéficiez (selon le type de contrat et sa durée) :
- jusqu'à 30 jours de congés + 15 RTT par an (pour un temps plein)
- d'un soutien à la parentalité : CESU garde d'enfants, prestations pour les loisirs ;
- de dispositifs de développement des compétences : formation, conseil en orientation professionnelle ;
- d'un accompagnement social : conseil et écoute, aides et prêts sociaux ;
- de prestations vacances et loisirs : chèque-vacances, hébergements à tarif préférentiel ;
- d'activités sportives et culturelles ;
- d'une restauration collective.
Modalités pour postuler
J'envoie mon CV et ma lettre de motivation
Les personnes accueillies à INRAE, établissement public de recherche, sont soumises aux dispositions du Code de la fonction publique notamment en ce qui concerne l’obligation de neutralité et le respect du principe de laïcité. A ce titre, dans l’exercice de leurs fonctions, qu’elles soient ou non au contact du public, elles ne doivent pas manifester leurs convictions, par leur comportement ou leur tenue, qu’elles soient religieuses, philosophiques ou politiques. > En savoir plus : site fonction publique.gouv.fr