Aller au contenu

De la classification à l’interprétation : repenser la reconnaissance des émotions dans les conversations à l’ère des grands modèles de langage. Présenté par Amir Ben Khalifa

Date :
Cet événement est passé.
Type :
Institutionnel
Public :
Bienvenue à toutes et à tous
Lieu :
D4-2011

Description :

La tâche de reconnaissance des émotions dans les conversations (REC), dans la modalité textuelle, vise à identifier l’état émotionnel exprimé par un locuteur dans un dialogue multi-tours, généralement à partir d’une réplique cible et de son contexte conversationnel.

Dans ce mémoire, nous étudions les limites des approches classiques en REC, en particulier face au déséquilibre des classes, à la difficulté de reconnaître les émotions minoritaires et à l’hypothèse selon laquelle chaque réplique peut être représentée par une seule émotion de référence.

Nous commençons par analyser l’impact de l’augmentation de données comme stratégie d’amélioration de la reconnaissance des émotions sous-représentées dans les jeux de données d’évaluation de la REC. Cette première étape montre que l’enrichissement des données peut contribuer à réduire certaines faiblesses des modèles supervisés, mais qu’il ne suffit pas à résoudre les problèmes plus fondamentaux liés à l’ambiguïté émotionnelle et à la subjectivité des annotations.

Nous évaluons ensuite plusieurs grands modèles de langage, notamment LLaMA, Qwen, Mistral et GPT-OSS, dans un cadre de classification sans exemples sur plusieurs bases de données de REC, afin d’analyser leur capacité à reconnaître les émotions sans affinage spécifique. Nos expériences montrent que les performances globales peuvent masquer des faiblesses importantes à un niveau plus fin, notamment pour les émotions minoritaires telles que la peur et le dégoût. Nous montrons également que les erreurs des modèles se concentrent autour de formes linguistiques récurrentes, telles que les négations, les exclamations, les interjections, les interrogations et les réponses courtes.

Afin de déterminer si ces erreurs reflètent réellement des limites des modèles ou plutôt une ambiguïté propre aux données, nous menons une étude de réannotation humaine sur plusieurs bases de données de REC. Les résultats révèlent un accord inter-annotateurs limités, avec de nombreux énoncés se situant dans des régimes d’accord faible ou modéré, ce qui indique que plusieurs interprétations émotionnelles peuvent être plausibles pour un même énoncé.

Ces observations remettent en question les approches d’évaluation de la reconnaissance automatique des émotions fondées uniquement sur une étiquette émotionnelle de référence unique. Elles montrent également que certaines erreurs apparentes des modèles peuvent en réalité correspondre à des interprétations émotionnelles acceptables.

Enfin, nous proposons une évaluation plus flexible, fondée sur la plausibilité des émotions, notamment à travers un cadre utilisant un grand modèle de langage comme juge. Les résultats montrent que ce cadre reconnaît de manière cohérente les émotions jugées plausibles par les annotateurs humains et constitue ainsi une alternative évolutive à l’annotation multiple pour évaluer la reconnaissance des émotions au-delà d’une étiquette unique.

Membres du jury :

Directeur
: Amine Trabelsi, professeur Département informatique Université de Sherbrooke
Co -directeur: Bessam Abdulrazak, professeur Département informatique Université de Sherbrooke
Président-rapporteur : Hubert Knfack Ngankam
Membre interne : Nadia Tahiri, professeure Département informatique Université de Sherbrooke