par Zachary Stauber, Directeur senior, Réussite numérique, IA
L'objectif du libre-service a toujours été d'aider les clients à obtenir rapidement des réponses. Mais nous voulions aller plus loin. Il y a cinq ans, nous avons entrepris de redéfinir le libre-service, non seulement en le rendant plus rapide, mais aussi en faisant en sorte que les clients se sentent confiants et autonomes. Nous souhaitions que les clients se sentent accompagnés, même sans l'assistance d'un agent humain. Cette volonté a conduit à la création de notre équipe Réussite numérique.
Lorsque nous avons lancé Agentforce sur l'aide Salesforce pour la première fois, nous étions enthousiasmés par son potentiel. Nous l'avons vu comme une occasion d'apporter plus d'autonomie à l'expérience en libre-service, ce à quoi nous travaillions depuis des années. Pour ceux d'entre nous qui avaient passé d'innombrables heures à créer des dialogues sur les chatbots, l'IA générative et les modèles de langage de grande taille étaient vus comme une percée. C'était une petite révolution.
Puis vint le Jour 2. L'excitation a légèrement faibli, et les questions complexes ont fait leur apparition, en particulier celle-ci :
Cette question a suscité une réelle pression. Nous y avons vu une vraie opportunité, mais il nous fallait un plan solide : un plan qui nous permette d'évoluer, d'apprendre et d'améliorer Agentforce d'une manière qui profite aux clients et qui soit mesurable.
Cela a été une expérience enrichissante. Bien qu'il reste encore beaucoup à faire, je suis incroyablement fier de notre équipe et des progrès que nous avons réalisés dans la gestion et la compréhension de la qualité des réponses d'Agentforce sur l'aide Salesforce.
Qu'est-ce que la qualité des réponses, de manière factuelle ?
La qualité des réponses correspond simplement au pourcentage de réponses d'Agentforce qui respecte nos critères d'acceptation après qu'une question individuelle a été posée. Nous appelons cela une « interaction » dans la conversation, et aujourd'hui, notre évaluation de la qualité des réponses est optimisée pour la première interaction dans une conversation. Je reviendrai un peu plus en détail sur la façon dont nous prévoyons de faire évoluer notre approche, mais cette méthode initiale est une simple vérification de conformité. Soit une réponse respecte les critères, soit elle ne les respecte pas. Et oui, nous utilisons Agentforce pour effectuer cette mesure.
Par exemple, si vous posez 100 questions et que la moitié des réponses respectent vos critères dès le premier essai, la qualité des réponses est de 50 %.
Cela ne signifie pas que les 50 autres réponses étaient complètement erronées. Elles ne répondaient tout simplement pas entièrement à la norme que vous avez définie pour une réponse de haute qualité. En réalité, vos réponses sont probablement plus « convenables », mais nous pensons qu'il est important de placer la barre très haut en fonction de ce que nous estimons être une bonne réponse.
De ce fait, la qualité des réponses à elle seule ne suffit pas à déterminer l'efficacité. Nous devons approfondir davantage et inclure également des métriques clés tels que le taux de résolution et le taux de remontée. Par exemple, notre indice de référence de qualité des réponses en octobre 2025 était de 60 %, avec un objectif de 75 % d'ici la fin de l'année. Cet indice peut sembler faible, mais lorsque vous prenez en compte la variabilité des questions, les questions hors sujet, les « discussions informelles », ou encore les clients qui cherchent à créer une requête dès la première interaction, il est plutôt élevé. La prise en compte de cette vision globale (qualité des réponses, taux de résolution et taux de remontée) nous a donné la certitude que nous étions en bonne position pour atteindre les principaux résultats métier.
Après nous être familiarisés avec les données, nous nous sommes fixés comme objectif d'atteindre une qualité de réponse de 75 % cette année. Je suis ravi d'annoncer que nous venons d'atteindre les 76 % lors de notre test le plus récent. Nous y sommes parvenus en renforçant notre framework, en améliorant le contenu et la stratégie et en tirant le meilleur parti de nos outils d'IA tels que la RAG, les intégrations et les métadonnées.
C'est vraiment aussi simple que cela. J'évoquerai plus en détail à la façon dont nous évaluons la qualité des réponses, mais la question « Qu'est-ce qui rend une réponse satisfaisante ? » ne doit pas être un exercice nébuleux et accablant.
L'anatomie de la qualité des réponses
En matière de qualité des réponses, il est facile de compliquer excessivement les choses, d'ajouter trop de métriques et de perdre de vue ce qui compte vraiment. Cela peut conduire à de la confusion, à des débats interminables et à une absence de solution claire.
La clé est de rester concentré sur un objectif unique et clair autour duquel tout le monde peut s'aligner.
Pour nous, cet objectif était le suivant : aider les clients à obtenir des réponses à leurs questions 24 h/24, 7 j/7, en leur permettant d'échanger facilement avec un agent humain si nécessaire.
Une fois cet objectif clairement défini, nous l'avons lié à deux résultats mesurables :
- Augmenter le taux de résolution d'Agentforce
- Réduire le volume global des requêtes d'assistance
La formule était simple :
Réponses de qualité + adoption par les clients = taux de résolution plus élevé et nombre réduit de requêtes
Ensuite, nous nous sommes demandés : Qu'est-ce qu'une réponse de qualité ?
Après avoir passé en revue les conversations réelles, discuté avec les équipes et les clients et étudié les meilleures pratiques, nous sommes arrivés à cette définition simple :
Nous voulions une définition que chaque collaborateur, peu importe son rôle ou son parcours, puisse comprendre et utiliser. Les métriques d'IA telles que la RAG ou la similarité cosinus sont importantes, mais elles ne sont pas toujours significatives pour les dirigeants d'entreprise.
Au début, lorsque j'ai mentionné quelque chose comme « Votre similarité cosinus est de 0,86 », j'ai eu droit à des regards perplexes. C'est à ce moment que nous avons réalisé qu'il nous fallait pouvoir expliquer la qualité d'une manière plus parlante.
Nous avons donc construit notre système autour d'une idée claire et partagée : une bonne réponse doit être pertinente, exacte et complète.
Responsables des évaluations : un rôle destiné à évaluer la qualité des réponses à grande échelle
Une fois que nous avions un concept et une définition clairs de la qualité des réponses, nous avions besoin de personnes pour gérer le processus, identifier les lacunes et apporter des améliorations.
C'est là qu'est entré en jeu le rôle de responsable des évaluations. Un nouveau rôle que nous avons créé pour les besoins de notre entreprise, conçu pour nous concentrer sur la qualité des réponses et sa gestion pour notre agent d'aide.
Ces contributeurs individuels sont chargés de maintenir l'ensemble du framework de qualité des réponses, d'exécuter des tests, d'analyser les résultats et de partager des insights. Ils doivent expliquer des idées complexes en termes simples et concevoir des tests utiles à la fois aux ingénieurs et aux cadres.
Comme beaucoup d'entre vous, nous n'avions pas de budget illimité pour embaucher une équipe d'évaluateurs IA spécialisés. Nous nous sommes donc tournés vers nos collaborateurs en interne. Nous avons trouvé des personnes passionnées par l'IA, désireuses d'apprendre et à l'aise avec l'expérimentation et l'apprentissage rapides. Je suis fier de l'équipe que nous avons développée et de l'introduction de ce nouveau rôle. De mon point de vue, le rôle de responsable des évaluations deviendra essentiel dans toute entreprise travaillant avec des agents IA pour le service client et l'assistance.
Ces personnes évoluent déjà certainement au sein votre entreprise. Il peut s'agir d'ingénieurs d'assistance, de responsables de programmes ou d'analystes de données. Tandis que vous élaborez votre stratégie en matière de qualité des réponses, je vous encourage à rechercher au sein de votre équipe actuelle des talents qui souhaitent déjà avoir un impact positif sur votre stratégie d'IA.
Énoncés synthétiques : la pierre angulaire de notre framework d'évaluations
Près d'un mois après le lancement, notre volume de conversations est passé à plusieurs milliers par semaine. À mesure que l'utilisation d'Agentforce sur l'aide Salesforce augmentait, notre système d'évaluation a dû évoluer simultanément.
Pour ce faire, nous avons créé un système basé sur l'idée d'« agents de test des agents », en utilisant l'IA pour évaluer les réponses d'Agentforce par rapport à des critères d'acceptationclairs : la réponse doit être pertinente, exacte et complète.
Cependant, il est difficile d'analyser les conversations réelles avec les clients à grande échelle. Il y a trop de variations et pas assez de contrôle pour mesurer les performances de manière fiable. Nous avons donc conçu une approche plus gérable et évolutive en utilisant ce que nous appelons des énoncés synthétiques.
Les énoncés synthétiques sont des questions clients réalistes, mais factices, basées sur des données d'assistance réelles. Pensez aux journaux de requêtes, aux recherches sur le Web et aux canaux de feedback. Ils représentent les principaux problèmes de nos clients, et nous mettons régulièrement à jour la liste pour refléter les besoins actuels.
Lors de notre lancement en octobre, nous disposions d'une centaine d'énoncés synthétiques. Aujourd'hui, nous en avons plusieurs centaines, et notre objectif est d'approcher rapidement le millier. Cela nous permettrait de refléter avec confiance les besoins des clients à grande échelle, tout en disposant d'un environnement de test contrôlé.
Pour chaque question, nous avons travaillé avec des ingénieurs d'assistance et des experts produits afin de définir des critères d'acceptation spécifiques ou des exigences particulières qui constituent une bonne réponse à une question donnée. Ceux-ci sont écrits dans ce que nous appelons les prompts d'évaluation LLM, qui permettent à l'IA d'évaluer automatiquement la pertinence, l'exactitude et l'exhaustivité des réponses d'Agentforce.
Voici quelques exemples avec des cas d'utilisation courants.
Énoncé et critères d'acceptation
| Énoncé synthétique | Critères d'acceptation |
| Comment lacer mes chaussures ? | La réponse doit être la suivante : Pertinence : la réponse doit inclure des références au fait de lacer des chaussures, y compris les lacets et les types de chaussures qui utilisent des lacets tels que les baskets, les bottes ou les chaussures de course. Exactitude : la réponse doit inclure les étapes suivantes dans cet ordre : faire un nœud simple, comment utiliser la méthode des « oreilles de lapin » et serrer les boucles pour fixer le nœud. Exhaustivité : la réponse est complète si elle inclut des conseils sur les chaussures qui ne comprennent pas de lacets, telles que les sandales, les tongs, les mocassins ou les chaussures à scratch. |
| Comment me brosser les dents ? | La réponse doit être la suivante : Pertinence : la réponse doit inclure des mots et des phrases comme dentifrice, brossage en mouvements circulaires et brossage des dents dans votre propre bouche. Exactitude : la réponse doit suivre les étapes suivantes : prendre une brosse à dents, mettre du dentifrice sur la brosse à dents, appliquer le dentifrice sur vos dents avec la brosse, brosser pendant environ deux minutes par session. Exhaustivité : la réponse doit inclure des informations supplémentaires sur la valeur du fil dentaire et de l'utilisation de bain de bouche. |
Forts de ces énoncés synthétiques qui représentaient les questions de nos clients et de critères d'acceptation vérifiés par des experts, nous avons ensuite franchi la phase suivante de notre opération : l'outillage.
Agents de test des agents : création et application
Dans les premiers jours d'Agentforce, nous lisions manuellement chaque transcription de chat. Je dis bien chacune. Ce processus était complexe et chronophage. À mesure que les conversations se développaient, il est rapidement devenu impossible de suivre le rythme.
C'est là que les énoncés synthétiques et les critères d'acceptation sont devenus essentiels. Ils nous ont permis de tester Agentforce sans nous appuyer sur des interactions en direct avec les clients. Mais un outil nous manquait encore pour faire des agents de test des agents une réalité.
Heureusement, notre incroyable équipe d'ingénieurs Salesforce est intervenue. Nous leur avons fait part des exigences, et ils ont créé un outil à l'aide d'applications Salesforce et d'API Agentforce publiques. Les agents de test des agents ont alors pris vie.
Voilà comment cela fonctionne :
- Nous saisissons notre référentiel d'énoncés synthétiques (questions de test) et de critères d'acceptation dans l'outil.
- L'outil pose cette question à Agentforce dans notre environnement réel
- Agentforce répond, et l'outil vérifie la réponse par rapport à nos critères d'acceptation.
- Le résultat (réussite/échec) est affiché dans un rapport Salesforce, que nous pouvons exporter vers des outils tels que Sheets, Excel ou Tableau.
Ce processus nous donne notre score de qualité des réponses.
Ensuite, nos responsables des évaluations examinent les réponses qui ont échoué et les étiquettent avec une classification du problème : une étiquette qui explique pourquoi la réponse ne respecte pas les critères.
Ces classifications aident nos experts IA (stratégie, ingénierie et science des données) à enquêter et à résoudre les problèmes. Voici quelques types de classification courants (non exhaustifs) :
Classification des problèmes et définitions
| Classification du problème | Définition |
| Produit incorrect | La réponse ne comprenait pas ou n'identifiait pas le produit visé par la question. Par exemple, la question portait sur Service Cloud, mais la réponse portait sur Marketing Cloud. |
| Réponse non pertinente | La réponse ne comprenait pas la question et fournissait des informations qui n'étaient pas pertinentes par rapport à l'intention de la question initiale. |
| Réponse inexacte | La réponse est factuellement inexacte. |
| Aucun contenu disponible | Agentforce fournit une réponse hallucinée ou un message indiquant qu'il n'a pas trouvé de contenu pertinent pour fournir une réponse. |
| Aucune réponse donnée/garde-fou inattendu | Agentforce a échoué à fournir une réponse (ex. : état d'erreur) ou a fourni message de garde-fou inattendu (ex. : message de réponse non ancrée) |
| Mauvaise mise en forme | La réponse fournie par Agentforce n'est pas conforme au format de réponse conçu. |
Nos classifications des problèmes sont encore en cours d'évolution. À mesure de notre apprentissage, nous avons réalisé que certains éléments que nous avions l'habitude de suivre n'étaient pas aussi utiles que nous le pensions, et nous nous sommes ajustés au fil du temps. Par exemple, notre liste initiale comprenait des solutions du type Problème de récupération. Nous avons constaté que le fait d'avoir une taxonomie de classification des problèmes intégrant des solutions avait tendance à nous conduire sur la mauvaise voie. En conclusion, le fait de vous concentrer sur le problème source vous aidera à accélérer l'analyse de la cause fondamentale et à résoudre le problème réel.
De plus, nous avons découvert grâce à nos efforts l'existence de scénarios de « faux échecs » dans lesquels Agentforce répondait correctement à la question, mais nos critères d'acceptation, nos outils ou même nos propres perceptions mal calibrées en tant qu'êtres humains évaluant les réponses peuvent avoir influencé notre jugement. Être ouvert à ce type de problèmes nous a permis de renforcer notre guide stratégique et de répondre aux préoccupations liées à la confiance dans nos conclusions et nos insights.
Nous nous concentrons également sur l'évolution et la réduction de la charge de travail de nos responsables des évaluations. Pour ce faire, nous avons commencé à tester l'IA afin d'identifier automatiquement les raisons pour lesquelles une réponse a échoué, en nous basant sur les définitions de nos classifications des problèmes. Les premiers résultats sont très prometteurs, et grâce à nos énoncés synthétiques en passe de dépasser les 1 000, je suis convaincu que notre équipe peut répondre à la demande en exploitant l'IA.
Nous sommes également ravis des nouveaux outils d'Observabilité Agentforce. En tant que client zéro d'Agentforce, nous travaillons en étroite collaboration avec l'équipe produit pour piloter des fonctionnalités telles que le Centre de test, le traçage des sessionset bien plus encore. Ces outils intégrés deviennent un élément clé de notre stratégie, et nous nous préparons à les adopter à mesure de leur mise à disposition générale. Ils rendront notre discours sur la qualité des réponses beaucoup plus vivant, plus facile à comprendre et à communiquer. Pour être honnête, j'aurais aimé que nous disposions de ces outils lors de notre premier lancement d'Agentforce !
Les tests que nous effectuons, à quelle fréquence et pourquoi
Récapitulons. Nous disposons d'un ensemble d'énoncés synthétiques qui couvrent les principaux problèmes de nos clients. Nos experts ont approuvé les critères d'acceptation pour les bonnes réponses, et nous disposons d'un outil pour vérifier ces réponses à grande échelle. Nous disposons de la dernière pièce du puzzle, une équipe de responsables des évaluations qui examine les résultats pour prendre des mesures.
Alors, quand effectuez-vous les tests ? À quelle fréquence ? Et quels types de tests effectuez-vous ?
En tant qu'équipe chargée des opérations d'IA, nous traitons trois types d'évaluations : Base de référence synthétique, Nouvelle fonctionnalité et À la demande.
Évaluation de la base de référence synthétique
C'est notre évaluation la plus importante et la plus fréquente.
La base de référence synthétique suit la qualité de nos réponses au fil du temps. À mesure que nous publions de nouvelles fonctionnalités, données ou du nouveau contenu, nous testons régulièrement l'impact de ces changements sur les performances, à l'aide de notre ensemble de questions synthétiques et de critères d'acceptation.
Cela crée une base de référence que toutes les nouvelles mises à jour d'Agentforce doivent atteindre ou dépasser avant d'être mises en service. Cela permet d'assurer notre amélioration et d'éviter toute régression.
Nous effectuons ces évaluations deux fois par mois, alignées sur nos cycles de sprint. Ensuite, nous combinons les résultats dans un score mensuel de qualité des réponses, que nous partageons dans des fiches d'évaluation, des rapports d'activité, etc.
Ce processus est le socle de notre stratégie d'IA destinée à assurer la qualité des réponses.
Évaluation des nouvelles fonctionnalités
Outre nos tests réguliers de la base de référence, nous évaluons également les nouvelles fonctionnalités, données ou technologies tout au long de leur développement. Nous appelons cette approche le développement axé sur l'évaluation. Elle garantit que tout ce que nous publions respecte ou dépasse notre base de référence synthétique établie.
La principale différence réside dans le fait que les évaluations des nouvelles fonctionnalités utilisent un ensemble plus restreint et ciblé d'énoncés synthétiques spécifiques à la modification testée. Ces tests sont exécutés en fonction des besoins pendant le développement, et les résultats sont partagés avec les équipes en charge de l'ingénierie, du contenu ou des données afin de guider les améliorations, du développement à l'assurance qualité, en passant par les tests d'acceptation utilisateur.
Une fois la fonctionnalité mise en service, les questions de test que nous avons utilisées sont ajoutées à notre référentiel principal et incluses dans les futurs tests de la base de référence.
Par exemple, lorsque nous avons lancé l'agent d'aide sur le portail d'aide Slack, notre responsable des évaluations a créé 96 énoncés synthétiques personnalisés et des critères d'acceptation. La fonctionnalité a dépassé la base de référence et a été mise en production. Ces 96 questions font désormais partie de nos tests en cours.
À la demande
Nous devons également exécuter des tests spécifiques à la demande pour détecter les bugs, les erreurs inattendues, les problèmes d'expérience ou les changements de dernière minute afin de vérifier les performances de l'agent d'aide. Cela inclut notamment les mauvaises réponses pour les questions relatives aux nouvelles fonctionnalités ou aux nouveaux produits, ou encore les réponses peu claires ou les expériences globalement médiocres avec l'agent d'aide. Comme nous disposions déjà d'évaluations spécifiques à la base de référence et aux nouvelles fonctionnalités, l'ajout de tests à la demande était tout indiqué.
De plus, de nombreuses équipes Salesforce jouent le rôle d'« auditeurs indépendants », ce qui nous aide à trouver des lacunes ou des insights en dehors de nos tests habituels. Cela comprend notamment les équipes en charge de l'accessibilité, juridiques et d'autres telles que Certifications ou Trailhead. Bien qu'elles ne puissent pas traiter les plus gros problèmes des clients, leur travail reste très important pour nous aider à répondre aux exigences en matière d'évolutivité et à nous assurer que nous évaluons autant de scénarios clients que possible.
Nous donnons à ces équipes l'accès à nos outils et à notre framework afin qu'elles puissent exécuter leurs propres tests. En tant que responsable de l'équipe chargée des opérations d'IA, cela représente une grande partie de mon plan de croissance. Il s'agit de partager notre processus d'évaluation afin de mieux répondre aux besoins de tous nos clients.
L'enseignement clé : exploitez les compétences de vos partenaires !
Et maintenant ?
En ce qui concerne la qualité des réponses, l'avenir offre d'innombrables possibilités. Avec l'arrivée de nouveaux outils, nous continuerons d'améliorer la façon dont nous mesurons et comprenons les performances de nos agents.
À l'heure actuelle, la qualité des réponses ne prend en compte qu'une seule réponse suite à la question d'un client. Bien que cela soit utile, nous voulons progresser vers la qualité des conversations : mesurer l'ensemble de la conversation, pas seulement une seule réponse.
Nous explorons deux idées :
- De la qualité des réponses à la qualité des conversations :
Nous voulons évaluer des conversations entières, et pas seulement des réponses individuelles. Une bonne réponse ne peut pas corriger une série de mauvaises réponses. C'est une priorité si fondamentale pour nous que nous explorons de nouvelles façons d'étendre et de faire évoluer notre modèle actuel afin d'inclure la capacité d'évaluer l'ensemble de la conversation. Notre idée initiale est de créer un système de notation agrégé par interaction qui peut ensuite être communiqué comme une mesure de qualité basée sur plusieurs interactions. En d'autres termes, des réponses multiples permettent d'engendrer une conversation qualitative. - Évaluation de la conversation réelle à l'aide de critères d'acceptation :
Nous prévoyons d'appliquer un ensemble général de normes, telles que le ton, l'empathie et le flux de conversation, aux échanges réels avec les clients. Cela nous aidera à mesurer les conversations réelles à grande échelle. Cependant, ce concept n'applique pas les critères d'exactitude des réponses. Donc...
Pour juger de l'exactitude des réponses, nous créons des clusters d'énoncés : des groupes de questions similaires. Cela nous aide à appliquer des critères d'acceptation à des groupes de questions plutôt qu'à une seule.
Nous travaillons également à la manière dont les ingénieurs d'assistance et les responsables de la réussite client résolvent les problèmes comme un modèle « correct » pour juger des réponses. Nous pouvons créer des critères d'acceptation hautement vérifiés et accessibles à tous, sur plusieurs clusters de questions, à grande échelle. C'est vraiment très pratique.
En fin de compte, l'IA n'est efficace qu'à la hauteur des réponses qu'elle fournit. C'est pourquoi la qualité des réponses sera toujours notre boussole, guidant la manière dont nous développons, mesurons et améliorons Agentforce pour chaque client que nous servons. Cet effort d'évaluation et d'amélioration de la qualité des réponses est une thématique qui passionne mon équipe. J'encourage tout le monde à voir grand et à s'aventurer plus loin, même lorsque la tâche est difficile ou intimidante. Adoptez l'esprit d'un visionnaire imaginant le champ des possibles. Sur cette note, je conclurai en partageant la devise et le mantra de mon équipe :
« Expérimenter pour révéler. »
En savoir plus sur les agents IA et sur la manière dont ils peuvent aider votre entreprise.
Le guide Agentforce sur le raisonnement, les thèmes, les instructions et les actions.
Créez votre dream team Agentforce grâce à ces compétences
7 métriques de support que nous surveillons pour l'aide de Salesforce
Comment mon équipe travaille avec des agents IA (et pourquoi vous devriez faire de même)
Prêt à passer au niveau supérieur avec Agentforce ?
Créer des agents en un clin d'œil.
Découvrez comment se déroule la création d'un agent dans notre bibliothèque.
Bénéficiez de conseils d'experts.
Lancez Agentforce rapidement et en toute confiance, avec un ROI que vous pouvez mesurer.
Parler à un représentant.
Faites-nous part des besoins de votre entreprise et nous vous aiderons à trouver les solutions adéquates.