av Zachary Stauber, senior chef, digital framgång, AI
Målet med självbetjäning har alltid varit att hjälpa kunderna att få svar snabbt. Men vi ville gå längre. För fem år sedan bestämde vi oss för att omdefiniera självbetjäning – inte bara göra det snabbare, utan också få kunderna att känna sig trygga och stärkta. Vi ansåg att människor borde känna stöd, även utan att en människa hjälpte dem. Den övertygelsen ledde till att vårt team för digital framgång skapades.
När vi först lanserade Agentforce i Salesforce Hjälp var vi glada över dess potential. Vi såg det som en chans att ge självbetjäningsupplevelsen mer autonomi, något vi hade strävat efter i flera år. För de av oss som hade lagt otaliga timmar på att bygga chattbotdialoger kändes generativ AI och stora språkmodeller som ett genombrott. Det förändrade spelplanen.
Sedan kom dag två. Glädjen avtog lite, och de svåra frågorna började – särskilt den här:
Den frågan väckte verklig press. Vi såg det som en chans att leda, men vi behövde en gedigen plan: en som lät oss växa, lära oss och förbättra Agentforce på ett sätt som gynnade kunderna och var mätbart.
Det har varit en meningsfull resa. Även om det fortfarande finns mer att göra är jag otroligt stolt över vårt team och de framsteg vi har gjort med att driva och förstå svarskvaliteten för Agentforce i Hjälp.
Vad är svarskvalitet, bokstavligen?
Svarskvalitet är helt enkelt andelen svar från Agentforce som uppfyller våra godkännandekriterier när en enskild fråga har ställts. Vi kallar detta för ett ”steg” i konversationen, och vår bedömning av svarskvaliteten idag är optimerad för det första steget i en konversation. Senare berättar jag lite mer om hur vi planerar att utveckla vår strategi, men den här inledande metoden är en enkel kontroll som blir godkänd/underkänd. Antingen uppfyller ett svar kriterierna eller så gör det inte det. Och ja, vi använder själva Agentforce för att mäta detta.
Om du till exempel ställer 100 frågor och 50 av svaren uppfyller dina kriterier på första försöket är det en svarskvalitet på 50 %.
Det betyder inte att de övriga 50 svaren var helt fel. De uppfyllde helt enkelt inte den standard du har angett för ett högkvalitativt svar. I själva verket är dina svar förmodligen mer ”korrekta”, men vi anser att det är viktigt att sätta ribban högt baserat på vad vi tycker utgör ett bra svar.
På grund av detta räcker inte svarskvaliteten i sig för att avgöra effektiviteten. Vi behöver fördjupa oss och inkludera viktiga mått som lösningsfrekvens och eskaleringsfrekvens. Vårt riktmärke för svarskvalitet var till exempel 60 % i oktober 2025, med målet att vara 75 % i slutet av året. Det kan låta lågt, men när du tar hänsyn till frågors variabilitet, frågor som inte rör ämnet eller ”småprat”, och kunder som vill skapa ärenden i första steget, är det faktiskt ganska högt. Genom att ta hänsyn till hela den här bilden – svarskvalitet, lösningsfrekvens och eskaleringsfrekvens – kände vi oss trygga i att vi hade en bra utgångspunkt för att uppnå viktiga affärsresultat.
När vi hade blivit bekväma med dessa data satte vi upp ett mål att nå 75 % svarskvalitet i år. Jag är glad över att kunna berätta att vi precis nådde 76 % i vårt senaste test. Vi uppnådde det genom att stärka vårt ramverk, förbättra innehåll och strategi, och få ut mesta möjliga av våra AI-verktyg som Retrieval Augmented Generation (RAG), inbäddningar och metadata.
Det är egentligen allt som behövs. Jag ska fördjupa mig i hur vi bedömer svarskvaliteten, men frågan ”Vad gör ett svar bra?” behöver inte vara en oklar, överväldigande övning.
Svarskvalitetens anatomi
När vi hanterar svarskvalitet är det lätt att krångla till det genom att lägga till för många mått och tappa bort det som verkligen är viktigt. Det kan leda till förvirring, oändliga diskussioner och ingen tydlig väg framåt.
Nyckeln är att hålla fokus på ett enda tydligt mål som alla kan samarbeta kring.
För oss var det målet: Hjälp kunderna att få svar på sina frågor dygnet runt, med en enkel väg till en människa om det behövs.
När vi hade den tydligheten kopplade vi det till två mätbara resultat:
- Öka Agentforce-lösningsfrekvensen
- Minska det totala antalet supportärenden
Formeln var enkel:
Sedan frågade vi: Vad är ett kvalitetssvar?
Efter att ha gått igenom verkliga konversationer, pratat med team och kunder och studerat bästa praxis, kom vi fram till den här enkla definitionen:
Vi ville ha en definition som alla, oavsett roll och bakgrund, kunde förstå och använda. AI-mått som RAG och cosinuslikhet är viktiga, men de är inte alltid meningsfulla för företagsledare.
I ett tidigt skede fick jag tomma blickar till svar när jag nämnde något i stil med ”Din cosinuslikhet är 0,86”. Det var då vi insåg att vi behövde ett mer relaterbart sätt att förklara kvalitet.
Därför byggde vi vårt system kring en tydlig, gemensam idé: Ett bra svar är relevant, korrekt och fullständigt.
Utvärderingsansvariga: Rollen som utformats för att bedöma svarskvalitet i stor skala
När vi hade ett tydligt koncept och en definition för svarskvalitet behövde vi någon som kunde hantera processen, hitta luckor och driva förbättringar.
Det är där rollen som utvärderingsansvarig kommer in i bilden. En ny roll som vi tog fram i vår organisation och som utformats för att fokusera på svarskvalitet och dess hantering för vår hjälpagent.
Dessa enskilda deltagare ansvarar för att upprätthålla hela ramverket för svarskvalitet, köra tester, analysera resultat och dela insikter. De behöver förklara komplexa idéer med enkla termer och designa tester som är användbara för både ingenjörer och chefer.
Som många av er hade vi ingen oändlig budget för att anställa ett team med specialiserade AI-utvärderare. Så vi tittade internt. Vi hittade medarbetare som var passionerade när det gäller AI, ivriga att lära sig och bekväma med att experimentera och lära sig snabbt. Jag är stolt över det team vi har byggt upp och den här nya rollen. Enligt min uppfattning kommer utvärderingsansvarig att bli en avgörande roll i alla organisationer som arbetar med AI-agenter inom service och support.
Dessa personer finns sannolikt redan i ditt företag. De kan vara supportpersonal, programchefer eller dataanalytiker. När du utformar strategin för svarskvalitet uppmuntrar jag dig därför att leta inom ditt nuvarande team efter talanger som redan vill ha en positiv inverkan på AI-resan.
Syntetiska yttranden: Ryggraden i vårt utvärderingsramverk
Ungefär en månad efter lanseringen ökade antalet konversationer till tusentals varje vecka. I takt med att användningen av Agentforce i Hjälp ökade behövde vårt utvärderingssystem också växa.
Det uppnådde vi genom att skapa ett system baserat på idén om ”agenter som testar agenter”, som använder AI för att utvärdera Agentforces svar mot tydliga godkännandekriterier: Svaret måste vara relevant, korrekt och fullständigt.
Det är dock svårt att analysera verkliga kundkonversationer i stor skala. Variationen är för stor och kontrollen för liten för att tillförlitligt kunna mäta prestanda. Därför tog vi fram en mer hanterbar, skalbar metod med hjälp av något vi kallar syntetiska yttranden.
Syntetiska yttranden är realistiska, men falska, kundfrågor baserade på faktiska supportdata. Tänk dig ärendeloggar, webbsökningar och feedbackkanaler. De representerar våra största kundproblem och vi uppdaterar regelbundet listan utifrån aktuella behov.
När vi lanserade i oktober hade vi omkring hundra syntetiska yttranden. Idag har vi flera hundra, och vi siktar på nära tusen snart – tillräckligt för att tryggt återspegla kundernas behov i stor skala, men på ett sätt som möjliggör en kontrollerad testmiljö.
För varje fråga arbetade vi med supportpersonal och produktexperter för att definiera specifika godkännandekriterier, eller de specifika krav som ger ett bra svar på den frågan. De skrivs in i vad vi kallar LLM-bedömningspromptar, som gör det möjligt för AI att automatiskt bedöma Agentforces svar utifrån relevans, korrekthet och fullständighet.
Här följer några exempel på vanliga användningsfall.
Yttrande- och godkännandekriterier
| Syntetiskt yttrande | Godkännandekriterier |
| Hur knyter jag skorna? | Svaret bör vara: Relevant: Svaret bör innehålla referenser till att knyta skor, inklusive skosnören, och typer av skor som använder skosnören, till exempel sneakers, kängor och löparskor. Korrekt: Svaret bör innehålla följande steg i denna ordning: Gör en enkel knut, hur du gör kaninöron och dra åt öglorna för att fästa knuten. Fullständigt: Svaret är fullständigt om det innehåller vägledning om skor utan skosnören, till exempel sandaler, flip-flops, slip-ons eller kardborreskor. |
| Hur borstar jag tänderna? | Svaret bör vara: Relevant: Svaret bör innehålla ord och fraser som tandkräm, borsta i en cirkulär rörelse och borsta tänderna i din egen mun. Korrekt: Svaret bör följa dessa steg: Ta en tandborste, lägg tandkräm på tandborsten, applicera tandkrämen på tänderna med borsten och borsta i cirka två minuter per session. Fullständigt: Svaret bör innehålla ytterligare information om vikten av att använda tandtråd och munvatten. |
Utrustade med dessa syntetiska yttranden som representerade våra kunders frågor och godkännandekriterier som granskats av ämnesexperter gick vi sedan vidare till nästa fas i vår verksamhet: verktyg.
Bygga och tillämpa agenter som testar agenter
I Agentforces början läste vi varje chattranskription manuellt. Det är sant. Det var rörigt och tidskrävande. När konversationerna ökade blev det snabbt omöjligt att hänga med.
Det var där syntetiska yttranden och godkännandekriterier blev avgörande. De gör att vi kan testa Agentforce utan att använda verkliga kundinteraktioner. Men vi behövde fortfarande ett verktyg för att förverkliga agenter som testar agenter.
Som tur var klev vårt fantastiska ingenjörsteam på Salesforce in. Vi berättade om kraven och de byggde ett verktyg med Salesforce-appar och offentliga Agentforce-API:er. Vi kallade det agenter som testar agenter.
Så här funkar det:
- Vi matar in vårt arkiv med syntetiska yttranden (testfrågor) och godkännandekriterier i verktyget.
- Verktyget ställer den frågan till Agentforce i vår livemiljö
- Agentforce svarar och verktyget kontrollerar svaret mot våra godkännandekriterier.
- Resultatet (godkänt/underkänt) visas i en Salesforce-rapport, som vi kan exportera till verktyg som Kalkylark, Excel eller Tableau.
Den här processen ger oss vår svarskvalitetspoäng.
Därefter granskar våra utvärderingsansvariga eventuella underkända svar och taggar dem med en problemklassificering: en etikett som förklarar varför svaret inte uppfyllde kriterierna.
Dessa klassificeringar hjälper våra AI-experter inom strategi, teknik och datavetenskap att utreda och åtgärda problem. Några vanliga klassificeringstyper omfattar (men är inte begränsade till):
Problemklassificering och definitioner
| Problemklassificering | Definition |
| Fel produkt | Svaret förstod inte eller identifierade inte produkten som frågan var avsedd att gälla. Frågan handlade till exempel om Service Cloud, men svaret gällde Marketing Cloud. |
| Irrelevant svar | Svaret förstod inte frågan och gav information som var irrelevant för den ursprungliga frågans syfte. |
| Fel svar | Svaret är faktamässigt felaktigt. |
| Inget tillgängligt innehåll | Agentforce ger ett hallucinerat svar, eller ett meddelande som indikerar att den inte kunde hitta relevant innehåll för att ge ett svar. |
| Inget svar gavs/oväntat skyddsräcke | Agentforce kunde inte ge ett svar (dvs. feltillstånd) eller gav ett oväntat skyddsräckemeddelande (dvs. ogrundat svarsmeddelande) |
| Dålig formatering | Svaret som gavs av Agentforce överensstämmer inte med det utformade svarsformatet. |
Våra problemklassificeringar utvecklas fortfarande. I takt med att vi har lärt oss mer har vi insett att vissa saker vi tidigare spårade inte var så användbara som vi trodde, och vi har anpassat oss över tid. Vår inledande lista innehöll till exempel lösningar som hämtningsproblem. Det vi upptäckte är att en taxonomi för problemklassificering som omfattade lösningar hade en tendens att leda oss åt fel håll. Slutsatsen var att fokus på grundproblemet faktiskt hjälper dig att agera snabbare i grundorsaksanalysen och lösa det verkliga problemet.
Dessutom upptäckte vi genom våra ansträngningar att vi ibland hittade ”falska misslyckanden”: scenarier där Agentforce faktiskt svarade rätt på frågan, men våra godkännandekriterier, verktyg eller till och med våra egna okalibrerade uppfattningar när människor utvärderade svaren kan ha påverkat vårt omdöme. Genom att vara öppna för de här typerna av problem kunde vi ta fram en starkare strategibok och hantera problem med förtroendet för våra resultat och insikter.
Vi fokuserar också på att skala och minska arbetsbördan för våra utvärderingsansvariga. Därför har vi börjat testa AI för att automatiskt identifiera varför ett svar underkändes, baserat på definitionerna i våra problemklassificeringar. De tidiga resultaten är mycket lovande, och med tanke på att våra syntetiska yttranden är på väg att passera 1 000 är jag säker på att vårt team kan hålla jämna steg med efterfrågan genom att använda AI.
Vi är också glada över nya verktyg i Agentforce Observabilitet. Som Agentforce-kund noll har vi ett nära samarbete med produktteamet för att testa funktioner som testcenter, sessionsspårning med mera. Dessa inbyggda verktyg blir en viktig del av vår strategi, och vi förbereder oss för att övergå till dem när de blir allmänt tillgängliga. De kommer att göra vår berättelse om svarskvalitet mycket mer levande, lättare att förstå och förmedla. Om jag ska vara ärlig önskar jag att vi hade dessa verktyg när vi först lanserade Agentforce!
Vilka tester vi kör, hur ofta och varför
Dags att sammanfatta. Vi har en uppsättning syntetiska yttranden som omfattar våra kunders största problem. Våra experter har godkänt godkännandekriterierna för bra svar, och vi har ett verktyg för att kontrollera dessa svar i stor skala. Vi har den sista pusselbiten, ett team med utvärderingsansvariga som granskar resultaten för att vidta åtgärder.
När testar ni då? Hur ofta? Vilka typer av tester?
För oss, som AI-driftteam, hanterar vi tre typer av utvärderingar: syntetisk baslinje, ny funktion och på begäran.
Utvärdering av syntetisk baslinje
Detta är vår viktigaste och vanligaste utvärdering.
Den syntetiska baslinjen spårar vår svarskvalitet över tid. När vi släpper nya funktioner, innehåll eller data testar vi regelbundet hur dessa ändringar påverkar prestanda med hjälp av våra syntetiska frågor och godkännandekriterier.
Det skapar en baslinje som alla nya uppdateringar av Agentforce måste uppfylla eller överträffa innan de tas i drift. Det säkerställer att vi blir bättre, inte tvärtom.
Vi kör dessa utvärderingar två gånger i månaden, i linje med våra sprintcykler. Sedan kombinerar vi resultaten i en månatlig svarskvalitetspoäng, som vi delar i poängkort, företagsrecensioner med mera.
Denna process är grunden för vår AI-strategi för svarskvalitet.
Utvärdering av nya funktioner
Utöver våra regelbundna baslinjetester utvärderar vi även nya funktioner, data eller teknik under hela deras utveckling. Vi kallar denna metod utvärderingsdriven utveckling. Det säkerställer att allt vi släpper uppfyller eller överträffar vår etablerade syntetiska baslinje.
Den största skillnaden är att utvärderingar av nya funktioner använder en mindre, riktad uppsättning syntetiska yttranden som är specifika för den ändring som testas. Dessa tester körs efter behov under utvecklingen, och resultaten delas med teknik-, innehålls- eller datateam för att vägleda förbättringar från utveckling till QA och UAT.
När funktionen lanseras läggs testfrågorna vi använde till i vårt huvudarkiv och ingår i framtida baslinjetester.
När vi lanserade hjälpagenten på Slack-hjälpportalen, skapade till exempel vår utvärderingsansvariga 96 anpassade syntetiska yttranden och godkännandekriterier. Funktionen godkändes över baslinjen och släpptes till produktion. Dessa 96 frågor är nu en del av våra pågående tester.
På begäran
Vi behöver också köra specifika tester på begäran för buggar, oväntade problem, upplevelseproblem eller ändringar i sista minuten för att kontrollera hur hjälpagenten presterar. Det kan handla om dåliga svar för nya funktioner eller produkter, otydliga svar eller allmänt dåliga upplevelser av hjälpagenten. Eftersom vi redan har utvärderingar av baslinjen och nya funktioner var det naturligt att lägga till tester på begäran.
Dessutom fungerar många team inom Salesforce som ”oberoende revisorer”, vilket hjälper oss att hitta luckor eller insikter utanför våra vanliga tester. Dessa team omfattar tillgänglighet, juridik och andra som certifieringar eller Trailhead. Även om de kanske inte hanterar de största kundproblemen är deras arbete fortfarande mycket viktigt för att hjälpa oss att uppfylla våra skalkrav och säkerställa att vi utvärderar för så många kundscenarier som möjligt.
Vi ger dessa team tillgång till våra verktyg och vårt ramverk så att de kan köra sina egna tester. Som AI-driftteamets ledare är detta en stor del av min tillväxtplan. Det handlar om att dela vår utvärderingsprocess för att bättre tillgodose alla våra kunders behov.
Den viktigaste slutsatsen: Använd dina partners!
Vad händer härnäst?
Framtiden för svarskvalitet är full av möjligheter. I takt med att nya verktyg dyker upp kommer vi att fortsätta att förbättra hur vi mäter och förstår våra agenters resultat.
Just nu tittar svarskvalitet bara på ett svar efter en kunds fråga. Även om detta är användbart vill vi gå mot konversationskvalitet: mätning av hela konversationen, inte bara ett svar.
Vi utforskar två idéer:
- Från svarskvalitet till konversationskvalitet:
Vi vill poängsätta hela konversationer, inte bara enskilda svar. Ett bra svar kan inte lösa en rad dåliga svar. Detta är ett sådant fokus och en sådan passion för oss att vi utforskar nya och annorlunda sätt att utöka och utveckla vår nuvarande modell så att den omfattar möjligheten att bedöma hela konversationen. Vår initiala tanke är att vi kan skapa ett sammansatt enstegspoängsystem som sedan kan kommuniceras som en flerstegsbaserad kvalitet. Med andra ord utgör många svar en bra konversation. - Verklig konversationsbedömning med hjälp av godkännandekriterier:
Vi planerar att tillämpa en allmän uppsättning standarder, till exempel ton, empati och konversationsflöde, på verkliga kundchattar. Det hjälper oss att mäta verkliga konversationer i stor skala. Detta koncept tillämpar dock inte kriterier för svarens korrekthet. Så...
För att bedöma om svaren är korrekta skapar vi yttrandekluster: grupper av liknande frågor. Det hjälper oss att tillämpa godkännandekriterier på grupper av frågor istället för bara en fråga.
Vi arbetar också med att använda hur supportpersonal och kundframgångsansvariga löser problem som en ”korrekt” modell för att bedöma svar. Vi kan skapa mycket granskade, demokratiserade godkännandekriterier för flera kluster av frågor, i stor skala. Det är rätt så häftigt.
I slutändan är AI bara så kraftfull som de svar den ger. Därför kommer svarskvaliteten alltid att vara vår ledstjärna och vägleda hur vi bygger, mäter och förbättrar Agentforce för varje kund vi hjälper. Detta arbete med att bedöma och förbättra svarskvaliteten är en passion för mitt team. Jag uppmuntrar alla att tänka stort och prova något som känns obekvämt eller skrämmande. Anamma andan hos en futurist som funderar på hur det skulle kunna vara. Apropå det avslutar jag med att dela med mig av mitt teams motto och mantra:
”Friskt vågat, hälften vunnet.”
Läs mer om AI-agenter och hur de kan hjälpa din verksamhet.
Agentforce Guiden till resonemang, ämnen, instruktioner och handlingar.
Skapa ditt Agentforce-drömlag med de här färdigheterna
7 supportmått som vi övervakar för Agentforce på Hjälp
Så här arbetar mitt team med AI-agenter – och därför bör du också göra det
Redo att ta nästa steg med Agentforce?
Skapa agenter snabbt.
Ta en närmare titt på hur agentbyggandet fungerar i vårt bibliotek.
Få expertvägledning.
Lansera Agentforce med hastighet, förtroende och ROI som du kan mäta.
Prata med en representant.
Berätta för oss om dina affärsbehov så hjälper vi dig att hitta svar.