di Zachary Stauber, Senior Director, Digital Success, AI
L'obiettivo del self-service è sempre stato quello di aiutare i clienti a ottenere risposte in tempi rapidi. Tuttavia, volevamo andare oltre. Cinque anni fa abbiamo deciso di ridefinire il concetto di self-service: non solo rendendolo più veloce, ma anche facendo sì che i clienti si sentissero sicuri e autonomi. Eravamo convinti che le persone dovessero sentirsi sostenute, anche senza l'aiuto di un altro essere umano. È stata proprio questa convinzione a portare alla creazione del nostro team "Digital Success".
Quando abbiamo lanciato per la prima volta Agentforce su Salesforce Help, eravamo entusiasti delle sue potenzialità. L'abbiamo vista come un'opportunità per rendere l'esperienza self-service più autonoma, un obiettivo a cui lavoravamo da anni. Per chi di noi aveva trascorso innumerevoli ore a creare dialoghi per chatbot, l'AI generativa (Gen AI) e i Large Language Model (LLM) sono sembrati una vera e propria svolta. Era qualcosa di rivoluzionario.
Poi però è arrivato il giorno 2. L'entusiasmo si è un po' affievolito e sono iniziate le domande difficili — in particolare questa:
Quella domanda ha suscitato una forte tensione. L'abbiamo vista come un'opportunità per assumere un ruolo di leadership, ma avevamo bisogno di un piano solido: un piano che ci permettesse di crescere, imparare e migliorare Agentforce in modo da apportare benefici ai clienti e che fosse misurabile.
È stato un percorso significativo. Sebbene ci sia ancora molto da fare, sono incredibilmente orgoglioso del nostro team e dei progressi che abbiamo compiuto nel migliorare e comprendere la qualità delle risposte di Agentforce su Help.
Cosa si intende, letteralmente, per "qualità delle risposte"?
La qualità delle risposte è semplicemente la percentuale di risposte di Agentforce che soddisfano i nostri criteri di accettazione dopo che è stata posta una singola domanda. Ci riferiamo a questo come a una "fase" della conversazione, e la nostra valutazione della qualità delle risposte è attualmente ottimizzata per la prima fase di una conversazione. Più avanti approfondirò un po' di più il modo in cui intendiamo evolvere il nostro approccio, ma questo metodo iniziale consiste in un semplice controllo di tipo "superato/non superato". Una risposta o soddisfa i criteri oppure no. E sì, usiamo proprio Agentforce per misurarlo.
Ad esempio, se poni 100 domande e 50 delle risposte soddisfano i tuoi criteri già al primo tentativo, la qualità delle risposte è pari al 50%.
Questo non significa che le altre 50 risposte siano completamente sbagliate. Semplicemente non soddisfano appieno gli standard che hai stabilito per una risposta di alta qualità. In realtà, le tue risposte sono probabilmente più "corrette", ma riteniamo importante fissare uno standard elevato basato su ciò che, a nostro avviso, rappresenta una risposta eccellente.
Per questo motivo, la qualità delle risposte da sola non è sufficiente a determinare l'efficacia. Dobbiamo approfondire ulteriormente l'analisi e includere anche metriche chiave come il tasso di risoluzione e il tasso di escalation. Ad esempio, il nostro parametro di riferimento relativo alla qualità delle risposte nell'ottobre del 2025 era del 60%, con l'obiettivo di raggiungere il 75% entro la fine di quest'anno. Potrebbe sembrare una percentuale bassa, ma se si tiene conto della variabilità delle domande, delle domande fuori tema o delle "chiacchiere di circostanza" e dei clienti che chiedono la creazione di un caso già al primo contatto, in realtà è piuttosto alta. Tenendo conto di questo quadro complessivo — qualità delle risposte, tasso di risoluzione e tasso di escalation — abbiamo acquisito la certezza di essere sulla buona strada per raggiungere i principali obiettivi aziendali.
Dopo aver acquisito familiarità con i dati, ci siamo prefissati l'obiettivo di raggiungere quest'anno il 75% di qualità delle risposte. Sono lieto di annunciare che nel nostro ultimo test abbiamo appena raggiunto il 76%. Ci siamo riusciti rafforzando la nostra struttura, migliorando i contenuti e la strategia e sfruttando al meglio i nostri strumenti di AI, quali generazione aumentata dal recupero (RAG), embedding e metadati.
Non c'è altro da fare. Approfondirò il modo in cui valutiamo la qualità delle risposte, ma la domanda "Cosa rende una risposta valida?" non deve necessariamente essere un esercizio vago e opprimente.
Anatomia della qualità delle risposte
Quando si affronta il tema della qualità delle risposte, è facile complicare eccessivamente le cose, aggiungendo troppe metriche e perdendo di vista ciò che conta davvero. Ciò può causare confusione, dibattiti senza fine e l'assenza di una via d'uscita chiara.
La chiave è rimanere concentrati su un unico obiettivo chiaro, attorno al quale tutti possano allinearsi.
Per noi, questo obiettivo era il seguente: Aiutare i clienti a trovare risposta alle loro domande 24 ore su 24, 7 giorni su 7, con la possibilità di parlare con un operatore umano, se necessario.
Una volta chiarito questo punto, lo abbiamo collegato a due risultati misurabili:
- Aumentare il tasso di risoluzione di Agentforce
- Ridurre il volume complessivo dei casi di assistenza
La formula era semplice:
Successivamente, ci siamo chiesti: Che cos'è una risposta di qualità?
Dopo aver analizzato conversazioni reali, aver parlato con i team e i clienti e aver studiato le best practice, siamo giunti a questa semplice definizione:
Volevamo una definizione che tutti, indipendentemente dal ruolo o dal background, potessero comprendere e utilizzare. Sebbene le metriche di AI come la generazione aumentata dal recupero (RAG) o la similarità coseno siano importanti, non sempre risultano significative per i dirigenti aziendali.
All'inizio, quando dicevo qualcosa del tipo: "La vostra similarità coseno è pari a 0,86", mi guardavano con aria perplessa. È stato allora che ci siamo resi conto che avevamo bisogno di un modo più accessibile per spiegare il concetto di qualità.
Abbiamo quindi sviluppato il nostro sistema partendo da un'idea chiara e condivisa: Un'ottima risposta è pertinente, corretta e completa.
Responsabili delle valutazioni: Il ruolo creato per valutare la qualità delle risposte su larga scala
Una volta definito chiaramente il concetto e la definizione di "qualità delle risposte", avevamo bisogno di qualcuno che gestisse il processo, individuasse le lacune e promuovesse i miglioramenti.
È qui che è entrato in gioco il ruolo di Responsabile delle valutazioni. Un nuovo ruolo che abbiamo creato all'interno della nostra organizzazione, pensato per concentrarsi sulla qualità delle risposte e sulla relativa gestione da parte dei nostri agenti Help.
Questi collaboratori sono responsabili della gestione dell'intero sistema di controllo della qualità delle risposte, dell'esecuzione dei test, dell'analisi dei risultati e della condivisione degli approfondimenti. Devono spiegare concetti complessi in termini semplici e ideare test che siano utili sia per gli ingegneri che per i dirigenti.
Come molti di voi, non disponevamo di un budget illimitato per assumere un team di valutatori specializzati in AI. Abbiamo quindi cercato all'interno dell'azienda. Abbiamo trovato persone appassionate di AI, desiderose di imparare e a proprio agio nello sperimentare e nell'apprendere in fretta. Sono orgoglioso del team che abbiamo creato e di questo nuovo ruolo. A mio avviso, il ruolo di Responsabile delle valutazioni diventerà fondamentale in qualsiasi organizzazione che utilizzi agenti AI nei servizi e nell'assistenza.
Probabilmente queste persone fanno già parte del tuo personale aziendale. Potrebbero essere tecnici dell'assistenza, responsabili di programma o analisti dati. Quindi, mentre sviluppi la tua strategia per la qualità delle risposte, ti invito a cercare all'interno del tuo attuale team quei talenti che desiderano già contribuire in modo positivo al tuo percorso nell'ambito dell'AI.
Enunciati sintetici: La colonna portante del nostro quadro di valutazione
Circa un mese dopo il lancio, il numero delle nostre conversazioni è salito a migliaia ogni settimana. Con l'aumentare dell'utilizzo di Agentforce su Help, anche il nostro sistema di valutazione ha dovuto adeguarsi.
A tal fine, abbiamo creato un sistema basato sul concetto di "Agents Testing Agents", utilizzando l'AI per valutare le risposte di Agentforce in base a chiari criteri di accettazione: la risposta deve essere pertinente, corretta e completa.
Tuttavia, analizzare su larga scala le conversazioni reali dei clienti è difficile. Le variazioni sono troppe e il controllo non è sufficiente per misurare le prestazioni in modo affidabile. Abbiamo quindi messo a punto un approccio più gestibile e scalabile utilizzando quelli che chiamiamo enunciati sintetici.
Gli enunciati sintetici sono domande dei clienti realistiche, ma fittizie, basate su dati reali dell'assistenza. Basta pensare ai registri dei casi, alle ricerche sul web e ai canali di feedback. Questi rappresentano i principali problemi segnalati dai nostri clienti e aggiorniamo regolarmente l'elenco per riflettere le esigenze attuali.
Quando abbiamo lanciato a ottobre, abbiamo avuto circa un centinaio di enunciati sintetici. Oggi ne abbiamo diverse centinaia e puntiamo a sfiorare presto il migliaio: un numero sufficiente per rispecchiare con sicurezza le esigenze dei clienti su larga scala, ma in modo da poter mantenere un ambiente di test controllato.
Per ogni domanda, abbiamo collaborato con i tecnici dell'assistenza e gli esperti di prodotto per definire specifici criteri di accettazione, ovvero i requisiti specifici che rendono una risposta valida per quella domanda. Questi vengono inseriti in quelli che chiamiamo LLM Judge Prompt, che consentono all'AI di valutare automaticamente le risposte di Agentforce in termini di pertinenza, correttezza e completezza.
Ecco alcuni esempi di utilizzo di alcuni casi d'uso comuni.
Enunciati e criteri di accettazione
| Enunciato sintetico | Criteri di accettazione |
| Come si allacciano le scarpe? | La risposta deve essere: Pertinente: La risposta deve includere riferimenti all'allacciamento delle scarpe, compresi i lacci, e ai tipi di scarpe che utilizzano i lacci, come le scarpe da ginnastica, gli stivali o le scarpe da corsa. Risposta corretta: La risposta deve includere i seguenti passaggi in questo ordine: Fai un nodo semplice, impara a usare il metodo a "orecchie di coniglio" e stringi bene i cappi per fissare il nodo. Fine: La risposta è completa se include indicazioni sulle calzature prive di lacci, come sandali, infradito, scarpe senza lacci o con chiusura in velcro. |
| Come si lavano i denti? | La risposta deve essere: Pertinente: La risposta deve includere parole ed espressioni come "dentifricio", "spazzolare con movimenti circolari" e "spazzolare a partire dalle gengive". Risposta corretta: La risposta deve seguire questi passaggi: Prendi uno spazzolino da denti, metti il dentifricio sullo spazzolino, applica il dentifricio sui denti con lo spazzolino e lavati i denti per circa due minuti ogni volta. Completa: La risposta deve includere ulteriori informazioni sull'importanza dell'uso del filo interdentale e del collutorio. |
Grazie a questi enunciati sintetici che rappresentavano le domande dei nostri clienti e ai criteri di accettazione controllati da esperti in materia, siamo arrivati alla fase successiva della nostra attività: la strumentazione.
Creazione e applicazione di agenti test degli agenti
All'inizio di Agentforce, leggevamo manualmente ogni trascrizione delle chat. Letteralmente. Era un lavoro complicato che richiedeva molto tempo. Man mano che le conversazioni aumentavano, è diventato ben presto impossibile stare al passo.
È qui che gli enunciati sintetici e i criteri di accettazione sono diventati fondamentali. Ci hanno permesso di testare Agentforce senza dover ricorrere a interazioni reali con i clienti. Ma avevamo ancora bisogno di uno strumento per trasformare gli agenti di test degli agenti in realtà.
Per fortuna, è intervenuto il nostro fantastico team di ingegneri di Salesforce. Abbiamo illustrato loro le nostre esigenze e loro hanno sviluppato uno strumento utilizzando Salesforce Apps e API Agentforce pubbliche. L'abbiamo chiamato Agents Testing Agents.
Vediamo quali sono le loro principiali funzionalità:
- Inseriamo il nostro repository di enunciati sintetici (domande di test) e criteri di accettazione nello strumento.
- Lo strumento pone a Agentforce quella domanda nel nostro ambiente di produzione
- Agentforce risponde e lo strumento verifica la risposta in base ai nostri criteri di accettazione.
- Il risultato (superato/non superato) viene visualizzato in un report di Salesforce, che possiamo esportare in strumenti come Sheets, Excel o Tableau.
Questo processo ci fornisce il nostro Punteggio di qualità della risposta.
Successivamente, i nostri Responsabili della valutazione esaminano tutte le risposte non accettate e le contrassegnano con una Classificazione del problema: un'etichetta che spiega perché la risposta non soddisfa i criteri.
Queste classificazioni aiutano i nostri esperti di AI nei settori della strategia, dell'ingegneria e della Data Science ad analizzare e risolvere i problemi. Tra i tipi di classificazione più comuni figurano (a titolo esemplificativo ma non esaustivo):
Classificazione e definizioni dei problemi
| Classificazioni dei problemi | Definizione |
| Prodotto sbagliato | La risposta non ha compreso né identificato il prodotto a cui la domanda si riferiva. Ad esempio, la domanda riguardava Service Cloud, ma la risposta si riferiva a Marketing Cloud. |
| Risposta non pertinente | La risposta non ha compreso la domanda e ha fornito informazioni che non erano pertinenti per l'intento della domanda originale. |
| Risposta errata | La risposta è effettivamente imprecisa. |
| Nessun contenuto disponibile | Agentforce fornisce una risposta con allucinazioni o un messaggio che indica che non è stato in grado di trovare contenuti pertinenti per fornire una risposta. |
| Nessuna risposta fornita/limite di azione inaspettato | Agentforce non ha fornito una risposta (ovvero, stato di errore) oppure ha fornito un messaggio di limite di azione inatteso (ovvero, messaggio di risposta non giustificato) |
| Formato scadente | La risposta fornita da Agentforce non è conforme al formato di risposta progettato. |
Le nostre classificazioni dei problemi sono ancora in fase di evoluzione. Man mano che abbiamo acquisito maggiori conoscenze, ci siamo resi conto che alcuni dati che monitoravamo in passato non erano così utili come pensavamo, e nel corso del tempo abbiamo apportato delle modifiche. Ad esempio, il nostro elenco iniziale comprendeva soluzioni come Retrieval Issue. Quello che abbiamo scoperto è che disporre di una tassonomia di classificazione dei problemi che includesse anche le soluzioni tendeva a condurci sulla strada sbagliata. La conclusione è che concentrarsi sul problema alla radice aiuterà effettivamente a procedere più rapidamente nell'analisi delle cause alla radice e nella risoluzione del problema reale.
Inoltre, grazie al nostro lavoro abbiamo scoperto che a volte ci imbattevamo in "falsi errori": situazioni in cui Agentforce in realtà rispondeva correttamente alla domanda, ma i nostri criteri di accettazione, gli strumenti utilizzati o persino le nostre percezioni non calibrate, in quanto esseri umani incaricati di valutare le risposte, potevano aver influenzato il nostro giudizio. Essere aperti a questo tipo di questioni ci ha aiutato a mettere a punto un manuale più solido e a rispondere alle preoccupazioni relative alla credibilità dei nostri risultati e degli approfondimenti.
Ci stiamo inoltre concentrando sull'espansione delle attività e sulla riduzione del carico di lavoro dei nostri responsabili della valutazione. Per facilitare questo processo, abbiamo iniziato a testare un sistema di AI in grado di identificare automaticamente il motivo per cui una risposta non è stata accettata, sulla base delle definizioni delle nostre classificazioni dei problemi. I primi risultati sono molto promettenti e, dato che il numero dei nostri enunciati sintetici è destinato a superare quota 1.000, sono fiducioso che il nostro team riuscirà a stare al passo con la domanda grazie all'uso dell'AI.
Siamo inoltre entusiasti dei nuovi strumenti disponibili in Osservabilità Agentforce. In qualità di "Cliente Zero" di Agentforce, stiamo collaborando a stretto contatto con il team di prodotto per testare in via sperimentale funzioni quali Testing Center, Session Tracing e altre ancora. Questi strumenti integrati stanno diventando una parte fondamentale della nostra strategia e ci stiamo preparando a passare al loro utilizzo non appena saranno disponibili al pubblico. Renderanno la nostra storia sulla qualità delle risposte molto più vivida, più facile da comprendere e da comunicare. A dire il vero, avrei voluto che avessimo avuto questi strumenti quando abbiamo lanciato Agentforce per la prima volta!
Quali test eseguiamo, con quale frequenza e perché
Ricapitoliamo. Disponiamo di una serie di enunciati sintetici che trattano le principali problematiche dei nostri clienti. I nostri esperti hanno approvato i criteri di accettazione delle risposte corrette e disponiamo di uno strumento per verificare tali risposte su larga scala. Abbiamo l'ultimo tassello: un team di responsabili della valutazione che esamina i risultati per mettere in atto le misure necessarie.
Quando vengono eseguiti i test? Con quale frequenza? Che tipi di test?
Noi, in qualità di team addetto alle operazioni di AI, ci occupiamo di tre tipi di valutazioni: Baseline sintetica, Nuova funzione e su richiesta.
Valutazione della Baseline sintetica
Questa è la nostra valutazione più importante e più frequente.
La Baseline sintetica tiene traccia della qualità delle risposte nel tempo. Man mano che rilasciamo nuove funzioni, contenuti o dati, verifichiamo regolarmente l'impatto di tali modifiche sulle prestazioni, utilizzando la nostra serie di domande sintetiche e i nostri criteri di accettazione.
Questo crea una baseline che tutti i nuovi aggiornamenti a Agentforce devono soddisfare o superare prima di essere pubblicati. Ci garantisce che stiamo migliorando, non regredendo.
Effettuiamo queste valutazioni due volte al mese, in linea con i nostri cicli di sprint. Successivamente, aggreghiamo i risultati in un punteggio mensile relativo alla qualità delle risposte, che condividiamo nelle schede di valutazione, nelle riunioni di analisi dei risultati aziendali e in altre occasioni.
Questo processo costituisce il fondamento della nostra strategia AI per la qualità delle risposte.
Valutazione delle Nuove funzioni
Oltre ai nostri test di base periodici, valutiamo anche nuove funzioni, dati o tecnologie durante tutto il loro processo di sviluppo. Questo approccio è denominato Sviluppo guidato dalla valutazione. Garantisce che tutto ciò che rilasciamo soddisfi o superi gli standard stabiliti dalla nostra Baseline sintetica.
La differenza principale consiste nel fatto che le valutazioni delle nuove funzioni utilizzano un insieme più ristretto e mirato di enunciati sintetici specifici per la modifica oggetto di test. Questi test vengono eseguiti secondo necessità durante la fase di sviluppo e i risultati vengono condivisi con i team di ingegneria, contenuti o dati per orientare i miglioramenti, dallo sviluppo fino al controllo qualità (QA) e ai test di accettazione utente (UAT).
Una volta che la funzione viene resa operativa, le domande di test che abbiamo utilizzato vengono aggiunte al nostro repository principale e incluse nei futuri test di riferimento.
Ad esempio, quando abbiamo lanciato l'agente Help sul Portale di assistenza Slack, il nostro responsabile delle valutazioni ha creato 96 enunciati sintetici personalizzati e relativi criteri di accettazione. La funzione ha superato i requisiti minimi ed è stata rilasciata in produzione. Quelle 96 domande fanno ora parte dei nostri test standard.
Su richiesta
Dobbiamo inoltre eseguire test specifici su richiesta per individuare eventuali bug, problemi imprevisti, problemi legati all'esperienza utente o modifiche dell'ultimo minuto, al fine di verificare le prestazioni di Agente Help. Si tratta, ad esempio, di risposte inadeguate relative a nuove funzioni o prodotti, risposte poco chiare o, più in generale, esperienze negative con l'agente Help. Dato che disponiamo già di valutazioni di riferimento e relative alle nuove funzioni, l'aggiunta di test su richiesta è stata una scelta naturale.
Inoltre, molti team all'interno di Salesforce fungono da "revisori indipendenti", aiutandoci a individuare lacune o approfondimenti che sfuggono ai nostri normali test. Tra questi team figurano Accessibilità, Affari legali e altri come Certificazioni o Trailhead. Sebbene non si occupino delle problematiche più complesse dei clienti, il loro lavoro è comunque molto importante per aiutarci a soddisfare le nostre esigenze di scalabilità e garantire che prendiamo in considerazione il maggior numero possibile di scenari relativi ai clienti.
Forniamo a questi team l'accesso ai nostri strumenti e al nostro framework, in modo che possano eseguire i propri test. In qualità di responsabile del team AI Ops, questo rappresenta una parte importante del mio piano di crescita. Si tratta di condividere il nostro processo di valutazione per soddisfare al meglio le esigenze di tutti i nostri clienti.
Conclusione principale: Sfrutta i tuoi partner!
E adesso?
Il futuro della qualità delle risposte è ricco di possibilità. Man mano che saranno disponibili nuovi strumenti, continueremo a migliorare il modo in cui misuriamo e analizziamo le prestazioni dei nostri agenti.
Al momento, la "Qualità della risposta" prende in considerazione solo una risposta a una domanda del cliente. Sebbene ciò sia utile, vogliamo orientarci verso la qualità della conversazione: misurare l'intera conversazione, non solo una singola risposta.
Stiamo valutando due idee:
- Dalla qualità delle risposte alla qualità della conversazione:
Vogliamo valutare intere conversazioni, non solo singole risposte. Una sola risposta valida non può compensare una serie di risposte sbagliate. Questo tema ci sta così a cuore e ci appassiona a tal punto che stiamo esplorando modi nuovi e diversi per ampliare e far evolvere il nostro modello attuale, in modo da includere la possibilità di valutare la conversazione nella sua interezza. La nostra idea iniziale è quella di creare un sistema di valutazione a turno singolo combinato, che possa poi essere presentato come una qualità basata su più turni. In altre parole, tante risposte rendono la conversazione interessante. - Valutazione delle conversazioni reali mediante criteri di accettazione:
Abbiamo intenzione di applicare una serie di criteri generali, quali il tono, l'empatia e la fluidità della conversazione, alle chat reali con i clienti. Questo ci aiuterà a misurare le conversazioni reali su larga scala. Tuttavia, questo concetto non prevede criteri relativi alla correttezza delle risposte. Quindi...
Per valutare se le risposte sono corrette, stiamo creando dei cluster di enunciati: gruppi di domande simili tra loro. Questo ci permette di applicare i criteri di accettazione a gruppi di domande anziché a una sola.
Stiamo inoltre lavorando per utilizzare il modo in cui i tecnici dell'assistenza e i responsabili del successo dei clienti risolvono i problemi come modello "corretto" per valutare le risposte. Siamo in grado di definire criteri di accettazione altamente verificati e democratizzati, che coprono diversi gruppi di domande, su larga scala. È davvero fantastico.
In fin dei conti, l'AI è potente nella misura in cui lo sono le risposte che fornisce. Ecco perché la qualità delle risposte sarà sempre la nostra stella polare, che ci guiderà nel modo in cui sviluppiamo, misuriamo e miglioriamo Agentforce per ogni cliente che serviamo. Questo impegno volto a valutare e migliorare la qualità delle risposte è un ambito che appassiona il mio team. Invito tutti a pensare in grande e a provare qualcosa che possa sembrare scomodo o scoraggiante. Lasciati ispirare dallo spirito di un futurista che riflette su ciò che potrebbe essere. Con questo, concludo condividendo il motto e il mantra del mio team:
"Divertiti un po'. Scopri".
Scopri di più sugli agenti AI e su come possono aiutare la tua azienda.
La guida di Agentforce relativa a ragionamento, argomenti, istruzioni e azioni.
Crea il team dei tuoi sogni con queste competenze di Agentforce
7 metriche di assistenza che monitoriamo per Agentforce su Help
Come il mio team lavora con gli agenti di AI e perché dovresti farlo anche tu
Fai un salto di qualità con Agentforce!
Crea agenti rapidamente.
Scopri tutti i dettagli sula creazione degli agenti nella nostra libreria.
Richiedi la guida di un esperto.
Avvia Agentforcecon velocità, sicurezza e ROI misurabili.
Parla con un rappresentante.
Parlaci delle esigenze della tua azienda e ti aiuteremo a trovare le risposte.