作者:Zachary Stauber,Digital Success AI資深總監
自助服務的目標一直都是協助客戶快速取得答案。但我們希望更進一步。五年前,我們著手重新定義自助服務,不只是讓服務速度更快,也要讓客戶感到有信心並能自主解決問題。我們相信,即使沒有真人提供協助,人們仍應感受到充分的支援。這個信念促成了Digital Success團隊的成立。
我們首次在Salesforce Help上推出Agentforce時,對其潛力感到十分振奮。我們將此視為讓自助服務體驗更具自主性的機會,而這正是我們多年來持續努力的方向。對於曾花費無數時間建置聊天機器人對話的我們來說,生成式AI與大型語言模型就像是一項重大突破。這徹底改變了局面。
但接著來到了第二天。興奮感稍微退去後,棘手的問題開始浮現,尤其是:
這個問題帶來了實際的壓力。我們將此視為引領市場的機會,但需要一套完善的計畫,讓我們能持續成長、學習並改善Agentforce,不僅能為客戶帶來效益,而且成果可以衡量。
這是一段意義非凡的歷程。雖然還有更多工作要完成,但我非常以團隊為榮,也為我們在提升並深入瞭解Help上Agentforce回答品質方面取得的進展感到自豪。
「回答品質」究竟是什麼?
回答品質簡單來說,就是每次提出單一問題後,Agentforce所提供的答案中符合我們驗收標準的百分比。我們將這稱為對話中的一個「回合」,目前的回答品質評估主要針對對話的第一個回合進行最佳化。稍後我會進一步說明我們計畫如何調整這套方法,但目前的初步方法就是直接進行通過/未通過的檢查。答案不是符合標準,就是不符合標準。沒錯,我們就是使用Agentforce本身來進行衡量。
舉例來說,如果您提出100個問題,其中50個答案在第一次回答時就符合標準,那麼回答品質就是50%。
這並不表示另外50個答案完全錯誤。它們只是沒有完全達到您為高品質答案設定的標準。實際上,您的答案可能比這個數字顯示的更加「正確」,但我們認為,根據我們心目中優質答案應有的標準設定較高門檻非常重要。
因此,單靠回答品質並不足以判斷實際成效。我們需要進一步深入分析,並納入解決率與升級處理率等關鍵指標。例如,我們在2025年10月的回答品質基準為60%,目標是在今年年底前達到75%。這個數字聽起來或許偏低,但若將問題的多樣性、離題問題或「閒聊」,以及客戶在第一個回合就要求建立案件等因素納入考量,其實已經相當高。綜合考量回答品質、解決率與升級處理率等整體狀況後,我們更有信心認為目前的方向足以協助我們達成關鍵業務成果。
在充分掌握這些資料後,我們將今年的回答品質目標設定為75%。很高興與大家分享,我們在最近一次測試中已達到76%。我們透過強化架構、改善內容與策略,並充分發揮檢索增強生成(RAG)、嵌入向量和中繼資料等AI工具的效益,成功達成這項成果。
其實就是這麼回事。接下來我會更深入說明我們如何評估回答品質,但要回答「什麼才算是好答案?」這個問題,其實不需要把它變成模糊又令人難以招架的複雜課題。
回答品質的核心架構
在處理回答品質時,很容易把事情弄得過於複雜,加入太多指標,反而忽略真正重要的重點。這可能導致混亂、無休止的爭論,也讓後續方向變得不明確。
關鍵在於聚焦於一個明確且所有人都能認同的共同目標。
對我們來說,這個目標是:協助客戶全天候取得問題解答,並在需要時能輕鬆轉由真人協助。
確立這個目標後,我們將它連結至兩項可衡量的成果:
- 提高Agentforce解決率
- 降低整體支援案件量
公式很簡單:
接著,我們提出一個問題:什麼是高品質回答?
在檢視實際對話、與團隊及客戶交流,並研究最佳做法後,我們得出了這個簡單的定義:
我們希望這個定義無論任何職務或背景的人都能理解並實際採用。雖然RAG或餘弦相似度等AI指標很重要,但對業務領導者而言,不一定都具備實際意義。
早期當我提到像是「您的餘弦相似度為0.86」這類內容時,大家往往一臉茫然。就在那時,我們意識到需要用更容易理解的方式來說明品質。
因此,我們以一個清楚且共同認同的概念為核心,建立整套系統:優質的回答應具備相關性、正確性與完整性。
評估經理:專為大規模評估回答品質而設的職務
在確立回答品質的清楚概念與定義後,我們需要有人負責管理流程、找出缺口並推動改善。
因此,我們設立了評估經理這個職務。這是我們在組織內新設計的職務,專注於Help Agent的回答品質及其管理。
這些個人貢獻者負責維護整套回答品質架構、執行測試、分析結果並分享洞察。他們需要以簡單易懂的方式解釋複雜概念,並設計對工程師與高階主管都具實用價值的測試。
和許多人一樣,我們並沒有無限預算可以聘用一整隊專業AI評估人員。因此,我們開始從內部尋找合適人選。我們找到了一群熱衷AI、樂於學習,並勇於實驗與快速吸收新知的人。我以我們建立的團隊以及這個新職務為榮。在我看來,對任何在服務與支援領域使用AI智慧代理的組織而言,評估經理都將成為關鍵職務。
其實,這樣的人才很可能已經在您的公司裡。他們可能是支援工程師、計畫經理或資料分析師。因此,在建立回答品質策略時,我建議您先從現有團隊中尋找那些已經有意願為公司的AI發展帶來正面影響的人才。
合成語句:我們評估架構的核心支柱
推出約一個月後,我們每週的對話量已成長至數千次。隨著Help上Agentforce的使用量增加,我們的評估系統也必須同步擴展。
為此,我們以「代理測試代理」的概念建立了一套系統,使用AI依照明確的驗收標準評估Agentforce的回答:答案必須具相關性、正確且完整。
然而,要大規模分析真實客戶對話並不容易。其中的變化太多,也缺乏足夠的控制條件,因此難以可靠地衡量成效。因此,我們採用所謂的合成語句,建立一套更容易管理且可擴展的方法。
合成語句是根據實際支援資料建立、貼近真實情境但並非由真實客戶提出的問題。例如案件記錄、網頁搜尋與意見回饋通路中的資料。這些語句代表我們最常見的客戶問題,而且我們會定期更新清單,以反映目前的需求。
我們在10月推出時,大約有100個合成語句。如今,我們已經有數百個,並計畫很快增加至接近1,000個,數量足以大規模且可靠地反映客戶需求,同時仍能維持受控的測試環境。
針對每個問題,我們都與支援工程師和產品專家合作,定義明確的驗收標準,也就是針對該問題,優質回答必須符合的具體要求。這些標準會寫入我們所稱的LLM評審提示詞,讓AI能自動評估Agentforce的回答是否具備相關性、正確性與完整性。
以下以幾個常見使用情境為例。
語句與驗收標準
| 合成語句 | 驗收標準 |
| 我該如何綁鞋帶? | 答案應符合以下條件: 相關性:答案應包含與綁鞋帶相關的內容,包括鞋帶,以及使用鞋帶的鞋款,例如運動鞋、靴子或跑鞋。 正確性:答案應依照以下順序包含這些步驟:先打一個基本結,接著用兔耳法打結,最後拉緊兩個環以固定鞋帶。 完整性:如果答案也包含不使用鞋帶的鞋款相關說明,例如涼鞋、夾腳拖鞋、懶人鞋或魔鬼氈鞋,即可視為完整。 |
| 我該如何刷牙? | 答案應符合以下條件: 相關性:答案應包含牙膏、以畫圓方式刷牙,以及刷自己口中的牙齒等詞彙與描述。 正確性:答案應依照以下步驟:拿起牙刷、將牙膏擠在牙刷上、用牙刷將牙膏刷到牙齒上,每次刷牙約兩分鐘。 完整性:答案還應包含使用牙線與漱口水好處的額外資訊。 |
有了這些代表客戶問題的合成語句,以及經領域專家審核的驗收標準後,我們便進入下一個階段:工具建置。
建置並應用「代理測試代理」
在Agentforce推出初期,我們會逐一人工閱讀每份聊天記錄。真心不騙。這個過程既繁瑣又耗時。隨著對話量增加,很快就變得難以負荷。
這時,合成語句與驗收標準就變得至關重要。它們讓我們無需仰賴即時客戶互動,也能測試Agentforce。但我們仍需要一套工具,才能真正實現代理測試代理。
所幸Salesforce優秀的工程團隊及時提供了協助。我們提供需求後,他們使用Salesforce Apps與公開的Agentforce API建置了一套工具。我們將它稱為代理測試代理。
運作方式如下:
- 我們將合成語句(測試問題)與驗收標準的資料庫輸入工具中。
- 工具會在正式環境中向Agentforce提出該問題。
- Agentforce會做出回答,而工具則會依照我們的驗收標準檢查答案。
- 結果(通過/未通過)會顯示在Salesforce報告中,我們可以將報告匯出至Sheets、Excel或Tableau等工具。
透過這個流程,我們便能取得回答品質分數。
接著,我們的評估經理會檢視所有未通過的答案,並加上問題分類標籤,以說明答案為何未達標準。
這些分類可協助策略、工程與資料科學領域的AI專家調查並解決問題。常見的分類類型包括但不限於:
問題分類與定義
| 問題分類 | 定義 |
| 產品錯誤 | 答案未能理解或辨識問題所指的產品。例如,問題詢問的是Service Cloud,但答案卻是在說明Marketing Cloud。 |
| 不相關的答案 | 答案未能理解問題,並提供了與原始問題意圖無關的資訊。 |
| 錯誤答案 | 答案在事實上不正確。 |
| 沒有可用內容 | Agentforce提供了幻覺答案,或顯示訊息表示無法找到可用來回答問題的相關內容。 |
| 未提供答案/非預期的防護機制 | Agentforce未能提供答案(例如發生錯誤狀態),或顯示非預期的防護機制訊息(例如沒有根據的回應訊息)。 |
| 格式不佳 | Agentforce提供的答案不符合既定的回答格式。 |
我們的問題分類仍在持續演進。隨著我們瞭解得更多,也發現先前追蹤的某些項目並不像原先想像的那麼實用,因此我們一路持續調整。例如,我們最初的清單中包含檢索問題等解決方向。我們發現,如果問題分類架構中混入了解決方案,反而容易把我們帶往錯誤的方向。我們得到的結論是,專注於根本問題,反而能讓根本原因分析進行得更快,並真正解決問題。
此外,在這些工作中,我們也發現有時會出現「誤判為未通過」的情況:其實Agentforce已正確回答問題,但我們的驗收標準、工具,甚至是身為答案評估者的人員自身尚未校準的主觀認知,都可能影響判斷。願意正視這類問題,有助於我們建立更完善的實戰指南,也能處理外界對我們研究結果與洞察可信度的疑慮。
我們也致力於擴展規模,並減輕評估經理的工作負擔。為此,我們已開始測試AI,根據問題分類的定義,自動辨識答案未通過的原因。初步成果非常令人期待,而我們的合成語句預計將增加至1,000個以上,我相信藉助AI,我們的團隊能持續因應不斷增加的需求。
我們也十分期待Agentforce可觀測性中的新工具。身為Agentforce的Customer Zero,我們正與產品團隊密切合作,試行Testing Center、Session Tracing等功能。這些內建工具正逐漸成為我們策略中的關鍵一環,而我們也正準備在它們正式推出後逐步轉換使用。這些工具能讓我們的回答品質成果呈現得更具體、更容易理解,也更容易對外溝通。說真的,我真希望我們當初推出Agentforce時就已經有這些工具了!
我們執行哪些測試、多久一次,以及原因
先來回顧一下。我們有一組合成語句,涵蓋客戶最常遇到的問題。我們的專家已核准優質回答的驗收標準,而且我們也有一套工具可大規模檢查這些回答。最後一個關鍵環節,就是由評估經理組成的團隊,他們會檢視結果並採取行動。
那麼,您應該何時進行測試?多久測試一次?要進行哪些類型的測試?
對我們AI營運團隊而言,主要進行三種類型的評估:合成基準、新功能與隨需評估。
合成基準評估
這是我們最重要、也最常進行的評估。
合成基準可追蹤我們回答品質隨時間的變化。隨著我們推出新功能、內容或資料,會定期使用一組合成問題與驗收標準,測試這些變更對成效造成的影響。
這會建立一項基準,Agentforce的所有新更新在正式上線前都必須達到或超越這項標準。這可確保我們持續進步,而不是退步。
我們會配合Sprint週期,每月進行兩次這類評估。接著,我們會將結果整合為每月回答品質分數,並透過計分卡、業務檢討等方式分享。
這個流程是我們回答品質AI策略的基礎。
新功能評估
除了定期進行基準測試外,我們也會在開發過程中持續評估新功能、資料或技術。我們將這種方法稱為評估驅動開發。這可確保所有推出的內容都能達到或超越既定的合成基準。
主要差異在於,新功能評估會使用一組規模較小、針對性更高的合成語句,專門對應正在測試的變更。這些測試會在開發期間視需要執行,並將結果分享給工程、內容或資料團隊,作為從開發、QA到UAT各階段改善工作的依據。
功能正式上線後,我們使用過的測試問題會加入主要資料庫,並納入未來的基準測試。
例如,當我們在Slack Help Portal推出Help Agent時,評估經理建立了96個自訂合成語句及其驗收標準。該功能的測試結果高於基準,因此正式部署至正式環境。這96個問題現在已成為持續測試的一部分。
隨需評估
我們也需要針對錯誤、非預期問題、體驗問題或臨時變更隨需執行特定測試,以確認Help Agent的表現。這些情況可能包括針對新功能或產品提供不佳的回答、回答不清楚,或整體Help Agent使用體驗不佳。由於我們已經有基準評估與新功能評估,因此加入隨需測試也是很自然的延伸。
此外,Salesforce內許多團隊也扮演類似「獨立稽核者」的角色,協助我們找出一般測試範圍之外的缺口或洞察。這些團隊包括無障礙、法務,以及認證或Trailhead等團隊。雖然他們處理的未必是最主要的客戶問題,但這些工作仍非常重要,可協助我們因應規模需求,並確保評估涵蓋盡可能多的客戶情境。
我們會讓這些團隊存取相關工具與架構,讓他們自行執行測試。身為AI營運團隊的負責人,這也是我擴展整體能力規模的重要計畫之一。重點在於共享我們的評估流程,以更完善地滿足所有客戶的需求。
最重要的重點是:善用您的合作夥伴!
下一步是什麼?
回答品質的未來充滿各種可能性。隨著新工具陸續推出,我們會持續改善衡量與瞭解代理表現的方式。
目前,回答品質只會評估客戶提出問題後的一次回答。雖然這種方式很實用,但我們希望進一步朝對話品質發展,也就是衡量整段對話,而不只是單一回答。
我們正在探索兩個方向:
- 從回答品質邁向對話品質:
我們希望針對整段對話進行評分,而不只是單一回答。一個好答案無法彌補一連串不佳的回答。這是我們非常重視且投入心力的方向,因此我們正探索各種新方法,擴充並改進現有模型,使其具備評估整段對話的能力。我們初步構想是建立一套累積單一回合分數的評分系統,再將結果呈現為以多回合為基礎的品質評分。換句話說,多個優質回答才能構成一段好的對話。 - 使用驗收標準評估真實對話:
我們計畫將一套通用標準(例如語氣、同理心與對話流程)套用至真實的客戶對話。這將協助我們大規模衡量真實對話的品質。不過,這個概念並不包含判斷回答是否正確的標準。因此…
為了判斷回答是否準確,我們正在建立語句群組,也就是將相似的問題分成同一組。這讓我們能將驗收標準套用至一整組問題,而不只是單一問題。
我們也正嘗試將支援工程師與客戶成功經理解決問題的方式,作為判斷回答是否「正確」的參考模型。我們可以針對多個問題群組,大規模建立經過嚴謹審核、可廣泛採用的驗收標準。這真的非常厲害。
歸根究柢,AI的能力取決於它所提供的回答品質。因此,回答品質始終是我們的北極星,指引我們如何為每位客戶建置、衡量並持續改善Agentforce。評估並提升回答品質,是我們團隊非常投入且充滿熱忱的領域。我鼓勵大家放膽思考,勇於嘗試那些讓人感到不自在或看似艱鉅的事。以未來學家的精神,想像一切可能成為的樣貌。最後,我想以我們團隊的座右銘作結:
「大膽嘗試。找出答案。」