Por Zachary Stauber, diretor sênior de sucesso digital, IA
O objetivo do autoatendimento sempre foi ajudar os clientes a obter respostas rapidamente. Mas queríamos ir além. Há cinco anos, decidimos redefinir o autoatendimento, não apenas tornando-o mais rápido, mas fazendo com que os clientes se sentissem confiantes e capacitados. Acreditávamos que as pessoas deveriam se sentir apoiadas, mesmo sem uma pessoa para ajudá-las. Essa crença levou à criação da nossa equipe de Sucesso digital.
Quando lançamos o Agentforce na Ajuda do Salesforce, estávamos empolgados com seu potencial. Vimos nisso uma oportunidade de trazer mais autonomia à experiência de autoatendimento, algo que vínhamos buscando há anos. Para aqueles de nós que passaram inúmeras horas criando diálogos de chatbot, a IA generativa e grandes modelos de linguagem pareciam um avanço. Foi um divisor de águas.
Mas então chegou o Dia 2. A empolgação diminuiu um pouco, e começaram as perguntas difíceis, especialmente esta:
Essa pergunta gerou uma pressão significativa. Vimos isso como uma chance de liderar, mas precisávamos de um plano sólido: um que nos permitisse crescer, aprender e melhorar o Agentforce de uma forma que beneficiasse os clientes e fosse mensurável.
Tem sido uma jornada significativa. Embora ainda haja muito o que fazer, estou extremamente orgulhoso da nossa equipe e do progresso que fizemos em impulsionar e compreender a qualidade das respostas do Agentforce na Ajuda.
Literalmente, o que é qualidade da resposta?
Qualidade da resposta é simplesmente a porcentagem de respostas do Agentforce que atendem aos nossos critérios de aceitação após uma pergunta ser feita. Nós nos referimos a isso como uma "interação" na conversa, e nossa avaliação de Qualidade da resposta hoje é otimizada para a primeira interação de uma conversa. Mais tarde, falarei um pouco mais sobre como planejamos evoluir nossa abordagem, mas esse método inicial é uma verificação simples de aprovação/reprovação. Ou uma resposta atende aos critérios ou não. E, sim, usamos o próprio Agentforce para medir isso.
Por exemplo, se você fizer 100 perguntas e 50 das respostas atenderem aos seus critérios na primeira tentativa, isso será uma qualidade de resposta de 50%.
Isso não significa que as outras 50 respostas estavam completamente erradas. Eles simplesmente não atenderam totalmente ao padrão que você definiu para uma resposta de alta qualidade. Na realidade, suas respostas provavelmente estão mais "corretas", mas acreditamos que é importante definir um alto padrão com base no que achamos que representa uma ótima resposta.
Por causa disso, a qualidade da resposta por si só não é suficiente para determinar a eficácia. Precisamos nos aprofundar e também incluir métricas importantes, como taxa de resolução e taxa de escalonamento. Por exemplo, nosso benchmark de qualidade de resposta em outubro de 2025 foi de 60%, com uma meta de 75% até o final deste ano. Isso pode parecer baixo, mas quando você leva em conta a variabilidade das perguntas, perguntas fora do tópico ou "conversa fiada" e clientes que buscam a criação de casos na primeira interação, na verdade é bastante alto. Considerar todo esse panorama, incluindo qualidade da resposta, taxa de resolução e taxa de escalonamento, nos deu confiança de que estávamos em uma boa posição para alcançar os principais resultados de negócios.
Depois de nos familiarizarmos com os dados, definimos uma meta de atingir 75% de qualidade de resposta este ano. Tenho o prazer de compartilhar que acabamos de atingir 76% em nosso teste mais recente. Conseguimos isso fortalecendo nossa estrutura, melhorando o conteúdo e a estratégia e aproveitando ao máximo nossas ferramentas de IA, como RAG, incorporações e metadados.
É realmente só isso. Vou me aprofundar em como avaliamos a qualidade da resposta, mas a pergunta "O que torna uma resposta boa?" não precisa ser um exercício nebuloso e complicado.
A anatomia da qualidade da resposta
Ao lidar com a qualidade da resposta, é fácil complicar demais as coisas, adicionar muitas métricas e perder de vista o que realmente importa. Isso pode levar a confusão, debates intermináveis e a nenhuma maneira clara de avançar.
O segredo é manter o foco em uma meta única e clara com a qual todos possam estar alinhados.
Para nós, esse objetivo era: Ajudar os clientes a obter respostas para suas perguntas 24 horas por dia, 7 dias por semana, com um caminho fácil para falar com uma pessoa, se necessário.
Depois de termos essa clareza, vinculamos isso a dois resultados mensuráveis:
- Aumentar a taxa de resolução do Agentforce
- Reduzir o volume geral de casos de suporte
A fórmula era simples:
Em seguida, perguntamos: O que é uma resposta de qualidade?
Depois de analisar conversas reais, conversar com equipes e clientes e estudar as práticas recomendadas, chegamos a esta definição simples:
Queríamos uma definição que todos, independentemente da função ou do histórico, pudessem entender e usar. Embora métricas de IA, como RAG ou similaridade de cosseno, sejam importantes, elas nem sempre são significativas para os líderes de negócios.
No início, quando mencionei algo como: "Sua semelhança de cosseno é 0,86", recebi olhares com cara de dúvida. Foi quando percebemos que precisávamos de uma maneira mais acessível de explicar a qualidade.
Por isso, criamos nosso sistema com base em uma ideia clara e compartilhada: Uma ótima resposta é relevante, correta e completa.
Gerentes de avaliações: A função criada para avaliar a qualidade da resposta em grande escala
Quando tínhamos um conceito e uma definição claros para qualidade da resposta, precisávamos de alguém para gerenciar o processo, encontrar lacunas e impulsionar melhorias.
Foi aí que a função de Gerente de Avaliação entrou em cena. Uma nova função que criamos em nossa organização, projetada para se concentrar na qualidade da resposta e em seu gerenciamento para nosso agente de ajuda.
Esses colaboradores individuais são responsáveis por manter toda a estrutura de qualidade da resposta, executar testes, analisar resultados e compartilhar percepções. Eles precisam explicar ideias complexas em termos simples e criar testes que sejam úteis tanto para engenheiros quanto para executivos.
Como muitos de vocês, não tínhamos orçamento infinito para contratar uma equipe de avaliadores especializados em IA. Então, analisamos internamente. Encontramos pessoas apaixonadas por IA, ansiosas por aprender e confortáveis em experimentar e aprender rapidamente. Tenho orgulho da equipe que construímos e dessa nova função. Na minha opinião, o Gerente de avaliação se tornará uma função fundamental em qualquer organização que trabalhe com agentes de IA em atendimento e suporte.
Provavelmente, essas pessoas já existem na sua empresa. Eles podem ser engenheiros de suporte, gerentes de programas ou analistas de dados. Assim, ao criar sua estratégia de qualidade da resposta, recomendo que você procure na sua equipe atual talentos que já queiram contribuir positivamente para sua estratégia de IA.
Enunciados sintéticos: A espinha dorsal da nossa estrutura de avaliação
Cerca de um mês após o lançamento, nosso volume de conversas chegou aos milhares por semana. À medida que o uso do Agentforce na Ajuda cresceu, nosso sistema de avaliação teve que crescer com ele.
Para fazer isso, criamos um sistema baseado na ideia de "Agentes testando agentes", usando IA para avaliar as respostas do Agentforce em relação a critérios de aceitação claros: a resposta deve ser relevante, correta e completa.
No entanto, analisar conversas reais com clientes em grande escala é difícil. Há muita variação e pouco controle para medir o desempenho de forma confiável. Por isso, criamos uma abordagem mais gerenciável e escalável usando algo que chamamos de enunciados sintéticos.
Enunciados sintéticos são perguntas realistas, mas fictícias, de clientes, baseadas em dados reais de suporte. Pense em registros de casos, pesquisas na web e canais de feedback. Eles representam os principais problemas dos nossos clientes, e atualizamos regularmente a lista para refletir as necessidades atuais.
Quando lançamos, em outubro, tínhamos cerca de uma centena de enunciados sintéticos. Hoje, temos várias centenas e estamos buscando chegar a quase mil em breve, o suficiente para refletir com confiança as necessidades dos clientes em grande escala, mas de uma forma que permita manter um ambiente de teste controlado.
Para cada pergunta, trabalhamos com engenheiros de suporte e especialistas em produtos para definir critérios de aceitação específicos, ou os requisitos específicos que caracterizam uma boa resposta para essa pergunta. Eles são incorporados ao que chamamos de prompts de juiz de LLM (LLM Judge Prompts), que permitem que a IA avalie automaticamente as respostas de Agentforce quanto à relevância, correção e completude.
Aqui estão alguns exemplos usando alguns casos de uso comuns.
Enunciado e critérios de aceitação
| Enunciado sintético | Critérios de aceitação |
| Como amarro meus sapatos? | A resposta deve ser: Relevante: A resposta deve incluir referências a como amarrar sapatos, incluindo cadarços, e a tipos de sapatos que usam cadarços, como tênis, botas ou tênis de corrida. Correto: A resposta deve incluir as seguintes etapas nesta ordem: Fazer um nó básico, usar orelhas de coelho e puxar as alças firmemente para prender a amarração. Completo: A resposta está completa se incluir orientações sobre sapatos que não têm cadarços, como sandálias, chinelos, slip-ons ou sapatos com velcro. |
| Como faço para escovar os dentes? | A resposta deve ser: Relevante: A resposta deve incluir palavras e frases como pasta de dente, escovar em movimentos circulares e escovar os dentes na própria boca. Correto: A resposta deve seguir estas etapas: Pegue uma escova de dentes, coloque creme dental na escova de dentes, aplique o creme dental nos dentes com a escova e escove por cerca de dois minutos por sessão. Completo: A resposta deve incluir informações adicionais sobre o valor do uso de fio dental e enxaguatório bucal. |
Com esses enunciados sintéticos que representavam as perguntas de nossos clientes e critérios de aceitação validados por especialistas no assunto, chegamos à próxima fase de nossa operação: ferramentas.
Criação e aplicação de agentes testando agentes
No início do Agentforce, lemos manualmente todas as transcrições de chat. De verdade. Era confuso e demorado. À medida que as conversas cresciam, rapidamente se tornou impossível acompanhar o ritmo.
Foi aí que enunciados sintéticos e critérios de aceitação se tornaram cruciais. Eles nos permitem testar o Agentforce sem depender de interações ao vivo com os clientes. Mas ainda precisávamos de uma ferramenta para tornar agentes testando agentes uma realidade.
Felizmente, nossa incrível equipe de engenharia da Salesforce entrou em ação. Compartilhamos os requisitos, e eles criaram uma ferramenta usando aplicativos Salesforce e APIs públicas do Agentforce. Nós a chamamos de Agentes testando agentes.
Funciona da seguinte maneira:
- Nós inserimos nosso repositório de enunciados sintéticos (perguntas de teste) e critérios de aceitação na ferramenta.
- A ferramenta faz essa pergunta ao Agentforce em nosso ambiente de produção
- O Agentforce responde, e a ferramenta verifica a resposta em relação aos nossos critérios de aceitação.
- O resultado (aprovado/reprovado) é mostrado em um relatório do Salesforce, que podemos exportar para ferramentas como Planilhas, Excel ou do Tableau.
Esse processo nos dá nossa Pontuação de qualidade da resposta.
Em seguida, nossos Gerentes de avaliação analisam as respostas que não passaram e as marcam com uma classificação de problemas: um rótulo que explica por que a resposta não atendeu aos critérios.
Essas classificações ajudam nossos especialistas em IA em estratégia, engenharia e ciência de dados a investigar e corrigir problemas. Alguns tipos de classificação comuns incluem, mas não se limitam a:
Classificação e definições de problemas
| Classificação de problema | Definição |
| Produto errado | A resposta não entendeu ou identificou o produto ao qual a pergunta se referia. Por exemplo, a pergunta era sobre Service Cloud, mas a resposta era em relação ao Marketing Cloud. |
| Resposta irrelevante | A resposta não entendeu a pergunta e forneceu informações irrelevantes para a intenção da pergunta original. |
| Resposta incorreta | A resposta contém informações factualmente incorretas. |
| Nenhum conteúdo disponível | O Agentforce fornece uma resposta alucinada ou uma mensagem indicando que não foi possível encontrar conteúdo relevante para fornecer uma resposta. |
| Nenhuma resposta fornecida / Proteção inesperada | O Agentforce não forneceu uma resposta (ou seja, estado de erro) ou forneceu uma mensagem de proteção inesperada (ou seja, mensagem de resposta não fundamentada) |
| Má formatação | A resposta fornecida pelo Agentforce não está em conformidade com o formato de resposta projetado. |
Nossas classificações de problemas ainda estão evoluindo. À medida que aprendemos mais, percebemos que algumas coisas que costumávamos rastrear não eram tão úteis quanto pensávamos e nos ajustamos ao longo do tempo. Por exemplo, nossa lista inicial incluía soluções como Problema de recuperação. O que descobrimos é que ter uma taxonomia de classificação de problemas que incorporasse soluções tendia a nos levar pelo caminho errado. A conclusão foi que concentrar-se no problema raiz realmente ajudará você a avançar mais rapidamente em sua análise de causa raiz e resolver o problema real.
Além disso, descobrimos por meio de nossos esforços que às vezes encontramos "Falsas falhas": cenários em que o Agentforce estava realmente respondendo à pergunta corretamente, mas nossos critérios de aceitação, ferramentas ou até mesmo nossas próprias percepções não calibradas como humanos avaliando as respostas podem ter influenciado nosso julgamento. Estar aberto a esses tipos de problemas nos ajudou a criar um playbook mais sólido e abordar preocupações sobre a confiança em nossas descobertas e percepções.
Também estamos focados em dimensionar e reduzir a carga de trabalho de nossos gerentes de avaliação. Para ajudar com isso, começamos a testar a IA para identificar automaticamente por que uma resposta falhou, com base nas definições de nossas classificações de problemas. Os resultados iniciais são muito promissores e, com nossos enunciados sintéticos a caminho de ultrapassar 1.000, tenho certeza de que nossa equipe poderá acompanhar a demanda usando a IA.
Também estamos empolgados com as novas ferramentas na Capacidade de observação do Agentforce. Como cliente zero do Agentforce, estamos trabalhando em estreita parceria com a equipe de produto para testar recursos como Centro de testes, Rastreamento de sessões e muito mais. Essas ferramentas integradas estão se tornando uma parte fundamental da nossa estratégia, e estamos nos preparando para fazer a transição para elas à medida que se tornarem disponíveis para o público geral. Elas tornarão nossa história de qualidade de resposta muito mais vívida, mais fácil de entender e de comunicar. Para ser honesto, gostaria de ter essas ferramentas quando lançamos o Agentforce!
Quais testes executamos, com que frequência e por quê
Vamos recapitular. Temos um conjunto de enunciados sintéticos que abordam os principais problemas de nossos clientes. Nossos especialistas aprovaram os critérios de aceitação para boas respostas, e temos uma ferramenta para verificar essas respostas em grande escala. Temos a peça final, uma equipe de gerentes de avaliação que analisam os resultados para agir.
Então, quando você testa? Com que frequência? Que tipos de testes?
Para nós, como uma equipe de operações de IA, lidamos com três tipos de avaliações: Linha de base sintética, novo recurso e sob demanda.
Avaliação de linha de base sintética
Esta é a nossa avaliação mais importante e frequente.
A linha de base sintética acompanha a qualidade das respostas ao longo do tempo. À medida que lançamos novos recursos, conteúdo ou dados, testamos regularmente como essas mudanças afetam o desempenho, usando nosso conjunto de perguntas sintéticas e critérios de aceitação.
Isso cria uma linha de base que todas as novas atualizações do Agentforce devem atender ou exceder antes de entrar em operação. Isso garante que estejamos melhorando, não regressando.
Fazemos essas avaliações duas vezes por mês, alinhadas com nossos ciclos de sprint. Em seguida, combinamos os resultados em uma pontuação mensal de qualidade da resposta, que compartilhamos em scorecards, avaliações de negócios e muito mais.
Esse processo é a base da nossa estratégia de IA para qualidade da resposta.
Nova avaliação de recursos
Além de nossos testes regulares de linha de base, também avaliamos novos recursos, dados ou tecnologia durante todo o desenvolvimento. Chamamos essa abordagem de desenvolvimento orientado por avaliação. Ele garante que tudo o que lançamos atenda ou exceda nossa linha de base sintética estabelecida.
A principal diferença é que as avaliações de novos recursos usam um conjunto menor e direcionado de enunciados sintéticos específicos para a mudança que está sendo testada. Esses testes são executados conforme necessário durante o desenvolvimento, e os resultados são compartilhados com as equipes de engenharia, conteúdo ou dados para orientar as melhorias desde o desenvolvimento até QA e UAT.
Quando o recurso entra em operação, as perguntas de teste que usamos são adicionadas ao nosso repositório principal e incluídas em futuros testes de linha de base.
Por exemplo, quando lançamos o agente de ajuda no Portal de ajuda do Slack, nosso gerente de avaliações criou 96 enunciados sintéticos personalizados e critérios de aceitação. O recurso superou a linha de base e foi liberado para produção. Agora, essas 96 perguntas fazem parte de nossos testes contínuos.
Sob demanda
Também precisamos executar testes específicos sob demanda para verificar o desempenho do agente de ajuda em casos de bugs, problemas inesperados, problemas de experiência ou alterações de última hora. São coisas como respostas ruins para novos recursos ou produtos, respostas pouco claras ou experiências geralmente ruins com o agente de ajuda Como já temos avaliações de linha de base e de novos recursos, adicionar testes sob demanda foi uma opção natural.
Além disso, muitas equipes da Salesforce atuam como "auditores independentes", ajudando-nos a encontrar lacunas ou percepções fora de nossos testes habituais. Essas equipes incluem acessibilidade, jurídico e outras, como certificações ou Trailhead. Embora eles possam não lidar com os maiores problemas dos clientes, seu trabalho ainda é muito importante para nos ajudar a atender às nossas demandas de escala e garantir que estejamos avaliando o maior número possível de cenários de clientes.
Damos a essas equipes acesso às nossas ferramentas e estrutura para que elas possam executar seus próprios testes. Como líder da equipe de operações de IA, isso é uma grande parte do meu plano de crescimento. Trata-se de compartilhar nosso processo de avaliação para atender melhor às necessidades de todos os nossos clientes.
Conclusões: Use seus parceiros!
O que vem por aí?
O futuro da qualidade da resposta está cheio de possibilidades. À medida que novas ferramentas surgirem, continuaremos melhorando a forma como medimos e entendemos o desempenho de nossos agentes.
No momento, a qualidade da resposta analisa apenas uma resposta após a pergunta de um cliente. Embora isso seja útil, queremos avançar para a qualidade da conversa: medir toda a conversa, não apenas uma resposta.
Estamos explorando duas ideias:
- Da qualidade da resposta à qualidade da conversa:
Queremos pontuar conversas inteiras, não apenas respostas únicas. Uma boa resposta não pode corrigir uma série de respostas ruins. Esse é um foco e uma paixão tão grandes para nós que estamos explorando maneiras novas e diferentes de estender e evoluir nosso modelo atual para incluir a capacidade de avaliar toda a conversa. Nossa ideia inicial é que podemos criar um sistema de pontuação composto de um único turno que possa então ser comunicado como uma qualidade baseada em vários turnos. Em outras palavras, muitas respostas criam uma boa conversa. - Avaliação da conversa real usando critérios de aceitação:
Planejamos aplicar um conjunto geral de padrões, como tom, empatia e fluxo de conversa, a chats reais com clientes. Isso nos ajudará a medir conversas reais em grande escala. No entanto, esse conceito não aplica critérios de correção das respostas. Então…
Para avaliar se as respostas são precisas, estamos criando clusters de enunciados: grupos de perguntas semelhantes. Isso nos ajuda a aplicar critérios de aceitação a grupos de perguntas, em vez de apenas uma.
Também estamos trabalhando para usar como os engenheiros de suporte e os gerentes de sucesso do cliente resolvem problemas como um modelo "correto" para avaliar as respostas. Podemos criar critérios de aceitação altamente validados e democratizados, em vários clusters de perguntas, em grande escala. É muito legal.
No final, a IA é tão poderosa quanto as respostas que ela fornece. É por isso que a qualidade da resposta sempre será nossa estrela-guia, orientando como construímos, medimos e melhoramos o Agentforce para cada cliente que atendemos. Esse esforço para avaliar e melhorar a qualidade da resposta é uma área de paixão para minha equipe. Incentivo todos a pensar grande e tentar algo que pareça desconfortável ou assustador. Abrace o espírito de um futurista pensando no que poderia ser. Dito isso, terminarei compartilhando o lema e o mantra da minha equipe:
“Faça experiências. Confira."
Saiba mais sobre agentes de IA e como eles podem ajudar sua empresa.
Guia do Agentforce sobre raciocínio, tópicos, instruções e ações.
Crie sua equipe dos sonhos do Agentforce com essas habilidades
7 métricas de suporte que monitoramos para o Agentforce na Ajuda
Como minha equipe está trabalhando com agentes de IA e por que você deveria fazer o mesmo
Tudo pronto para dar o próximo passo com Agentforce?
Crie agentes rapidamente.
Veja mais detalhadamente como a criação de agentes funciona em nossa biblioteca.
Obtenha orientação especializada.
Lance Agentforce com velocidade, confiança e ROI que você pode medir.
Fale com um representante.
Conte-nos sobre as necessidades dos seus negócios, e ajudaremos você a encontrar respostas.