Por Zachary Stauber, director sénior de éxito digital, IA
El objetivo del autoservicio siempre ha sido ayudar a los clientes a obtener respuestas rápidamente. Pero queríamos ir más allá. Hace cinco años, nos propusimos redefinir el autoservicio, no solo para que sea más rápido, sino también para que los clientes se sientan seguros y capacitados. Creíamos que las personas debían sentirse apoyadas, incluso sin que un humano les ayudara. Esa creencia llevó a la creación de nuestro equipo de éxito digital.
Cuando lanzamos Agentforce la ayuda de Salesforce por primera vez, estábamos entusiasmados con su potencial. Lo vimos como una oportunidad de aportar más autonomía a la experiencia de autoservicio, algo por lo que llevábamos años trabajando. Para aquellos de nosotros que habíamos pasado incontables horas creando diálogos de chatbot, la IA de generación y los modelos de lenguaje de gran tamaño parecían un gran avance. Es una solución revolucionaria.
Pero luego llegó el día 2. La emoción disminuyó un poco, y comenzaron las preguntas difíciles, especialmente esta:
Esa pregunta generó una presión real. Lo vimos como una oportunidad de liderar, pero necesitábamos un plan sólido: Uno que nos permitiera crecer, aprender y mejorar Agentforce de una manera que beneficiara a los clientes y fuera medible.
Ha sido un viaje muy enriquecedor. Aunque aún queda mucho por hacer, estoy increíblemente orgulloso de nuestro equipo y del progreso que hemos logrado en la conducción y comprensión de la calidad de las respuestas para Agentforce en Help.
¿Qué es exactamente la calidad de las respuestas?
La calidad de las respuestas es simplemente el porcentaje de respuestas de Agentforce que cumplen con nuestros criterios de aceptación después de que se hace una pregunta individual. Nos referimos a esto como un "giro" en la conversación, y nuestra evaluación de calidad de respuestas hoy en día está optimizada para el primer giro de una conversación. Más adelante explicaré con más detalle cómo pensamos ir desarrollando nuestro enfoque, pero este método inicial consiste en una simple comprobación de aprobado/suspenso. Una respuesta cumple con los criterios o no. Y sí, utilizamos Agentforce para medirlo.
Por ejemplo, si hace 100 preguntas y el 50 % de las respuestas cumplen con sus criterios en el primer intento, se trata de una calidad de respuesta del 50 %.
Eso no significa que las otras 50 respuestas fueran completamente equivocadas. Simplemente no cumplían completamente con el estándar que usted estableció para una respuesta de alta calidad. En realidad, sus respuestas probablemente sean más "correctas", pero creemos que es importante establecer un listón alto basado en lo que creemos que representa una gran respuesta.
Debido a esto, la calidad de las respuestas por sí sola no es suficiente para determinar la eficacia. Debemos profundizar en el tema y también incluir métricas clave como la tasa de resolución y la tasa de escalado. Por ejemplo, nuestro punto de referencia de calidad de respuesta en octubre de 2025 fue del 60 %, con un objetivo de estar en el 75 % a finales de este año. Eso puede sonar poco, pero cuando se tiene en cuenta la variabilidad de las preguntas, las preguntas fuera del tema o la "pequeña charla", y los clientes que buscan la creación de casos en el primer turno, en realidad es bastante alto. Tener en cuenta todo este panorama (calidad de las respuestas, tasa de resolución y tasa de aumento) nos dio confianza en que estábamos en un buen lugar para lograr resultados empresariales clave.
Después de sentirnos cómodos con los datos, nos fijamos el objetivo de alcanzar un 75 % de calidad de respuesta este año. Me complace compartir que acabamos de alcanzar el 76 % en nuestra prueba más reciente. Lo logramos fortaleciendo nuestro marco, mejorando el contenido y la estrategia, y aprovechando al máximo nuestras herramientas de IA como RAG, incrustaciones y metadatos.
Y eso es, en realidad, todo lo que hay que saber. Profundizaré en cómo evaluamos la calidad de las respuestas, pero la pregunta de "¿Qué hace que una respuesta sea buena?" no tiene por qué ser un ejercicio nebuloso y abrumador.
La anatomía de la calidad de la respuesta
Al abordar la calidad de las respuestas, es fácil complicar las cosas en exceso, agregar demasiadas métricas y perder de vista lo que realmente importa. Esto puede generar confusión, debates interminables y no hay un camino claro a seguir.
La clave es mantenerse centrados en un objetivo único y claro que todos puedan alinearse.
Para nosotros, ese objetivo era: Ayude a los clientes a responder sus preguntas las 24 horas del día, los 7 días de la semana, con un proceso sencillo para ponerse en contacto con un agente humano si es necesario.
Una vez que tuvimos eso claro, lo vinculamos a dos resultados medibles:
- Aumento de Agentforce la tasa de resolución
- Reducción del volumen general de casos de soporte
La fórmula era sencilla:
A continuación, preguntamos: ¿Qué es una respuesta de calidad?
Después de revisar conversaciones reales, hablar con equipos y clientes y estudiar las prácticas recomendadas, llegamos a esta definición sencilla:
Queríamos una definición que todo el mundo, independientemente de su función o antecedentes, pudiera entender y usar. Si bien las métricas de IA como la RAG o la similitud con el coseno son importantes, no siempre son significativas para los líderes empresariales.
Al principio, cuando mencioné algo como: "Su similitud con el coseno es del 0,86 %", me miraron con cara de desconcierto. Fue entonces cuando nos dimos cuenta de que necesitábamos una forma más cercana de explicar qué es la calidad.
Por tanto, construimos nuestro sistema en torno a una idea clara y compartida: Una buena respuesta es relevante, correcta y completa.
Responsables de evaluaciones: La función creada para evaluar la calidad de las respuestas a escala
Una vez que tuvimos un concepto y una definición claros para la calidad de las respuestas, necesitábamos a alguien que gestionara el proceso, encontrara brechas e impulsara mejoras.
Ahí es donde entró en juego el rol de gestor de evaluaciones. Un nuevo papel que inventamos en nuestra organización diseñado para centrarse en la calidad de las respuestas y su gestión para nuestro agente de ayuda.
Estos contribuyentes individuales son responsables de mantener todo el marco de calidad de respuestas, ejecutar pruebas, analizar resultados y compartir información. Necesitan explicar ideas complejas en términos simples y pruebas de diseño que sean útiles tanto para ingenieros como para ejecutivos.
Como muchos de ustedes, no teníamos un presupuesto interminable para contratar a un equipo de evaluadores especializados en IA. Así que miramos internamente. Encontramos personas apasionadas de la IA, ansiosas por aprender y cómodas experimentando y aprendiendo rápidamente. Estoy orgulloso del equipo que hemos creado y de esta nueva función. En mi opinión, el gestor de evaluaciones se convertirá en un papel fundamental en cualquier organización que trabaje con agentes de IA en servicio y soporte.
Es probable que estas personas ya existan en su empresa. Pueden ser ingenieros de soporte, gestores de programas o analistas de datos. Así que a medida que construya su estrategia de calidad de respuestas, le animo a que busque dentro de su equipo actual el talento que ya quiere tener un impacto positivo en su historia de IA.
Enunciados sintéticos: La columna vertebral de nuestro marco de evaluaciones
Aproximadamente un mes después de que lanzáramos, nuestro volumen de conversaciones creció a miles cada semana. A medida que Agentforce creció el uso de en Help, nuestro sistema de evaluación tuvo que crecer con él.
Para ello, creamos un sistema basado en la idea de "agentes de prueba", utilizando la IA para evaluar las respuestas de Agentforce frente a criterios de aceptación claros: la respuesta debe ser relevante, correctay completa.
Sin embargo, analizar las conversaciones reales de los clientes a escala es difícil. Hay demasiadas variaciones y no hay suficiente control para medir el rendimiento de forma fiable. Así que creamos un enfoque más manejable y escalable utilizando algo que llamamos enunciados sintéticos.
Los enunciados sintéticos son realistas, pero falsos, las preguntas de los clientes se basan en datos reales de soporte. Piense en registros de casos, búsquedas en la web y canales de comentarios. Estos representan los principales problemas de nuestros clientes, y actualizamos regularmente la lista para reflejar las necesidades actuales.
Cuando lanzamos en octubre, teníamos alrededor de enunciados sintéticos. Hoy en día, contamos con varios cientos, y nuestro objetivo es cerca de mil pronto, lo suficiente como para reflejar con confianza las necesidades de los clientes a escala, pero de una manera que permita tener un entorno de pruebas controlado.
Para cada pregunta, trabajamos con ingenieros de soporte y expertos en productos para definir criterios de aceptación específicos, o los requisitos específicos que sirven de buena respuesta a esa pregunta. Estas se escriben en lo que llamamos solicitudes de jueces de LLM, que permiten a la IA evaluar automáticamente Agentforcelas respuestas de para determinar su relevancia, corrección e integridad.
Estos son algunos ejemplos de algunos casos de uso comunes.
Criterios de enunciación y aceptación
| Enunciado sintético | Criterios de aceptación |
| ¿Cómo me ato los zapatos? | La respuesta debe ser : Relevante: La respuesta debe incluir referencias a atarse zapatos, incluidos los cordones, y tipos de zapatos que utilizan cordones para zapatos, como zapatillas de deporte, botas o zapatillas de running. Corregir: La respuesta debe incluir los siguientes pasos en este orden: Haga un nudo básico, cómo usar las orejas de conejo y tirar de los bucles firmemente para asegurar la corbata. Complete: La respuesta es completa si incluye orientación sobre zapatos que no incluyan cordones, como sandalias, chanclas, slip ons o zapatos de velcro. |
| ¿Cómo me cepillo los dientes? | La respuesta debe ser : Relevante: La respuesta debe incluir palabras y frases como pasta de dientes, cepillarse con movimientos circulares y cepillarse los dientes en su propia boca. Corregir: La respuesta debe seguir estos pasos: Tome un cepillo de dientes, ponga pasta dental en el cepillo, aplique la pasta dental en los dientes con el cepillo y cepíllese durante unos dos minutos por sesión. Complete: La respuesta debe incluir información adicional sobre el valor de usar hilo dental y enjuague bucal. |
Armados con estos enunciados sintéticos que representaban las preguntas de nuestros clientes y los criterios de aceptación de los expertos en la materia examinados, pasamos a la siguiente fase de nuestra operación: Las herramientas.
Creación y aplicación de agentes. Pruebas de agentes
En los primeros días de Agentforce, leíamos manualmente cada transcripción del chat. De verdad. Era complicado y llevaba mucho tiempo. A medida que las conversaciones crecían, rápidamente se volvió imposible mantenerse al día.
Ahí es donde los enunciados sintéticos y los criterios de aceptación se volvieron cruciales. Nos permiten probar Agentforce sin depender de las interacciones con los clientes en directo. Pero todavía necesitábamos una herramienta para hacer que los agentes de pruebas de agentes fueran una realidad.
Afortunadamente, nuestro increíble equipo de ingeniería de Salesforce intervino. Compartimos los requisitos y crearon una herramienta con aplicaciones de Salesforce y Agentforce API públicas. Llamamos agentes de pruebas de TI.
Así funciona:
- Introducimos nuestro repositorio de enunciados sintéticos (preguntas de prueba) y criterios de aceptación en la herramienta.
- La herramienta hace Agentforce esa pregunta en nuestro entorno en vivo
- Agentforce Responde y la herramienta comprueba la respuesta con nuestros criterios de aceptación.
- El resultado (paso/fallo) se muestra en un informe de Salesforce, que podemos exportar a herramientas como Hojas de cálculo, Excel o Tableau.
Este proceso nos proporciona nuestra puntuación de calidad de respuesta.
A continuación, nuestros gerentes de evaluación revisan las respuestas fallidas y las etiquetan con una clasificación de problemas: una etiqueta que explica por qué la respuesta no cumplió con los criterios.
Estas clasificaciones ayudan a nuestros expertos en IA en estrategia, ingeniería y ciencia de datos a investigar y solucionar problemas. Algunos tipos de clasificación comunes incluyen (pero no se limitan a):
Clasificación y definiciones de problemas
| Clasificación de casos | Definición |
| Producto incorrecto | La respuesta no comprendía ni identificaba el producto que la pregunta tenía la intención de abordar. Por ejemplo, la pregunta era sobre Service Cloud, pero la respuesta fue en lo que respecta a Marketing Cloud. |
| Respuesta irrelevante | La respuesta no comprendía la pregunta y proporcionaba información que era irrelevante para la intención de la pregunta original. |
| Respuesta incorrecta | La respuesta es objetivamente inexacta. |
| No hay contenido disponible | Agentforce proporciona una respuesta alucinada o un mensaje que indica que no pudo encontrar contenido relevante para proporcionar una respuesta. |
| No se ha dado respuesta / Salvaguarda inesperada | Agentforce No se proporcionó una respuesta (es decir, el estado de error) o se proporcionó un mensaje de salvaguarda inesperado (es decir, un mensaje de respuesta infundada) |
| Mal formato | La respuesta proporcionada por Agentforce no se ajusta al formato de respuesta diseñado. |
Nuestras clasificaciones de problemas siguen evolucionando. A medida que hemos aprendido más, nos hemos dado cuenta de que algunas cosas que solíamos realizar un seguimiento no eran tan útiles como pensábamos, y hemos ido ajustando con el tiempo. Por ejemplo, nuestra lista inicial incluía soluciones como el problema de recuperación. Lo que encontramos es que tener una taxonomía de clasificación de problemas que incorporaba soluciones, tendía a llevarnos por el camino equivocado. La conclusión fue que centrarse en el problema raíz realmente le ayudará a avanzar más rápido en su análisis de la causa raíz y a resolver el problema real.
Además, descubrimos a través de nuestros esfuerzos que a veces encontramos "fallos falsos": Escenarios en los que Agentforce realmente estaba respondiendo la pregunta correctamente, pero nuestros criterios de aceptación, herramientas o incluso nuestras propias percepciones no calibradas como humanos evaluando respuestas pueden haber influido en nuestro juicio. Estar abiertos a este tipo de problemas nos ayudó a crear un manual de estrategias más sólido y abordar las preocupaciones de confianza en nuestros hallazgos e información práctica.
También nos centramos en ampliar y reducir la carga de trabajo de nuestros responsables de evaluaciones. Para ayudar con eso, hemos comenzado a probar la IA para identificar automáticamente por qué falló una respuesta, en función de las definiciones de nuestras clasificaciones de problemas. Los primeros resultados son muy prometedores, y con nuestras expresiones sintéticas en camino de crecer más allá de los 1000, estoy seguro de que nuestro equipo puede mantenerse al día con la demanda mediante el uso de la IA.
También estamos entusiasmados con las nuevas herramientas de Capacidad de observación de Agentforce. Como Agentforce Customer Zero, nos estamos asociando estrechamente con el equipo de productos para pilotear funciones como el Centro de pruebas, el seguimiento de sesionesy más. Estas herramientas integradas se están convirtiendo en una parte clave de nuestra estrategia, y nos estamos preparando para pasar a ellas a medida que estén disponibles de forma general. Harán que nuestra historia de calidad de respuesta sea mucho más vívida, fácil de entender y comunicar. Si te digo la verdad, Agentforceojalá hubiéramos tenido estas herramientas cuando hicimos nuestro primer lanzamiento.
Qué pruebas realizamos, con qué frecuencia y por qué
Resumimos. Tenemos un conjunto de expresiones sintéticas que cubren los principales problemas de nuestros clientes. Nuestros expertos han aprobado los criterios de aceptación de buenas respuestas, y tenemos una herramienta para comprobar estas respuestas a gran escala. Tenemos el último artículo, un equipo de gestores de evaluación que revisan los resultados para tomar medidas.
Entonces, ¿cuándo se hacen las pruebas? ¿Con qué frecuencia? ¿Qué tipos de pruebas?
Para nosotros, como equipo de operaciones de IA, gestionamos tres tipos de evaluaciones: Base sintética, nueva función y bajo demanda.
Evaluación de línea base sintética
Esta es nuestra evaluación más importante y frecuente.
La línea base sintética realiza un seguimiento de la calidad de nuestra respuesta a lo largo del tiempo. A medida que lanzamos nuevas funciones, contenido o datos, probamos regularmente cómo esos cambios afectan al rendimiento, utilizando nuestro conjunto de preguntas sintéticas y criterios de aceptación.
Esto crea una línea de base que todas las actualizaciones nuevas Agentforce deben cumplir o superar antes de entrar en funcionamiento. Garantiza que estamos mejorando, no retrocediendo.
Realizamos estas evaluaciones dos veces al mes, alineadas con nuestros ciclos de sprint. A continuación, combinamos los resultados en una puntuación mensual de calidad de respuestas, que compartimos en cuadros de puntuación, reseñas empresariales y mucho más.
Este proceso es la base de nuestra estrategia de IA para la calidad de las respuestas.
Evaluación de nuevas funciones
Además de nuestras pruebas de referencia regulares, también evaluamos nuevas funciones, datos o tecnología a lo largo de su desarrollo. A este enfoque le llamamos desarrollo basado en la evaluación. Garantiza que todo lo que publiquemos cumpla o supere nuestra línea base sintética establecida.
La principal diferencia es que las evaluaciones de nuevas funciones utilizan un conjunto más pequeño y específico de expresiones sintéticas específicas del cambio que se está probando. Estas pruebas se ejecutan según sea necesario durante el desarrollo, y los resultados se comparten con los equipos de ingeniería, contenido o datos para guiar las mejoras desde el desarrollo hasta la QA y la UAT.
Una vez que la función se pone en marcha, las preguntas de prueba que utilizamos se añaden a nuestro repositorio principal y se incluyen en futuras pruebas de referencia.
Por ejemplo, cuando lanzamos el Agente de ayuda en el portal de ayuda deSlack, la persona responsable de las evaluaciones creó 96 enunciados sintéticos personalizados y criterios de aceptación. La función pasó por encima de la línea de referencia y se lanzó a producción. Esas 96 preguntas ahora forman parte de nuestras pruebas en curso.
Bajo demanda
También debemos ejecutar pruebas específicas a petición para detectar errores, problemas inesperados, problemas de experiencia o cambios de última hora para comprobar el rendimiento del Agente de Help. Estas son cosas como malas respuestas para nuevas funciones o productos, respuestas poco claras o, en general, malas experiencias con el Agente de Help. Dado que ya tenemos evaluaciones de referencia y nuevas funciones, agregar pruebas bajo demanda fue una opción natural.
Además, muchos equipos de Salesforce actúan como "auditores independientes", lo que nos ayuda a encontrar lagunas o información práctica fuera de nuestras pruebas habituales. Estos equipos incluyen Accesibilidad, Legal y otros como Certificaciones o Trailhead. Si bien es posible que no se ocupen de los mayores problemas de los clientes, su trabajo sigue siendo muy importante para ayudarnos a satisfacer nuestras demandas de escala y garantizar que estamos evaluando para el mayor número posible de escenarios de clientes.
Damos a estos equipos acceso a nuestras herramientas y marco para que puedan ejecutar sus propias pruebas. Como líder del equipo de operaciones de IA, esto es una parte importante de mi plan de crecimiento. Se trata de compartir nuestro proceso de evaluación para satisfacer mejor las necesidades de todos nuestros clientes.
Conclusión clave: ¡Utilice a sus socios!
¿Qué es lo siguiente?
El futuro de la calidad de las respuestas está lleno de posibilidades. A medida que lleguen nuevas herramientas, seguiremos mejorando la forma en que medimos y entendemos el rendimiento de nuestros agentes.
En este momento, Respuesta de calidad solo se centra en una respuesta después de la pregunta de un cliente. Aunque esto es útil, queremos avanzar hacia la calidad de la conversación: midiendo toda la conversación, no solo una respuesta.
Estamos explorando dos ideas:
- Desde la calidad de las respuestas hasta la calidad de las conversaciones:
Queremos puntuar conversaciones completas, no solo respuestas individuales. Una buena respuesta no puede compensar una serie de respuestas malas. Esto nos apasiona tanto que estamos explorando formas nuevas y diferentes de ampliar y desarrollar nuestro modelo actual para incluir la capacidad de evaluar la conversación en su totalidad. Nuestra idea inicial es que podemos crear un sistema compuesto de puntuación de un solo turno que luego se pueda comunicar como calidad basada en varios turnos. En otras palabras, muchas respuestas forman una buena conversación. - Evaluación de conversaciones reales con criterios de aceptación:
Planeamos aplicar un conjunto general de estándares, como el tono, la empatía y el flujo de conversación, a los chats reales de los clientes. Esto nos ayudará a medir conversaciones reales a gran escala. Sin embargo, este concepto no aplica criterios para la corrección de las respuestas. Así que...
Para juzgar si las respuestas son precisas, estamos creando grupos de enunciados: grupos de preguntas similares. Esto nos ayuda a aplicar criterios de aceptación a grupos de preguntas en lugar de solo una.
También estamos trabajando en cómo los ingenieros de soporte y los gerentes de éxito de los clientes resuelven los problemas como un modelo "correcto" para juzgar las respuestas. Podemos crear criterios de aceptación altamente verificados y democratizados, en múltiples grupos de preguntas, a escala. Es genial.
Al final, la IA es tan potente como las respuestas que proporciona. Por eso, la calidad de las respuestas siempre será nuestra estrella principal, y guiará la forma en que construimos, medimos y mejoramos Agentforce para cada cliente que atendemos. Este esfuerzo por evaluar y mejorar la calidad de las respuestas es un espacio apasionado para mi equipo. Animo a todos a pensar en grande y probar algo que resulte incómodo o desalentador. Adopte el espíritu de un pensamiento futurista sobre lo que podría ser. En ese sentido, terminaré compartiendo el lema y el mantra de mi equipo:
“Experimente. Descúbralo.
Obtenga más información sobre los agentes de IA y cómo pueden ayudar a su empresa.
La guía de razonamiento, temas, instrucciones y acciones de Agentforce.
Cree su equipo soñado de Agentforce con estas habilidades
Siete mediciones de asistencia que supervisamos de Agentforce en el sitio de ayuda
Cómo trabaja mi equipo con los agentes de IA, y por qué el suyo también debería hacerlo
¿Todo listo para dar el siguiente paso con Agentforce?
Cree técnicos rápidamente.
Conozca en detalle cómo funciona la creación de agentes en nuestra biblioteca.
Obtenga orientación experta.
Lance Agentforce rápidamente, con confianza y consiga un ROI que pueda medir.
Hable con un representante.
Cuéntenos las necesidades de su negocio y le ayudaremos a encontrar respuestas.