por Zachary Stauber, Director sénior, Éxito Digital, IA
El objetivo del autoservicio siempre ha sido ayudar a los clientes a obtener respuestas rápidamente. Pero queríamos ir más allá. Hace cinco años, nos propusimos redefinir el autoservicio, no solo para hacerlo más rápido, sino para que los clientes se sientan seguros y empoderados. Creíamos que las personas deberían sentirse apoyadas, incluso sin que un ser humano las ayudara. Ese convencimiento llevó a la creación de nuestro equipo de éxito digital.
Cuando lanzamos por primera vez Agentforce en Ayuda de Salesforce, nos entusiasmó su potencial. Lo vimos como una oportunidad para aportar más autonomía a la experiencia de autoservicio, algo por lo que habíamos estado trabajando durante años. Para aquellos de nosotros que habíamos dedicado incontables horas a crear diálogos con chatbots, la IA generativa y los grandes modelos de lenguaje se sentían como un avance. Fue revolucionario.
Pero luego llegó el Día 2. La emoción disminuyó un poco y surgieron las preguntas difíciles, especialmente esta:
Esa pregunta generó una presión real. Lo vimos como una oportunidad para liderar, pero necesitábamos un plan sólido: uno que nos permitiera crecer, aprender y mejorar Agentforce de una manera que beneficiara a los clientes y fuera medible.
Fue un recorrido significativo. Si bien aún queda más por hacer, estoy increíblemente orgulloso de nuestro equipo y del progreso que hemos logrado para impulsar y comprender la calidad de las respuestas de Agentforce en Ayuda.
¿Qué es la calidad de la respuesta, literalmente?
La calidad de la respuesta es simplemente el porcentaje de respuestas de Agentforce que cumplen con nuestros criterios de aceptación después de que se hace una pregunta individual. Nos referimos a esto como un "turno" dentro de la plática, y nuestra evaluación de la calidad de la respuesta hoy está optimizada para el primer turno de una plática. Más adelante, explicaré un poco más sobre cómo planeamos evolucionar nuestro enfoque, pero este método inicial es una verificación directa de aprobado/reprobado. Una respuesta cumple con los criterios o no lo hace. Y sí, utilizamos Agentforce para medir esto.
Por ejemplo, si haces 100 preguntas y 50 de las respuestas cumplen con tus criterios en el primer intento, esa es una calidad de respuesta del 50 %.
Eso no significa que las otras 50 respuestas fueron completamente erróneas. Simplemente no cumplían completamente el estándar que estableciste para una respuesta de alta calidad. En realidad, tus respuestas probablemente sean más "correctas", pero creemos que es importante establecer un listón alto en función de lo que creemos que representa una gran respuesta.
Debido a esto, la calidad de la respuesta por sí sola no es suficiente para determinar la eficacia. Necesitamos profundizar y también incluir mediciones clave como la tasa de resolución y la tasa de escalamiento. Por ejemplo, nuestro punto de referencia de calidad de respuesta en octubre de 2025 fue del 60 %, con un objetivo de llegar al 75 % a finales de este año. Puede sonar bajo, pero cuando se tiene en cuenta la variabilidad de las preguntas, las preguntas fuera de tema o la "charla casual", y los clientes que buscan la creación de casos en el primer turno, en realidad es bastante alto. Al considerar todo este panorama (calidad de respuesta, tasa de resolución y tasa de escalamiento) nos dio confianza en que estábamos en un buen lugar para lograr resultados comerciales clave.
Después de sentirnos cómodos con los datos, nos fijamos el objetivo de alcanzar el 75 % de calidad de respuesta este año. Me complace compartir que acabamos de alcanzar el 76 % en nuestra prueba más reciente. Lo logramos fortaleciendo nuestro marco, mejorando el contenido y la estrategia, y aprovechando al máximo nuestras herramientas de IA, como la generación aumentada de recuperación (RAG), las incrustaciones y los metadatos.
Eso es básicamente todo. Profundizaré en cómo evaluamos la calidad de las respuestas, pero la pregunta de "¿Qué hace que una respuesta sea buena?" no tiene por qué ser un ejercicio nebuloso y abrumador.
Anatomía de la calidad de la respuesta
Al abordar la calidad de la respuesta, es fácil complicar demasiado las cosas, agregar demasiadas mediciones y perder de vista lo que realmente importa. Esto puede generar confusión, debates interminables y ninguna ruta clara a seguir.
La clave es mantenerse enfocado en un único objetivo claro con el que todos puedan alinearse.
Para nosotros, ese objetivo era: Ayuda a los clientes a obtener respuestas a sus preguntas las 24 horas del día, los 7 días de la semana, con un camino fácil para llegar a una persona cuando sea necesario.
Una vez que tuvimos esa claridad, la vinculamos a dos resultados medibles:
- Aumentar la tasa de resolución de Agentforce
- Disminuir el volumen general de casos de soporte
La fórmula era sencilla:
A continuación, preguntamos: ¿Qué es una respuesta de calidad?
Después de revisar pláticas reales, hablar con equipos y clientes, y estudiar las prácticas recomendadas, llegamos a esta definición simple:
Queríamos una definición que todos, más allá de su función o fondo, pudieran comprender y utilizar. Si bien las mediciones de IA como la RAG o la similitud del coseno son importantes, no siempre son significativas para los líderes empresariales.
Al principio, cuando mencioné algo como: "Tu similitud de coseno es 0,86", no se entendía lo que decía. Fue entonces cuando nos dimos cuenta de que necesitábamos una forma más confiable de explicar la calidad.
Por lo tanto, construimos nuestro sistema en torno a una idea clara y compartida: Una gran respuesta es relevante, correcta y completa.
Gerentes de evaluaciones: La función creada para evaluar la calidad de las respuestas a escala
Una vez que teníamos un concepto y una definición claros para la calidad de las respuestas, necesitábamos a alguien que gestionara el proceso, encontrara brechas e impulsara mejoras.
Ahí es donde entra en juego la función de gerente de evaluación. Una nueva función que inventamos en nuestra organización diseñada para centrarse en la calidad de las respuestas y su gestión para nuestro Agente de Help.
Estos colaboradores individuales son responsables de mantener todo el marco de calidad de las respuestas, ejecutar pruebas, analizar resultados y compartir información. Necesitan explicar ideas complejas en términos simples y pruebas de diseño que sean útiles tanto para ingenieros como para ejecutivos.
Como muchos de ustedes, no teníamos un presupuesto interminable para contratar a un equipo de evaluadores de IA especializados. Así que miramos internamente. Encontramos personas apasionadas por la IA, ansiosas por aprender y cómodas experimentando y aprendiendo rápidamente. Estoy orgulloso del equipo que hemos creado y de esta nueva función. En mi opinión, el gerente de evaluación se convertirá en una función fundamental en cualquier organización que trabaje con agentes de IA en servicio y soporte.
Es probable que estas personas ya existan en tu compañía. Pueden ser ingenieros de soporte, gerentes de programas o analistas de datos. Por lo tanto, a medida que creas tu estrategia de calidad de respuesta, te animo a buscar dentro de tu equipo actual el talento que ya quiere tener un impacto positivo en tu historia de IA.
Declaraciones sintéticas: La columna vertebral de nuestro marco de evaluaciones
Aproximadamente un mes después del lanzamiento, nuestro volumen de pláticas creció a miles cada semana. A medida que creció el uso de Agentforce en Ayuda, nuestro sistema de evaluación tuvo que crecer con él.
Para ello, creamos un sistema basado en la idea de "Agentes que evalúan a otros agentes", utilizando la IA para evaluar las respuestas de Agentforce en función de criterios de aceptación claros: la respuesta debe ser relevante, correctay completa.
Sin embargo, analizar pláticas reales con los clientes a escala es difícil. Hay demasiada variación y no hay suficiente control para medir de manera confiable el rendimiento. Así que creamos un enfoque más manejable y escalable utilizando algo que llamamos expresiones sintéticas.
Las expresiones sintéticas son preguntas realistas, pero falsas, de los clientes basadas en datos reales de soporte. Piensa en los registros de casos, las búsquedas en la web y los canales de comentarios. Estos representan los principales problemas de nuestros clientes y actualizamos regularmente la lista para reflejar las necesidades actuales.
Cuando lanzamos en octubre, teníamos alrededor de un centenar de declaraciones sintéticas. Hoy en día, tenemos varios cientos y nuestro objetivo es cerca de mil pronto, lo suficiente para reflejar con confianza las necesidades de los clientes a escala, pero de una manera que permita tener un entorno de pruebas controlado.
Para cada pregunta, trabajamos con ingenieros de soporte y expertos en productos para definir criterios de aceptación específicos o los requisitos específicos que constituyen una buena respuesta para esa pregunta. Estos se escriben en lo que llamamos solicitudes de jueces de LLM, que permiten a la IA evaluar automáticamente Agentforcelas respuestas de relevancia, corrección e integridad.
Estos son algunos ejemplos que utilizan algunos casos de uso comunes.
Criterios de expresión y aceptación
| Expresión sintética | Criterios de aceptación |
| ¿Cómo me ato los zapatos? | La respuesta debe ser: Relevante: La respuesta debe incluir referencias a atar zapatos, incluidos los cordones, y tipos de zapatos que usan cordones de zapatos, como zapatillas de deporte, botas o zapatillas para correr. Correcto: La respuesta debe incluir los siguientes pasos en este orden: Haz un nudo básico, cómo usar las orejas de conejo y tirando de los lazos apretados para asegurar la corbata. Completa: La respuesta es completa si incluye orientación sobre zapatos que no incluyen cordones como sandalias, chanclas, mocasines o zapatos con velcro. |
| ¿Cómo me lavo los dientes? | La respuesta debe ser: Relevante: La respuesta debe incluir palabras y frases como pasta de dientes, cepillarse con un movimiento circular y cepillarse los dientes en la boca. Correcto: La respuesta debe seguir estos pasos: Coge un cepillo de dientes, pon pasta de dientes en el cepillo, aplica la pasta de dientes en tus dientes con el cepillo, cepilla durante unos dos minutos por sesión. Completa: La respuesta debe incluir información adicional sobre el valor de usar hilo dental y enjuague bucal. |
Armados con estas expresiones sintéticas que representaban las preguntas de nuestros clientes y los criterios de aceptación revisados por expertos en la materia, llegamos a la siguiente fase de nuestra operación: Herramientas.
Creación y aplicación de Agentes que evalúan a otros agentes
En los inicios de Agentforce, leíamos manualmente cada transcripción del chat. En verdad. Era complicado y llevaba mucho tiempo. A medida que las pláticas crecieron, rápidamente se volvió imposible mantenerse al día.
Ahí es donde las expresiones sintéticas y los criterios de aceptación se volvieron cruciales. Nos permiten probar Agentforce sin depender de las interacciones en vivo con los clientes. Pero todavía necesitábamos una herramienta para hacer que los agentes que evalúan a otros agentes sean una realidad.
Afortunadamente, aquí intervino nuestro increíble equipo de ingeniería de Salesforce. Compartimos los requisitos y crearon una herramienta con aplicaciones de Salesforce y API públicas de Agentforce. Lo llamamos Agentes que evalúan a otros agentes.
Así es como funciona:
- Ingresamos nuestro repositorio de expresiones sintéticas (preguntas de prueba) y criterios de aceptación en la herramienta.
- La herramienta hace esa pregunta a Agentforce en nuestro entorno en vivo
- Agentforce responde y la herramienta comprueba la respuesta en función de nuestros criterios de aceptación.
- El resultado (aprobado/reprobado) se muestra en un informe de Salesforce, que podemos exportar a herramientas como Sheets, Excel o Tableau.
Este proceso nos proporciona nuestra puntuación de calidad de la respuesta.
A continuación, nuestros gerentes de evaluación revisan las respuestas reprobadas y las etiquetan con una clasificación de problemas: una etiqueta que explica por qué la respuesta no cumplía con los criterios.
Estas clasificaciones ayudan a nuestros expertos en IA en estrategia, ingeniería y ciencia de datos a investigar y solucionar problemas. Algunos tipos de clasificación comunes incluyen (pero no se limitan a):
Clasificación y definiciones de problemas
| Clasificación de casos | Definición |
| Producto incorrecto | La respuesta no comprendía ni identificaba el producto que la pregunta pretendía abordar. Por ejemplo, la pregunta era acerca de Service Cloud, pero la respuesta se refería a Marketing Cloud. |
| Respuesta irrelevante | La respuesta no comprendía la pregunta y proporcionaba información que era irrelevante para la intención de la pregunta original. |
| Respuesta incorrecta | La respuesta es objetivamente inexacta. |
| No hay contenido disponible | Agentforce proporciona una respuesta alucinada o un mensaje que indica que no pudo encontrar contenido relevante para proporcionar una respuesta. |
| Sin respuesta proporcionada / Salvaguarda inesperado | Agentforce falló en proporcionar una respuesta (es decir, estado de error), o proporcionó un mensaje de salvaguarda inesperado (es decir, una respuesta sin fundamento) |
| Formato deficiente | La respuesta proporcionada por Agentforce no se ajusta al formato de respuesta diseñado. |
Nuestras clasificaciones de problemas siguen evolucionando. A medida que hemos aprendido más, nos hemos dado cuenta de que algunas cosas que solíamos rastrear no eran tan útiles como pensábamos, y las fuimos ajustando con el tiempo. Por ejemplo, nuestra lista inicial incluía soluciones como el Problema de recuperación. Lo que descubrimos es que tener una taxonomía de clasificación de problemas que incorporara soluciones tenía una tendencia a llevarnos por el camino equivocado. La conclusión fue que centrarte en el problema raíz en realidad te ayudará a avanzar más rápido en el análisis de la causa raíz y a resolver el problema real.
Además, descubrimos a través de nuestros esfuerzos que a veces encontramos "Falsos fracasos": escenarios en los que Agentforce en realidad respondía la pregunta correctamente, pero nuestros criterios de aceptación, herramientas o incluso nuestras propias percepciones no calibradas como humanos que evalúan las respuestas pueden haber influido en nuestro juicio. Estar abiertos a este tipo de problemas nos ayudó a crear una guía de estrategias más sólida y abordar las preocupaciones de confianza en nuestros hallazgos e información.
También nos centramos en ampliar y reducir la carga de trabajo de nuestros gerentes de evaluación. Para ayudar con eso, hemos comenzado a probar la IA para identificar automáticamente por qué una determinada respuesta falló, en función de las definiciones de nuestras clasificaciones de problemas. Los primeros resultados son muy prometedores, y con nuestras expresiones sintéticas en camino de crecer más allá de 1000, estoy seguro de que nuestro equipo puede mantenerse al día con la demanda mediante el uso de la IA.
También estamos entusiasmados con las nuevas herramientas de Capacidad de observación de Agentforce. Como Agentforce Customer Zero, nos asociamos estrechamente con el equipo de productos para probar funciones como el Centro de pruebas, el seguimiento de sesiones y más. Estas herramientas integradas se están convirtiendo en una parte clave de nuestra estrategia, y nos estamos preparando para pasar a ellas a medida que estén disponibles de forma general. Harán que nuestra historia de calidad de respuesta sea mucho más vívida, fácil de comprender y comunicarse. Si soy honesto, ¡ojalá hubiésemos tenido estas herramientas cuando lanzamos Agentforce por primera vez!
Qué pruebas realizamos, con qué frecuencia y por qué
Recapitulemos. Tenemos un conjunto de expresiones sintéticas que cubren los principales problemas de nuestros clientes. Nuestros expertos han aprobado los criterios de aceptación de las buenas respuestas y tenemos una herramienta para verificar estas respuestas a gran escala. Tenemos la última pieza, un equipo de gerentes de evaluación que revisan los resultados para tomar medidas.
Entonces, ¿cuándo evalúan? ¿Con qué frecuencia? ¿Qué tipos de pruebas?
Para nosotros, como equipo de operaciones de IA, manejamos tres tipos de evaluaciones: Línea de base sintética, nueva función y bajo demanda.
Evaluación de línea de base sintética
Esta es nuestra evaluación más importante y frecuente.
La línea de base sintética realiza un seguimiento de nuestra calidad de respuesta a lo largo del tiempo. A medida que lanzamos nuevas funciones, contenido o datos, probamos regularmente cómo afectan esos cambios al rendimiento, utilizando nuestro conjunto de preguntas sintéticas y criterios de aceptación.
Esto crea una línea de base que todas las actualizaciones nuevas Agentforce deben cumplir o superar antes de comenzar a funcionar. Garantiza que estemos mejorando, no retrocediendo.
Realizamos estas evaluaciones dos veces al mes, alineadas con nuestros ciclos de sprint. Luego, combinamos los resultados en una puntuación mensual de calidad de respuesta, que compartimos en tarjetas de puntuación, revisiones de negocio y más.
Este proceso es la base de nuestra estrategia de IA para la calidad de las respuestas.
Evaluación de nuevas funciones
Además de nuestras pruebas de referencia regulares, también evaluamos nuevas funciones, datos o tecnología a lo largo de su desarrollo. Llamamos a este enfoque Desarrollo impulsado por la evaluación. Garantiza que todo lo que lancemos cumpla o supere nuestra línea de base sintética establecida.
La principal diferencia es que las evaluaciones de nuevas funciones utilizan un conjunto más pequeño y específico de expresiones sintéticas específicas del cambio que se está probando. Estas pruebas se ejecutan según sea necesario durante el desarrollo y los resultados se comparten con los equipos de ingeniería, de contenido o de datos para orientar las mejoras desde el desarrollo hasta la QA y la UAT.
Una vez que la función se publica, las preguntas de prueba que utilizamos se agregan a nuestro repositorio principal y se incluyen en futuras pruebas de referencia.
Por ejemplo, cuando lanzamos el Agente de Help en el portal de ayuda de Slack, nuestro gerente de evaluaciones creó 96 expresiones sintéticas personalizadas y criterios de aceptación. La función pasó por encima de la línea de base y se lanzó a producción. Esas 96 preguntas ahora forman parte de nuestras pruebas continuas.
Bajo demanda
También necesitamos ejecutar pruebas específicas bajo demanda para detectar errores, problemas inesperados, problemas de experiencia o cambios de último minuto para comprobar el rendimiento del Agente de Help. Estas son cosas tales como malas respuestas para nuevas funciones o productos, respuestas poco claras o, en general, malas experiencias con el Agente de Help. Dado que ya tenemos evaluaciones de línea base y nuevas funciones, agregar pruebas bajo demanda fue una opción natural.
Además, muchos equipos de Salesforce actúan como "auditores independientes", lo que nos ayuda a encontrar brechas o información fuera de nuestras pruebas habituales. Estos equipos incluyen Accesibilidad, Legal y otros como Certificaciones o Trailhead. Si bien es posible que no manejen los mayores problemas de los clientes, su trabajo sigue siendo muy importante para ayudarnos a satisfacer nuestras demandas de escala y garantizar que estemos evaluando para la mayor cantidad de escenarios posibles de clientes.
Les damos a estos equipos acceso a nuestras herramientas y marcos para que puedan ejecutar sus propias pruebas. Como líder del equipo de operaciones de IA, esta es una gran parte de mi plan de crecimiento. Se trata de compartir nuestro proceso de evaluación para satisfacer mejor las necesidades de todos nuestros clientes.
Punto clave: ¡Utiliza a tus socios!
¿Qué sigue?
El futuro de la calidad de las respuestas está lleno de posibilidades. A medida que se incorporen nuevas herramientas, seguiremos mejorando la forma en que medimos y comprendemos el rendimiento de nuestros agentes.
En este momento, la calidad de las respuestas se centra en una sola respuesta después de la pregunta de un cliente. Si bien esto es útil, queremos avanzar hacia la calidad de la plática: medir toda la plática, no solo una respuesta.
Estamos explorando dos ideas:
- Desde la calidad de las respuestas hasta la calidad de las pláticas:
Queremos puntuar pláticas completas, no solo respuestas individuales. Una buena respuesta no compensa una serie de malas respuestas. Es un enfoque y una pasión tales para nosotros que estamos explorando nuevas y diferentes formas de ampliar y evolucionar nuestro modelo actual a fin de incluir la capacidad de evaluar toda la plática. Nuestra idea inicial es que podamos crear un sistema compuesto de puntuación de un solo turno que luego se pueda comunicar como una calidad basada en varios turnos. En otras palabras, muchas buenas respuestas hacen una buena plática. - Evaluación de pláticas reales utilizando criterios de aceptación:
Planeamos aplicar un conjunto general de estándares, como tono, empatía y flujo de pláticas, a los chats reales de los clientes. Esto nos ayudará a medir pláticas reales a gran escala. Sin embargo, este concepto no aplica criterios para la corrección de las respuestas. Así que...
Para juzgar si las respuestas son precisas, estamos creando grupos de expresiones: grupos de preguntas similares. Esto nos ayuda a aplicar criterios de aceptación a grupos de preguntas en lugar de a una sola.
También estamos trabajando en cómo los ingenieros de soporte y los gerentes de éxito del cliente resuelven los problemas como un modelo "correcto" para evaluar las respuestas. Podemos crear criterios de aceptación altamente verificados y democratizados, en múltiples grupos de preguntas, a escala. Es bastante genial.
Al final, la IA es tan poderosa como las respuestas que proporciona. Es por eso que la calidad de las respuestas siempre será nuestra estrella del norte, que guiará cómo desarrollamos, medimos y mejoramos Agentforce para cada cliente que atendemos. Este esfuerzo por evaluar y mejorar la calidad de las respuestas es una pasión para mi equipo. Animo a todos a pensar en grande y probar algo que se sienta incómodo o intimidante. Adopta el espíritu de un pensamiento futurista sobre lo que podría ser. En ese sentido, terminaré compartiendo el lema y el mantra de mi equipo:
“Hacer lío. Descubrir resultados.”
Obtén más información sobre los agentes de IA y cómo pueden ayudar a tu empresa.
Guía de Agentforce sobre razonamiento, temas, instrucciones y acciones.
Crea tu equipo ideal de Agentforce con estas habilidades
Siete mediciones de soporte que supervisamos en Agentforce en cuanto a la ayuda
Cómo trabaja mi equipo con agentes de IA y por qué tú también deberías hacerlo
¿Todo listo para dar el siguiente paso con Agentforce?
Desarrolla agentes rápidamente.
Echa un vistazo más de cerca a cómo funciona el desarrollo de agentes en nuestra biblioteca.
Obtén orientación de expertos.
Lanza Agentforce con velocidad, confianza y ROI que puedes medir.
Habla con un representante
Cuéntanos cuáles son las necesidades de tu empresa y te ayudaremos a encontrar respuestas.