CustomerEagle

Blog·Publicado·10 min de lectura

Medir la calidad del soporte sin métricas de vanidad

Los tickets cerrados, el tiempo de gestión y el CSAT en bruto sobreviven en los informes porque siempre parecen correctos. Aquí tienes el conjunto que los sustituye, cómo se manipula cada cifra y la página semanal que un responsable de soporte puede defender.

También disponible en: English · Nederlands · Deutsch · Français

La mayoría de los paneles de soporte están llenos de cifras que suben cuando las cosas van bien, suben cuando van mal y no pueden decirte cuál de las dos está pasando. Sobreviven porque nadie tiene que defenderlas: una métrica que siempre parece aceptable nunca provoca una reunión incómoda. El coste es que la cola puede llevar un mes deteriorándose antes de que ningún gráfico lo note.

La lista de vanidad, y lo que oculta cada una

Ninguna de estas cifras es falsa. Cada una mide algo real y luego se usa para responder una pregunta que no puede responder.

Cinco métricas que siempre parecen correctas
MétricaLo que mide realmenteCómo falla
Tickets cerradosEl rendimiento de la acción de cerrarCerrar es una acción que hace un agente, no un resultado que vive el cliente. Sube cuando el equipo cierra de forma agresiva, divide hilos o cuando una mala semana produjo más tickets que cerrar.
Tiempo medio de gestiónCuánto tiempo dedican los agentes a cada conversaciónEs un dato de coste tratado como señal de calidad. Reducirlo premia las respuestas cortas y los traspasos apresurados, y los tickets que vuelven por ello caen en el volumen de la semana siguiente, donde nadie los atribuye.
Resolución en el primer contacto, autodeclaradaSi un agente marcó una casillaQuien marca la casilla es la misma persona a la que se evalúa con ella. Salvo que se derive de si el cliente volvió, mide optimismo.
Chats gestionados por la IAEn cuántas conversaciones participó el widgetParticipar no es ayudar. Esta es la cifra que produce porcentajes de automatización impresionantes mientras la cola no se reduce.
CSAT en brutoLa opinión de la pequeña minoría que respondióCon una tasa de respuesta baja, la puntuación la dominan los encantados y los furiosos. No es errónea; simplemente habla de una población distinta de la que atiendes.

La tasa de desvío merece mención aparte, porque es la que con más frecuencia se reporta como cifra de calidad cuando es una cifra de capacidad. Cuenta los contactos que no llegaron, y un cliente que se rindió cuenta igual que uno al que se ayudó; la diferencia se analiza en tasa de desvío o tasa de resolución.

El conjunto que las sustituye

  1. Tasa de resolución con una definición estricta. Conversaciones resueltas divididas entre conversaciones intentadas, donde resuelta significa que ningún agente humano respondió, las conversaciones con las que el cliente nunca interactuó se excluyen en lugar de contarse como éxitos, y una resolución se retira si la conversación se reabre.
  2. Tasa de reapertura dentro de una ventana declarada. La ventana forma parte de la métrica: una tasa de reapertura sin un número de días asociado no es comparable con nada, ni siquiera con su propio valor del trimestre anterior.
  3. Tasa de contacto, por pedido o por cuenta activa. Es la única cifra del conjunto que puede bajar por una buena razón. El volumen sube con el negocio; que suba la tasa de contacto significa que el producto o el contenido han empeorado.
  4. Antigüedad del backlog como distribución. Una antigüedad media de nueve horas es compatible con once conversaciones respondidas al instante y una esperando cuatro días, y es la de cuatro días la que escribe la reseña.
  5. Coste por contacto resuelto, con el motivo de cada variación adjunto.

Tiempos de respuesta, bien medidos

Tres correcciones convierten el tiempo de primera respuesta de decoración en señal. Reporta la mediana y el percentil 90 en lugar de la media, porque la media la fijan unas pocas conversaciones que se quedaron paradas un fin de semana. Mide solo el horario laboral, o te estarás evaluando según el reloj y no según el servicio. Y mídelo en las conversaciones que llegaron a una persona, porque mezclar las respuestas instantáneas de la IA produce una media técnicamente cierta y operativamente inútil.

El percentil 90 es el que hay que vigilar semana a semana. Una mediana estable mientras el percentil 90 sube es la firma clásica de una cola en la que el trabajo rutinario va bien y el trabajo difícil se está pudriendo en silencio.

La única versión del CSAT que merece la pena reportar

Una única puntuación de satisfacción sobre una cola mixta no te dice casi nada sobre lo que puedas actuar. Divídela según cómo terminó la conversación —resuelta por la IA o resuelta por una persona— y las mismas respuestas empiezan a contestar preguntas reales: si la automatización mantiene la calidad y qué temas no deberían automatizarse en absoluto.

Esa división tiene que estar integrada en la recogida de datos, no reconstruirse después. En CustomerEagle una valoración es un número entero del 1 al 5, una por conversación, y se guarda junto con el dato de si la conversación la resolvió la IA, así que el desglose está disponible sin cruzar nada a mano. Hay dos sitios donde un cliente puede valorar —la tarjeta del widget y el enlace del correo de conversación resuelta— y ambos pasan a propósito por el mismo código, para que los dos canales no puedan acabar midiendo cosas distintas.

Una valoración por conversación es un límite deliberado: un segundo envío se rechaza en lugar de promediarse, para que un seguimiento no pueda sobrescribir en silencio la primera impresión. Una valoración baja también hace algo más que alimentar informes. En una conversación que se contó como resuelta por la IA, una valoración de 2 o menos revierte esa resolución: sale del consumo y se abona si ya se había facturado, que es el mismo mecanismo de periodo de asentamiento descrito en cómo medimos las resoluciones de IA. Una puntuación de satisfacción que puede costarle dinero al proveedor es una puntuación que el proveedor tiene interés en recoger con honestidad.

  • Reporta la tasa de respuesta junto a la puntuación, siempre. Un 4,6 procedente del 6 % de las conversaciones y un 4,3 procedente del 40 % no son comparables, y el segundo es la cifra más útil.
  • Reporta los dos segmentos por separado y nunca publiques una puntuación combinada sin los dos recuentos debajo.
  • Vigila la dirección más que el nivel. Una caída de un tercio de punto en el segmento resuelto por la IA es un problema de contenido con fecha.
  • Lee los comentarios. Son la única parte del CSAT que te dice el porqué, y suelen ser la parte que no tiene responsable.
  • Explica el sesgo cuando lo presentes hacia arriba: los clientes que valoran se autoseleccionan, y las conversaciones que terminaron mal tienen menos probabilidades de llegar siquiera al paso de valoración.

Coste por contacto resuelto, y por qué debería bajar

El coste por contacto resuelto es la cifra que piden los directivos y la que más fácilmente mejora en la dirección equivocada. Baja cuando se aprieta el tiempo de gestión, cuando los agentes cierran más rápido y cuando los clientes se rinden, y no quieres nada de eso. Debería bajar porque bajó la tasa de contacto: menos gente necesitó preguntar, porque el artículo existía, la página de seguimiento era clara o el producto dejó de generar la pregunta.

Así que repórtalo en pareja. El coste por contacto resuelto junto a la tasa de contacto, y una variación en el primero que no explique la segunda es una variación que investigar, no que celebrar. Si parte de tu coste se factura por resolución, la definición detrás de esa facturación forma parte de la métrica; los modelos que usan los proveedores se comparan en qué es una resolución de IA.

El informe semanal de una página

Siete cifras, una página, cada una con una nota sobre qué aspecto tendría si alguien la estuviera manipulando. Si una cifra no se puede defender en esa última columna, no pertenece a la página.

Una página semanal que un responsable de soporte puede defender
CifraLa pregunta que respondeQué aspecto tiene su manipulación
Conversaciones, y tasa de contacto por pedido o cuenta¿Crece la demanda más rápido que el negocio?Fusionar o dividir hilos para mover el recuento sin mover la carga de trabajo.
Tasa de resolución, cero respuestas humanas¿Cuánto se gestiona de verdad sin una persona?Contar conversaciones en las que un agente envió un mensaje, o contar el silencio como éxito.
Tasa de reapertura dentro de una ventana declarada¿Se mantuvieron las resoluciones?Acortar la ventana, o abrir una conversación nueva en lugar de reabrir la antigua.
Primera respuesta: mediana y percentil 90, en horario laboral¿Cuánto espera de verdad una persona?Un acuse de recibo automático contado como primera respuesta.
Backlog de más de 24 y 72 horas, como recuentos¿Se está pudriendo algo en el fondo?Cerrar conversaciones antiguas para vaciar el recuento, que reaparece como reaperturas.
CSAT dividido entre resuelto por la IA y resuelto por personas, con tasas de respuesta¿Se mantiene la calidad donde creció la automatización?Enviar la encuesta solo después de las conversaciones que fueron bien.
Principales motivos de traspaso, agrupados¿Qué debería documentarse esta semana?Una categoría comodín «otros» lo bastante grande para ocultar la respuesta real.

La última fila es la que convierte un informe en trabajo. Los motivos de traspaso agrupados son un backlog de contenido ordenado por prioridad, y el motivo principal del lunes suele ser un artículo que se puede escribir el martes.

La instrumentación es la parte difícil

Una métrica es tan buena como el evento que hay detrás, y la mayoría de las discusiones sobre informes son en realidad discusiones sobre eventos. Antes de que una cifra entre en la página necesita tres cosas: un evento definido con un desencadenante por escrito, un responsable con nombre autorizado a cambiar la definición y una exportación que puedas contrastar con transcripciones reales.

  • Atribución por autor del mensaje, no por resultado de la conversación. Si respondió una persona es un hecho sobre los mensajes; cualquier cosa derivada de un campo de estado acabará desviándose.
  • Un archivo de definiciones con fecha. Cuando una cifra se mueve, la primera pregunta es si se movió la definición, y responderla debería llevar treinta segundos.
  • Muestreo, cada semana. Diez conversaciones leídas de principio a fin te dirán más sobre la calidad que cualquier gráfico, y también son la forma de descubrir que una métrica está midiendo lo que no debe.
  • Una exportación con las transcripciones adjuntas, para que cualquier cifra del informe se pueda rastrear hasta las conversaciones que la produjeron.

Nada de esto requiere un equipo de datos. Requiere decidir qué siete cifras vas a defender, escribir qué significa cada una y estar dispuesto a publicar una cifra que va en la dirección equivocada. Dónde viven en el producto los informes de la parte de IA lo verás en el resumen de funciones, y las definiciones que usan nuestras propias cifras están en cómo medimos las resoluciones de IA.

Preguntas frecuentes

¿Qué son las métricas de vanidad en la atención al cliente?

Las métricas de vanidad son cifras que siempre parecen aceptables independientemente de lo que vivieron los clientes: tickets cerrados, tiempo medio de gestión, resolución en el primer contacto autodeclarada, chats en los que participó la IA y CSAT en bruto recogido con una tasa de respuesta baja. Cada una mide algo real, pero ninguna distingue a un cliente al que se ayudó de uno que se rindió.

¿Qué métricas de atención al cliente importan de verdad?

Las métricas de atención al cliente que importan son la tasa de resolución con una definición estricta, la tasa de reapertura dentro de una ventana declarada, la tasa de contacto por pedido o por cuenta activa, la antigüedad del backlog como distribución y no como media, el tiempo de respuesta como mediana y percentil 90 en horario laboral, y el CSAT dividido según si la conversación la resolvió la IA o una persona.

¿Conviene dividir el CSAT entre conversaciones resueltas por la IA y por personas?

Sí, conviene dividir el CSAT así, y es la única división que produce acciones de forma fiable. Una puntuación combinada oculta si la automatización mantiene la calidad o la erosiona, mientras que la división te dice qué temas se pueden automatizar con seguridad y cuáles deben ir a una persona. Reporta la tasa de respuesta de cada segmento junto a la puntuación, porque los dos segmentos rara vez tienen la misma.

¿Cómo debe medirse el tiempo de primera respuesta?

El tiempo de primera respuesta debe medirse como mediana y percentil 90 en lugar de como media, solo en horario laboral, y calculado sobre las conversaciones que llegaron a una persona y no sobre todas. Las respuestas instantáneas de la IA mezcladas en la misma media producen una cifra técnicamente correcta que no te dice nada sobre cuánto esperó una persona a otra persona.

¿Qué es una buena puntuación de CSAT en atención al cliente?

No existe un benchmark trasladable de CSAT, porque la puntuación depende de tu mezcla de canales, de cuándo se envía la encuesta y de cuántos clientes la responden. La comparación que tiene sentido es con tu propia línea base: mídela ahora registrando también la tasa de respuesta, divídela entre resuelto por la IA y resuelto por personas, y sigue la dirección más que el nivel.

¿Cómo sé si alguien está manipulando una métrica de soporte?

Escribe, para cada cifra del informe, qué aspecto tendría si alguien estuviera optimizando la cifra en lugar del resultado: cerrar hilos antes de tiempo, dividir conversaciones, enviar encuestas solo tras las buenas interacciones. Si no puedes describir ese modo de fallo, todavía no entiendes la métrica lo bastante bien como para actuar sobre ella.

Resuelva más tickets automáticamente.

Conecte su centro de ayuda, pruebe las respuestas con sus propias preguntas y revise las transferencias antes de ponerlo en marcha.

Iniciar prueba gratuitaVer la demo interactiva30 días · sin tarjeta · 25 resoluciones de IA para probar