Por qué un solo bot, construido en todas partes
Las tablas de funciones no dicen cuánto se tarda en aprender a usar un constructor ni qué hace un bot ante una pregunta para la que no estaba preparado. La única forma justa de averiguarlo es construir lo mismo en cada plataforma y hacerle las mismas preguntas. El diseño tiene que fijarse primero, para que los puntos fuertes de ninguna plataforma condicionen la prueba.
El bot de referencia
El bot atiende a una tienda en línea ficticia que vende plantas de interior. Es pequeño a propósito: una persona competente debería poder construirlo en una tarde con una buena herramienta.
- Responder a partir de una base de conocimiento. Doce artículos de ayuda breves (envíos, devoluciones, cuidado de plantas, pago, tarjetas regalo) facilitados como páginas web y como un único PDF.
- Consultar un pedido. Pedir el número de pedido, llamar a una API simulada pública e informar del estado, incluidos los casos en que el pedido no existe o la API falla.
- Pasar a una persona. Ofrecer una persona cuando se pide, cuando el cliente está molesto y cuando el bot no sabe responder dos veces seguidas. Transmitir la conversación hasta ese momento.
- Decir que es un bot en el primer mensaje, como esperan las normas de la UE y de algunos estados de EE. UU.
Las 40 conversaciones con guion
| Grupo | Conversaciones | Qué comprueba |
|---|---|---|
| Respondibles desde la base de conocimiento | 12 | Respuestas correctas en lenguaje claro |
| Las mismas preguntas, mal escritas o parafraseadas | 6 | Tolerancia a cómo escribe la gente de verdad |
| Alemán y español | 8 | Respuestas en el idioma del cliente a partir de contenido en inglés |
| Consulta de pedidos | 6 | Pedido válido, pedido desconocido, número ausente, fallo de la API |
| Fuera de alcance o sin respuesta | 4 | Declinar en lugar de inventarse una respuesta |
| Traspaso a una persona | 4 | Petición expresa, frustración, fallos repetidos, fuera de horario |
Qué se medirá
- Tiempo de construcción, en minutos, desde una cuenta nueva hasta un bot publicado, grabado en pantalla por alguien que no haya usado antes la herramienta.
- Conversaciones correctas y contenidas de 40, puntuadas por dos personas con una clave de respuestas escrita.
- Respuestas erróneas dadas con seguridad, contadas aparte, porque una de ellas cuesta más que un traspaso.
- Comportamiento en el traspaso: ¿recibió una persona la conversación, con su historial?
- Lo que costó la ronda según la propia unidad de medida del proveedor, para poder contrastar las páginas de precios con una factura real.
Pesos previstos para la rúbrica v2
| Criterio | Peso | Fuente |
|---|---|---|
| Calidad de las respuestas | 30% | Prueba del bot de referencia |
| Tiempo de construcción | 20% | Prueba del bot de referencia |
| Precio según volumen | 20% | Base de datos de productos |
| Canales | 15% | Base de datos de productos |
| Traspaso a personas | 15% | Prueba del bot de referencia |
Limitaciones que ya conocemos
- Los productos que solo se venden a través de un equipo comercial no pueden probarse sin la colaboración del proveedor. Conservarán una puntuación basada solo en documentación y se señalarán como tales.
- Los bots de marketing para Instagram, Messenger y WhatsApp están pensados para otra tarea. Se ejecutarán en su canal principal con los mismos guiones allí donde los guiones sean aplicables, y las páginas indicarán dónde no lo son.
- Un bot pequeño no puede mostrar cómo se comporta una plataforma con cientos de intenciones, equipos grandes o mucho tráfico. La prueba mide cómo se empieza, no la escala.
- Las respuestas de IA varían de una ejecución a otra. Cada conversación se ejecutará tres veces y se informará de la dispersión.
Cómo se obtienen las puntuaciones actuales sin esta prueba se explica en Cómo analizamos.
Investigado y redactado con ayuda de IA a partir de las fuentes que se citan en esta página. Todavía no hemos creado ni puesto a prueba bots en estas plataformas. Método: Cómo analizamos