La prueba del bot de referencia

Un bot pequeño, especificado de antemano, que se construirá en cada plataforma y pasará por las mismas 40 conversaciones con guion. Esta página es el protocolo. La prueba aún no se ha realizado.

Por el equipo de chatbots.reviewsPublicado 18 de septiembre de 2026Actualizado 18 de septiembre de 2026Precios verificados 18 de septiembre de 2026
Estado: no realizada. No se ha construido ningún bot ni se ha puntuado ninguna conversación. No hay resultados en este sitio, y ningún análisis de aquí describe un producto como puesto a prueba. Esta página existe para que el protocolo sea público antes de la primera ronda.

Por qué un solo bot, construido en todas partes

Las tablas de funciones no dicen cuánto se tarda en aprender a usar un constructor ni qué hace un bot ante una pregunta para la que no estaba preparado. La única forma justa de averiguarlo es construir lo mismo en cada plataforma y hacerle las mismas preguntas. El diseño tiene que fijarse primero, para que los puntos fuertes de ninguna plataforma condicionen la prueba.

El bot de referencia

El bot atiende a una tienda en línea ficticia que vende plantas de interior. Es pequeño a propósito: una persona competente debería poder construirlo en una tarde con una buena herramienta.

  1. Responder a partir de una base de conocimiento. Doce artículos de ayuda breves (envíos, devoluciones, cuidado de plantas, pago, tarjetas regalo) facilitados como páginas web y como un único PDF.
  2. Consultar un pedido. Pedir el número de pedido, llamar a una API simulada pública e informar del estado, incluidos los casos en que el pedido no existe o la API falla.
  3. Pasar a una persona. Ofrecer una persona cuando se pide, cuando el cliente está molesto y cuando el bot no sabe responder dos veces seguidas. Transmitir la conversación hasta ese momento.
  4. Decir que es un bot en el primer mensaje, como esperan las normas de la UE y de algunos estados de EE. UU.

Las 40 conversaciones con guion

GrupoConversacionesQué comprueba
Respondibles desde la base de conocimiento12Respuestas correctas en lenguaje claro
Las mismas preguntas, mal escritas o parafraseadas6Tolerancia a cómo escribe la gente de verdad
Alemán y español8Respuestas en el idioma del cliente a partir de contenido en inglés
Consulta de pedidos6Pedido válido, pedido desconocido, número ausente, fallo de la API
Fuera de alcance o sin respuesta4Declinar en lugar de inventarse una respuesta
Traspaso a una persona4Petición expresa, frustración, fallos repetidos, fuera de horario
Los guiones, la base de conocimiento y la API simulada se publicarán con los primeros resultados para que cualquiera pueda repetir la ronda.

Qué se medirá

  • Tiempo de construcción, en minutos, desde una cuenta nueva hasta un bot publicado, grabado en pantalla por alguien que no haya usado antes la herramienta.
  • Conversaciones correctas y contenidas de 40, puntuadas por dos personas con una clave de respuestas escrita.
  • Respuestas erróneas dadas con seguridad, contadas aparte, porque una de ellas cuesta más que un traspaso.
  • Comportamiento en el traspaso: ¿recibió una persona la conversación, con su historial?
  • Lo que costó la ronda según la propia unidad de medida del proveedor, para poder contrastar las páginas de precios con una factura real.

Pesos previstos para la rúbrica v2

CriterioPesoFuente
Calidad de las respuestas30%Prueba del bot de referencia
Tiempo de construcción20%Prueba del bot de referencia
Precio según volumen20%Base de datos de productos
Canales15%Base de datos de productos
Traspaso a personas15%Prueba del bot de referencia
Publicados antes de la primera ronda. Si los pesos cambian, el historial de cambios explicará por qué.

Limitaciones que ya conocemos

  • Los productos que solo se venden a través de un equipo comercial no pueden probarse sin la colaboración del proveedor. Conservarán una puntuación basada solo en documentación y se señalarán como tales.
  • Los bots de marketing para Instagram, Messenger y WhatsApp están pensados para otra tarea. Se ejecutarán en su canal principal con los mismos guiones allí donde los guiones sean aplicables, y las páginas indicarán dónde no lo son.
  • Un bot pequeño no puede mostrar cómo se comporta una plataforma con cientos de intenciones, equipos grandes o mucho tráfico. La prueba mide cómo se empieza, no la escala.
  • Las respuestas de IA varían de una ejecución a otra. Cada conversación se ejecutará tres veces y se informará de la dispersión.

Cómo se obtienen las puntuaciones actuales sin esta prueba se explica en Cómo analizamos.

Investigado y redactado con ayuda de IA a partir de las fuentes que se citan en esta página. Todavía no hemos creado ni puesto a prueba bots en estas plataformas. Método: Cómo analizamos