# La prueba del bot de referencia

> Un bot pequeño, especificado de antemano, que se construirá en cada plataforma y pasará por las mismas 40 conversaciones con guion. Esta página es el protocolo. La prueba aún no se ha realizado.

Publicado: 18 de septiembre de 2026 · Actualizado: 18 de septiembre de 2026 · Precios verificados: 18 de septiembre de 2026 · Por el equipo de chatbots.reviews

Investigado y redactado con ayuda de IA a partir de las fuentes que se citan en esta página. Todavía no hemos creado ni puesto a prueba bots en estas plataformas. Método: [Cómo analizamos](https://chatbots.reviews/es/como-evaluamos)

> **Estado: no realizada.** No se ha construido ningún bot ni se ha puntuado ninguna conversación. No hay resultados en este sitio, y ningún análisis de aquí describe un producto como puesto a prueba. Esta página existe para que el protocolo sea público antes de la primera ronda.

## Por qué un solo bot, construido en todas partes

Las tablas de funciones no dicen cuánto se tarda en aprender a usar un constructor ni qué hace un bot ante una pregunta para la que no estaba preparado. La única forma justa de averiguarlo es construir lo mismo en cada plataforma y hacerle las mismas preguntas. El diseño tiene que fijarse primero, para que los puntos fuertes de ninguna plataforma condicionen la prueba.

## El bot de referencia

El bot atiende a una tienda en línea ficticia que vende plantas de interior. Es pequeño a propósito: una persona competente debería poder construirlo en una tarde con una buena herramienta.

1. **Responder a partir de una base de conocimiento.** Doce artículos de ayuda breves (envíos, devoluciones, cuidado de plantas, pago, tarjetas regalo) facilitados como páginas web y como un único PDF.
2. **Consultar un pedido.** Pedir el número de pedido, llamar a una API simulada pública e informar del estado, incluidos los casos en que el pedido no existe o la API falla.
3. **Pasar a una persona.** Ofrecer una persona cuando se pide, cuando el cliente está molesto y cuando el bot no sabe responder dos veces seguidas. Transmitir la conversación hasta ese momento.
4. **Decir que es un bot** en el primer mensaje, como esperan las normas de la UE y de algunos estados de EE. UU.

## Las 40 conversaciones con guion

| Grupo | Conversaciones | Qué comprueba |
| --- | --- | --- |
| Respondibles desde la base de conocimiento | 12 | Respuestas correctas en lenguaje claro |
| Las mismas preguntas, mal escritas o parafraseadas | 6 | Tolerancia a cómo escribe la gente de verdad |
| Alemán y español | 8 | Respuestas en el idioma del cliente a partir de contenido en inglés |
| Consulta de pedidos | 6 | Pedido válido, pedido desconocido, número ausente, fallo de la API |
| Fuera de alcance o sin respuesta | 4 | Declinar en lugar de inventarse una respuesta |
| Traspaso a una persona | 4 | Petición expresa, frustración, fallos repetidos, fuera de horario |

_Los guiones, la base de conocimiento y la API simulada se publicarán con los primeros resultados para que cualquiera pueda repetir la ronda._

## Qué se medirá

- **Tiempo de construcción**, en minutos, desde una cuenta nueva hasta un bot publicado, grabado en pantalla por alguien que no haya usado antes la herramienta.
- **Conversaciones correctas y contenidas** de 40, puntuadas por dos personas con una clave de respuestas escrita.
- **Respuestas erróneas dadas con seguridad**, contadas aparte, porque una de ellas cuesta más que un traspaso.
- **Comportamiento en el traspaso**: ¿recibió una persona la conversación, con su historial?
- **Lo que costó la ronda** según la propia unidad de medida del proveedor, para poder contrastar las páginas de precios con una factura real.

## Pesos previstos para la rúbrica v2

| Criterio | Peso | Fuente |
| --- | --- | --- |
| Calidad de las respuestas | 30% | Prueba del bot de referencia |
| Tiempo de construcción | 20% | Prueba del bot de referencia |
| Precio según volumen | 20% | Base de datos de productos |
| Canales | 15% | Base de datos de productos |
| Traspaso a personas | 15% | Prueba del bot de referencia |

_Publicados antes de la primera ronda. Si los pesos cambian, el historial de cambios explicará por qué._

## Limitaciones que ya conocemos

- Los productos que solo se venden a través de un equipo comercial no pueden probarse sin la colaboración del proveedor. Conservarán una puntuación basada solo en documentación y se señalarán como tales.
- Los bots de marketing para Instagram, Messenger y WhatsApp están pensados para otra tarea. Se ejecutarán en su canal principal con los mismos guiones allí donde los guiones sean aplicables, y las páginas indicarán dónde no lo son.
- Un bot pequeño no puede mostrar cómo se comporta una plataforma con cientos de intenciones, equipos grandes o mucho tráfico. La prueba mide cómo se empieza, no la escala.
- Las respuestas de IA varían de una ejecución a otra. Cada conversación se ejecutará tres veces y se informará de la dispersión.

Cómo se obtienen las puntuaciones actuales sin esta prueba se explica en [Cómo analizamos](https://chatbots.reviews/es/como-evaluamos).

> **Puntuado a partir de documentación pública, con una rúbrica que puede leer.** Las puntuaciones salen de cinco criterios publicados: claridad de precios, acceso, profundidad del constructor, alcance y traspaso a una persona, y datos y confianza. Cada precio y cada límite se guarda una sola vez, en una única base de datos de productos, con un enlace a su fuente, de modo que dos páginas de este sitio no pueden contradecirse. Rúbrica v1.0 · La prueba de construcción del bot de referencia aún no se ha realizado. Hasta entonces, ninguna página de este sitio dice que un producto se haya puesto a prueba. [Leer el método completo](https://chatbots.reviews/es/como-evaluamos) · [La prueba del bot de referencia](https://chatbots.reviews/es/prueba-del-bot-de-referencia)

---

Canonical: https://chatbots.reviews/es/prueba-del-bot-de-referencia
