Der Referenz-Bot-Test

Ein kleiner, vorab festgelegter Bot, der auf jeder Plattform gebaut und durch dieselben 40 vorgegebenen Gespräche geschickt werden soll. Diese Seite ist das Protokoll. Der Test wurde noch nicht durchgeführt.

Von der Redaktion von chatbots.reviewsVeröffentlicht 18. September 2026Aktualisiert 18. September 2026Preise geprüft 18. September 2026
Stand: nicht durchgeführt. Es wurde kein Bot gebaut und kein Gespräch bewertet. Auf dieser Website gibt es keine Ergebnisse, und keine Bewertung hier behauptet, ein Produkt sei in einem Test geprüft worden. Diese Seite gibt es, damit das Protokoll vor dem ersten Durchlauf öffentlich ist.

Warum ein Bot, überall gebaut

Funktionstabellen verraten nicht, wie lange man braucht, um einen Baukasten zu lernen, oder was ein Bot mit einer Frage macht, auf die er nicht vorbereitet wurde. Der einzig faire Weg, das herauszufinden, ist, auf jeder Plattform dasselbe zu bauen und dieselben Fragen zu stellen. Das Design muss vorher feststehen, damit die Stärken keiner Plattform den Test prägen.

Der Referenz-Bot

Der Bot bedient einen fiktiven Onlineshop für Zimmerpflanzen. Er ist bewusst klein: Eine kompetente Person sollte ihn mit einem guten Tool an einem Nachmittag bauen können.

  1. Aus einer Wissensbasis antworten. Zwölf kurze Hilfeartikel (Versand, Rücksendung, Pflanzenpflege, Zahlung, Geschenkgutscheine), bereitgestellt als Webseiten und als ein PDF.
  2. Eine Bestellung nachschlagen. Nach der Bestellnummer fragen, eine öffentliche Mock-API aufrufen und den Status melden, auch in den Fällen, in denen die Bestellung nicht existiert oder die API ausfällt.
  3. An einen Menschen übergeben. Einen Menschen anbieten, wenn der Kunde es wünscht, wenn er verärgert ist und wenn der Bot zweimal hintereinander keine Antwort weiß. Den bisherigen Gesprächsverlauf mitgeben.
  4. Sagen, dass ein Bot antwortet, und zwar in der ersten Nachricht, wie es die Regeln der EU und einiger US-Bundesstaaten erwarten.

Die 40 vorgegebenen Gespräche

GruppeGesprächeWas geprüft wird
Aus der Wissensbasis beantwortbar12Richtige Antworten in verständlicher Sprache
Dieselben Fragen, mit Tippfehlern oder umformuliert6Toleranz dafür, wie Menschen wirklich schreiben
Deutsch und Spanisch8Antworten in der Sprache des Kunden aus englischen Inhalten
Bestellabfrage6Gültige Bestellung, unbekannte Bestellung, fehlende Nummer, API-Ausfall
Außerhalb des Themas oder nicht beantwortbar4Ablehnen, statt eine Antwort zu erfinden
Übergabe4Ausdrücklicher Wunsch, Frust, wiederholtes Scheitern, außerhalb der Geschäftszeiten
Die Skripte, die Wissensbasis und die Mock-API werden mit den ersten Ergebnissen veröffentlicht, damit jeder den Durchlauf wiederholen kann.

Was gemessen wird

  • Bauzeit in Minuten, vom neuen Konto bis zum veröffentlichten Bot, per Bildschirmaufnahme festgehalten, gebaut von jemandem, der das Tool noch nie benutzt hat.
  • Richtige, ohne Übergabe abgeschlossene Gespräche von 40, bewertet von zwei Personen anhand eines schriftlichen Lösungsschlüssels.
  • Selbstsicher falsche Antworten, getrennt gezählt, weil eine davon mehr kostet als eine Übergabe.
  • Verhalten bei der Übergabe: Hat ein Mensch das Gespräch samt Verlauf erhalten?
  • Was der Durchlauf gekostet hat, gemessen am eigenen Zähler des Anbieters, damit sich die Preisseiten an einer echten Rechnung überprüfen lassen.

Geplante Gewichtungen für Bewertungsschema v2

KriteriumGewichtungQuelle
Antwortqualität30%Referenz-Bot-Test
Bauzeit20%Referenz-Bot-Test
Preis bei Volumen20%Produktdatenbank
Kanäle15%Produktdatenbank
Übergabe an Menschen15%Referenz-Bot-Test
Vor dem ersten Durchlauf veröffentlicht. Ändern sich die Gewichtungen, steht im Änderungsprotokoll, warum.

Grenzen, die wir schon kennen

  • Produkte, die nur über ein Vertriebsteam verkauft werden, lassen sich ohne Mitwirkung des Anbieters nicht testen. Sie behalten eine Wertung allein auf Basis der Dokumentation und werden entsprechend gekennzeichnet.
  • Bots für Marketing über Instagram, Messenger und WhatsApp sind für eine andere Aufgabe gebaut. Sie laufen auf ihrem Hauptkanal mit denselben Skripten, soweit diese passen, und die Seiten sagen, wo sie nicht passen.
  • Ein kleiner Bot kann nicht zeigen, wie sich eine Plattform mit Hunderten von Intents, großen Teams oder hohem Traffic verhält. Der Test misst den Einstieg, nicht die Skalierung.
  • KI-Antworten schwanken von Durchlauf zu Durchlauf. Jedes Gespräch wird dreimal durchgeführt und die Streuung angegeben.

Wie die heutigen Wertungen ohne diesen Test entstehen, steht unter So bewerten wir.

Mit KI-Unterstützung recherchiert und entworfen, auf Grundlage der auf dieser Seite genannten Quellen. Wir haben auf diesen Plattformen noch keine Bots gebaut oder erprobt. Methode: So bewerten wir