Warum ein Bot, überall gebaut
Funktionstabellen verraten nicht, wie lange man braucht, um einen Baukasten zu lernen, oder was ein Bot mit einer Frage macht, auf die er nicht vorbereitet wurde. Der einzig faire Weg, das herauszufinden, ist, auf jeder Plattform dasselbe zu bauen und dieselben Fragen zu stellen. Das Design muss vorher feststehen, damit die Stärken keiner Plattform den Test prägen.
Der Referenz-Bot
Der Bot bedient einen fiktiven Onlineshop für Zimmerpflanzen. Er ist bewusst klein: Eine kompetente Person sollte ihn mit einem guten Tool an einem Nachmittag bauen können.
- Aus einer Wissensbasis antworten. Zwölf kurze Hilfeartikel (Versand, Rücksendung, Pflanzenpflege, Zahlung, Geschenkgutscheine), bereitgestellt als Webseiten und als ein PDF.
- Eine Bestellung nachschlagen. Nach der Bestellnummer fragen, eine öffentliche Mock-API aufrufen und den Status melden, auch in den Fällen, in denen die Bestellung nicht existiert oder die API ausfällt.
- An einen Menschen übergeben. Einen Menschen anbieten, wenn der Kunde es wünscht, wenn er verärgert ist und wenn der Bot zweimal hintereinander keine Antwort weiß. Den bisherigen Gesprächsverlauf mitgeben.
- Sagen, dass ein Bot antwortet, und zwar in der ersten Nachricht, wie es die Regeln der EU und einiger US-Bundesstaaten erwarten.
Die 40 vorgegebenen Gespräche
| Gruppe | Gespräche | Was geprüft wird |
|---|---|---|
| Aus der Wissensbasis beantwortbar | 12 | Richtige Antworten in verständlicher Sprache |
| Dieselben Fragen, mit Tippfehlern oder umformuliert | 6 | Toleranz dafür, wie Menschen wirklich schreiben |
| Deutsch und Spanisch | 8 | Antworten in der Sprache des Kunden aus englischen Inhalten |
| Bestellabfrage | 6 | Gültige Bestellung, unbekannte Bestellung, fehlende Nummer, API-Ausfall |
| Außerhalb des Themas oder nicht beantwortbar | 4 | Ablehnen, statt eine Antwort zu erfinden |
| Übergabe | 4 | Ausdrücklicher Wunsch, Frust, wiederholtes Scheitern, außerhalb der Geschäftszeiten |
Was gemessen wird
- Bauzeit in Minuten, vom neuen Konto bis zum veröffentlichten Bot, per Bildschirmaufnahme festgehalten, gebaut von jemandem, der das Tool noch nie benutzt hat.
- Richtige, ohne Übergabe abgeschlossene Gespräche von 40, bewertet von zwei Personen anhand eines schriftlichen Lösungsschlüssels.
- Selbstsicher falsche Antworten, getrennt gezählt, weil eine davon mehr kostet als eine Übergabe.
- Verhalten bei der Übergabe: Hat ein Mensch das Gespräch samt Verlauf erhalten?
- Was der Durchlauf gekostet hat, gemessen am eigenen Zähler des Anbieters, damit sich die Preisseiten an einer echten Rechnung überprüfen lassen.
Geplante Gewichtungen für Bewertungsschema v2
| Kriterium | Gewichtung | Quelle |
|---|---|---|
| Antwortqualität | 30% | Referenz-Bot-Test |
| Bauzeit | 20% | Referenz-Bot-Test |
| Preis bei Volumen | 20% | Produktdatenbank |
| Kanäle | 15% | Produktdatenbank |
| Übergabe an Menschen | 15% | Referenz-Bot-Test |
Grenzen, die wir schon kennen
- Produkte, die nur über ein Vertriebsteam verkauft werden, lassen sich ohne Mitwirkung des Anbieters nicht testen. Sie behalten eine Wertung allein auf Basis der Dokumentation und werden entsprechend gekennzeichnet.
- Bots für Marketing über Instagram, Messenger und WhatsApp sind für eine andere Aufgabe gebaut. Sie laufen auf ihrem Hauptkanal mit denselben Skripten, soweit diese passen, und die Seiten sagen, wo sie nicht passen.
- Ein kleiner Bot kann nicht zeigen, wie sich eine Plattform mit Hunderten von Intents, großen Teams oder hohem Traffic verhält. Der Test misst den Einstieg, nicht die Skalierung.
- KI-Antworten schwanken von Durchlauf zu Durchlauf. Jedes Gespräch wird dreimal durchgeführt und die Streuung angegeben.
Wie die heutigen Wertungen ohne diesen Test entstehen, steht unter So bewerten wir.
Mit KI-Unterstützung recherchiert und entworfen, auf Grundlage der auf dieser Seite genannten Quellen. Wir haben auf diesen Plattformen noch keine Bots gebaut oder erprobt. Methode: So bewerten wir