# Der Referenz-Bot-Test

> Ein kleiner, vorab festgelegter Bot, der auf jeder Plattform gebaut und durch dieselben 40 vorgegebenen Gespräche geschickt werden soll. Diese Seite ist das Protokoll. Der Test wurde noch nicht durchgeführt.

Veröffentlicht: 18. September 2026 · Aktualisiert: 18. September 2026 · Preise geprüft: 18. September 2026 · Von der Redaktion von chatbots.reviews

Mit KI-Unterstützung recherchiert und entworfen, auf Grundlage der auf dieser Seite genannten Quellen. Wir haben auf diesen Plattformen noch keine Bots gebaut oder erprobt. Methode: [So bewerten wir](https://chatbots.reviews/de/so-bewerten-wir)

> **Stand: nicht durchgeführt.** Es wurde kein Bot gebaut und kein Gespräch bewertet. Auf dieser Website gibt es keine Ergebnisse, und keine Bewertung hier behauptet, ein Produkt sei in einem Test geprüft worden. Diese Seite gibt es, damit das Protokoll vor dem ersten Durchlauf öffentlich ist.

## Warum ein Bot, überall gebaut

Funktionstabellen verraten nicht, wie lange man braucht, um einen Baukasten zu lernen, oder was ein Bot mit einer Frage macht, auf die er nicht vorbereitet wurde. Der einzig faire Weg, das herauszufinden, ist, auf jeder Plattform dasselbe zu bauen und dieselben Fragen zu stellen. Das Design muss vorher feststehen, damit die Stärken keiner Plattform den Test prägen.

## Der Referenz-Bot

Der Bot bedient einen fiktiven Onlineshop für Zimmerpflanzen. Er ist bewusst klein: Eine kompetente Person sollte ihn mit einem guten Tool an einem Nachmittag bauen können.

1. **Aus einer Wissensbasis antworten.** Zwölf kurze Hilfeartikel (Versand, Rücksendung, Pflanzenpflege, Zahlung, Geschenkgutscheine), bereitgestellt als Webseiten und als ein PDF.
2. **Eine Bestellung nachschlagen.** Nach der Bestellnummer fragen, eine öffentliche Mock-API aufrufen und den Status melden, auch in den Fällen, in denen die Bestellung nicht existiert oder die API ausfällt.
3. **An einen Menschen übergeben.** Einen Menschen anbieten, wenn der Kunde es wünscht, wenn er verärgert ist und wenn der Bot zweimal hintereinander keine Antwort weiß. Den bisherigen Gesprächsverlauf mitgeben.
4. **Sagen, dass ein Bot antwortet**, und zwar in der ersten Nachricht, wie es die Regeln der EU und einiger US-Bundesstaaten erwarten.

## Die 40 vorgegebenen Gespräche

| Gruppe | Gespräche | Was geprüft wird |
| --- | --- | --- |
| Aus der Wissensbasis beantwortbar | 12 | Richtige Antworten in verständlicher Sprache |
| Dieselben Fragen, mit Tippfehlern oder umformuliert | 6 | Toleranz dafür, wie Menschen wirklich schreiben |
| Deutsch und Spanisch | 8 | Antworten in der Sprache des Kunden aus englischen Inhalten |
| Bestellabfrage | 6 | Gültige Bestellung, unbekannte Bestellung, fehlende Nummer, API-Ausfall |
| Außerhalb des Themas oder nicht beantwortbar | 4 | Ablehnen, statt eine Antwort zu erfinden |
| Übergabe | 4 | Ausdrücklicher Wunsch, Frust, wiederholtes Scheitern, außerhalb der Geschäftszeiten |

_Die Skripte, die Wissensbasis und die Mock-API werden mit den ersten Ergebnissen veröffentlicht, damit jeder den Durchlauf wiederholen kann._

## Was gemessen wird

- **Bauzeit** in Minuten, vom neuen Konto bis zum veröffentlichten Bot, per Bildschirmaufnahme festgehalten, gebaut von jemandem, der das Tool noch nie benutzt hat.
- **Richtige, ohne Übergabe abgeschlossene Gespräche** von 40, bewertet von zwei Personen anhand eines schriftlichen Lösungsschlüssels.
- **Selbstsicher falsche Antworten**, getrennt gezählt, weil eine davon mehr kostet als eine Übergabe.
- **Verhalten bei der Übergabe**: Hat ein Mensch das Gespräch samt Verlauf erhalten?
- **Was der Durchlauf gekostet hat**, gemessen am eigenen Zähler des Anbieters, damit sich die Preisseiten an einer echten Rechnung überprüfen lassen.

## Geplante Gewichtungen für Bewertungsschema v2

| Kriterium | Gewichtung | Quelle |
| --- | --- | --- |
| Antwortqualität | 30% | Referenz-Bot-Test |
| Bauzeit | 20% | Referenz-Bot-Test |
| Preis bei Volumen | 20% | Produktdatenbank |
| Kanäle | 15% | Produktdatenbank |
| Übergabe an Menschen | 15% | Referenz-Bot-Test |

_Vor dem ersten Durchlauf veröffentlicht. Ändern sich die Gewichtungen, steht im Änderungsprotokoll, warum._

## Grenzen, die wir schon kennen

- Produkte, die nur über ein Vertriebsteam verkauft werden, lassen sich ohne Mitwirkung des Anbieters nicht testen. Sie behalten eine Wertung allein auf Basis der Dokumentation und werden entsprechend gekennzeichnet.
- Bots für Marketing über Instagram, Messenger und WhatsApp sind für eine andere Aufgabe gebaut. Sie laufen auf ihrem Hauptkanal mit denselben Skripten, soweit diese passen, und die Seiten sagen, wo sie nicht passen.
- Ein kleiner Bot kann nicht zeigen, wie sich eine Plattform mit Hunderten von Intents, großen Teams oder hohem Traffic verhält. Der Test misst den Einstieg, nicht die Skalierung.
- KI-Antworten schwanken von Durchlauf zu Durchlauf. Jedes Gespräch wird dreimal durchgeführt und die Streuung angegeben.

Wie die heutigen Wertungen ohne diesen Test entstehen, steht unter [So bewerten wir](https://chatbots.reviews/de/so-bewerten-wir).

> **Bewertet anhand öffentlicher Dokumentation, nach einem Schema, das Sie nachlesen können.** Die Wertungen beruhen auf fünf veröffentlichten Kriterien: Preistransparenz, Zugang, Tiefe des Baukastens, Reichweite und Übergabe sowie Daten und Vertrauen. Jeder Preis und jedes Limit wird nur einmal gespeichert, in einer einzigen Produktdatenbank, mit einem Link zur Quelle. So können sich keine zwei Seiten dieser Website widersprechen. Bewertungsschema v1.0 · Der Referenz-Bot-Test wurde noch nicht durchgeführt. Bis dahin behauptet keine Seite hier, ein Produkt sei in einem Test geprüft worden. [Die vollständige Methode lesen](https://chatbots.reviews/de/so-bewerten-wir) · [Der Referenz-Bot-Test](https://chatbots.reviews/de/referenz-bot-test)

---

Canonical: https://chatbots.reviews/de/referenz-bot-test
