Die meisten "KI-Bots" auf Discord funktionieren nach demselben Muster: deine gesprochenen Worte werden per Spracherkennung zu Text, der Text geht an ein Sprachmodell, die Antwort des Modells wird per Text-zu-Sprache wieder vorgelesen. Funktioniert, klingt aber fast immer robotisch und hat spürbare Verzögerung – drei Umwege, drei Fehlerquellen.
EselFriend macht das anders: Es läuft über eine echte Sprache-zu-Sprache-Verbindung (Google Geminis Live API). Kein Zwischenschritt über Text, ein einziger Round-Trip, spürbar niedrigere Latenz und eine natürlichere Stimme. Der Nachteil: Man bekommt eine fertige Blackbox, die sich in der Praxis anders verhält, als die Dokumentation vermuten lässt.
Ein KI-Freund, der auf jedes Wort im Kanal reagiert, ist in einem belebten Sprachkanal mit mehreren Leuten schlicht nervig. EselFriend soll nur antworten, wenn er beim Namen angesprochen wird. Das Naheliegende wäre, die Spracherkennung nach seinem Namen zu durchsuchen – das Problem: Spracherkennung ist nie perfekt, und "Bob" wird nicht immer als "Bob" transkribiert.
Die robustere Lösung: Das Modell selbst entscheidet, ob es gemeint ist, und markiert das mit einem festen Wort im System-Prompt ("IGNORIEREN"), statt dass wir extern nach Namen suchen. Das Modell versteht Kontext besser, als eine Textsuche es je könnte.
Jeder EselBuilder-Nutzer bekommt kostenlos 10 Sprach-Minuten pro Monat und 30 Nachrichten pro Tag im Textchat. Mit Eselbuilder Pro sind es 60 Minuten und 300 Nachrichten – genug, um EselFriend wirklich in den Alltag auf dem Server zu integrieren, statt ihn nur einmal auszuprobieren.