Sales
7 Minuten Lesezeit

Voice-to-CRM testen: Warum die Wortfehlerrate (WER) nicht reicht

Die Wortfehlerrate sagt dir, wie viele Wörter falsch sind - nicht, ob die Werte in deinem CRM stimmen. Hier lernst du, Voice-to-CRM mit kritischen Namen, Zahlen und Produktcodes zu testen, Fehler getrennt zu messen und Abnahmekriterien festzulegen.
Das Wichtigste in Kürze
In diesem Artikel

KI Dieser Artikel wurde mit Hilfe von KI erstellt.

Wichtige Erkenntnisse

  • WER zählt Ersetzungen, Auslassungen und Einfügungen gleich: ein falscher Name erzeugt dieselbe Fehlerzahl wie ein Füllwort.
  • Baue dein Testset aus Verwechslungspaaren wie Meier/Mayer, fünfzehn/fünfzig und 1,5/15 plus anonymisierten Sortimentsbegriffen.
  • Trenne vier Prüfpunkte: verstandener Text, normalisierter Wert, richtiges Feld, richtiger Datensatz - und miss die Korrekturzeit.
  • Phrase-Listen können Namen und Fachbegriffe bei der Erkennung gewichten; kläre mit dem Anbieter, was er dafür tatsächlich anbietet.

Warum sagt die Wortfehlerrate zu wenig aus?

Wenn du Voice-to-CRM bewertest, fängt die Diskussion fast immer bei der Wortfehlerrate an. Der Wert hat eine klare Definition: Die WER ist die Summe aus Ersetzungen, Auslassungen und Einfügungen, geteilt durch die Wortzahl des menschlich erstellten Referenztranskripts[1]. Das ist eine saubere Metrik für Spracherkennungsmodelle. Für deine CRM-Datenqualität reicht sie nicht.

Drei Grenzen, die du kennen musst

  • Die WER zählt jedes Wort gleich. Ein falsches Füllwort und ein falscher Betrag erzeugen dieselbe Fehlerzahl. Im CRM sind die Folgen völlig unterschiedlich: Das eine fällt niemandem auf, das andere verfälscht deinen Forecast.
  • Die WER ist blind für Groß-/Kleinschreibung, Zahlenformate und Namensschreibweisen. Genau diese Werte fehlen dir aber in den Dashboards, wenn sie falsch ankommen.
  • Die WER sagt nichts über das Ziel aus. Ob 'eins Komma fünf' als 1,5 oder als 15 im Feld Betrag landet, entscheidet sich nach der Erkennung, bei der Normalisierung und Feldzuordnung.

Wichtig zur Einordnung: Das hier ist keine allgemeine Rangliste von Sprachmodellen. Es geht um die Grenze der Metrik. Ein niedriger WER ist eine notwendige, aber keine hinreichende Bedingung für saubere CRM-Daten. Deshalb prüfst du Voice-to-CRM an den Werten, die deine Pipeline wirklich trägt: Namen, Beträge, Mengen und Produktcodes.

Welche Namen und Zahlen gehören ins Testset?

Dein Testset braucht Verwechslungspaare, die im echten Vertriebsalltag auseinandergehalten werden müssen. Fiktive, aber realistische Fälle reichen dafür völlig: Sie müssen nur die Fehlermuster abdecken, die später auch deine echten Deals treffen.

Fall Gesprochen Kritisch, weil
Nachname Meier Klingt fast identisch, landet aber in unterschiedlichen Kontaktdatensätzen
Zahlwort fünfzehn Zehnerpotenz-Fehler in der Menge
Dezimalbetrag eins Komma fünf Faktor zehn im Feld Betrag oder Rabatt
Produktcode PX-450 Buchstabieren und Ziffernfolge müssen sauber ankommen
Artikelnummer A-1207 vs. A-1702 Vertauschte Ziffern erzeugen die falsche Position im Angebot

‍

Zu jedem Fall notierst du vorab zwei Dinge: den Sollwert und das Ziel-CRM-Feld. Erst dieser Soll-Ist-Vergleich macht den Test auswertbar. Ohne die Notierung diskutierst du hinterher, was der Assistent 'gemeint' haben könnte, statt messen zu können.

  • Sollwert exakt festhalten: 1,5 bleibt 1,5, nicht 1.5 oder 15.
  • Ziel-CRM-Feld benennen: Opportunity, Betragsfeld, benutzerdefiniertes Feld, Kontakt.
  • Begriffe aus deinem echten Sortiment anonymisiert ergänzen: eigene Produktnamen, interne Projektcodes, typische Kundenrollen.

Der letzte Punkt ist der wichtigste. Entitätsfehler, also ein falscher Name oder eine falsche Nummer, schaden deinen Daten mehr als ein halber Punkt Gesamt-WER. Ein generisches Testset mit Standardsätzen blendet genau diese Fehler aus.

Wie testest du Sprache unter realistischen Bedingungen?

Ein Test im stillen Büro sagt wenig aus über den Moment, in dem es zählt: nach dem Kundentermin, im Auto, auf der Straße. Du wiederholst dieselben Fälle über denselben Kanal, den du auch im Alltag nutzt, unter zwei Bedingungen.

  1. Ruhiges Büro: Referenzbedingung, um die Basisgenauigkeit zu sehen.
  2. Typische Umgebung nach einem Besuch: Auto, Straßenlärm, Freisprechanlage. Genau hier entstehen Debriefs in der Praxis.
  3. Pro Lauf festhalten: Sprecher, Verbindung (Sprachanruf, Netzqualität) und exakte Eingaben. Nur so kannst du Unterschiede zuordnen, statt zu raten.

Zur Einordnung der Stichprobe: Microsoft verlangt für aussagekräftige Genauigkeitstests 30 Minuten bis 5 Stunden repräsentatives Audio[2]. Ein einzelner Testlauf liegt weit darunter. Leite daraus keinen repräsentativen Benchmark ab, sondern behandle ihn als Momentaufnahme. Die WER hängt stark von Bedingung und Umgebung ab; dieselben Fälle können im Büro sauber und im stehenden Auto fehlerhaft erkannt werden.

Praktisch heißt das: Plane mehrere kurze Läufe über mehrere Tage ein, nicht einen langen Marathon. Notiere pro Lauf, welche Fälle wiederholt scheitern. Wiederholte Fehler unter gleichen Bedingungen sind ein echtes Muster, ein einmaliger Ausreißer ist meist nur Lärm.

Wie unterscheidest du Erkennungsfehler und Feldfehler?

Wenn ein Wert falsch im CRM landet, kann das vier verschiedene Ursachen haben. Erst wenn du die Ebenen trennst, weißt du, wo du ansetzen musst: beim Sprachmodell, bei der Normalisierung, bei der Feldzuordnung oder beim Datensatz-Matching.

Prüfpunkt Frage Beispiel für einen Fehler
Verstandener Text Wurde das Gesprochene korrekt erkannt? 'Meier' wird als 'Mayer' transkribiert
Normalisierter Wert Wurde der Wert richtig formatiert? Gesprochenes 'eins Komma fünf' landet als 15 statt 1,5
Richtiges Feld Landet der Wert im vorgesehenen Feld? Der Betrag steht im Freitextfeld statt im Betragsfeld
Richtiger Datensatz Wurde der richtige Eintrag aktualisiert? Das Update geht auf die falsche Opportunity

‍

Das Endziel ist das strukturierte CRM-Update aus dem Sprachdebrief: Die Daten müssen im richtigen Feld und im richtigen Format ankommen, nicht nur im Transkript stehen. Genau so arbeiten die Phone Assistants: Aus dem gesprochenen Debrief entstehen strukturierte Updates, die im CRM in den richtigen Feldern landen[3].

Pro Fehler hältst du fest, welche Korrektur nötig war und wie lange sie gedauert hat. Das ist deine eigentliche Währung: nicht die Fehlerzahl, sondern der verbleibende Korrekturaufwand pro Fall. Das Datensatz-Matching selbst, also die Zuordnung eines Gesprächs zum richtigen CRM-Eintrag, ist ein eigenes Thema und bleibt einem eigenen Artikel vorbehalten.

Was bringen Fachvokabular und Nachfragen?

Es gibt eine technische Möglichkeit, kritische Begriffe zu stärken: Phrase-Listen. Das sind vorab hinterlegte Begriffslisten, die das Erkennungsgewicht dieser Wörter erhöhen, ohne ein eigenes Modell zu trainieren. Microsoft beschreibt das für die Azure Speech Services: Namen, Orte, Homonyme und branchenspezifische Begriffe lassen sich per Phrase-Liste gewichten, und das Gewicht lässt sich in einer Spanne von 0,0 bis 2,0 einstellen[4].

Azure ist hier ein Beispiel für die technische Machbarkeit, kein Nachweis über eine konkrete Produktarchitektur: Welcher Anbieter welche Engine im Hintergrund nutzt, kannst du von außen meist nicht prüfen. Die Frage, die du deinem Anbieter stellst, bleibt aber dieselbe, egal welche Engine läuft.

  • Kann der Anbieter deine eigene Terminologie hinterlegen, also Produktnamen, Projektcodes und häufige Kundennamen?
  • Kann der Assistent beim Erfassen buchstabieren, etwa bei Produktcodes wie 'PX-450'?
  • Bestätigt der Assistent kritische Zahlen per Rückfrage, bevor der Wert ins CRM geht?

Der dritte Punkt ist oft wirksamer als jede Modellmetrik. Eine Rückfrage kostet Sekunden. Ein falscher Betrag im Forecast kostet Glaubwürdigkeit, bei der nächsten Pipeline-Review und gegenüber der Geschäftsführung. Ein Assistent, der kritische Werte aktiv bestätigt, entlastet dich mehr als ein Transkript, das flüssig aussieht, aber im Detail danebenliegt.

Wann besteht Bliro deinen Praxistest?

Am Ende zählt ein Abnahmebogen, kein Demo-Eindruck. Du füllst ihn mit deinen eigenen Fällen und legst die Schwellen vor dem Test fest, gemeinsam mit Sales-IT und Team. Übernimm keine Genauigkeitsgarantie aus Vendor-Demos; ein Vorschlag für Schwellen ist genau das: ein Vorschlag, den ihr vor dem Test abstimmt.

Messgröße Was du misst Beispiel für eine Schwelle (Vorschlag)
Kritische Werte korrekt Anteil der Testfälle, bei denen Name, Betrag und Produktcode korrekt im richtigen Feld landen Mind. 90 Prozent der kritischen Werte korrekt
Ungelöste Fehler Fälle, die nach dem Durchlauf fehlerhaft bleiben und manuell korrigiert werden müssen Kein ungelöster Fehler bei Beträgen und Produktcodes
Korrekturzeit Durchschnittliche Zeit, um einen fehlerhaften Fall zu korrigieren Unter 30 Sekunden pro Fall

‍

Die problematischen Fälle aus deinem Testset wiederholst du gezielt mit den Bliro Phone Assistants (Vicky & Tim). Die Assistenten führen vor und nach dem Kundentermin ein echtes Sprachgespräch, strukturieren den Debrief zu einem Besuchsbericht und füllen CRM-Felder aus dem Gesagten, statt getippt zu werden[3]. Genau dieser Weg, vom gesprochenen Satz bis zum gefüllten Feld, ist das, was dein Abnahmebogen prüft.

Bliro besteht deinen Praxistest also dann, wenn die kritischen Werte aus deinem echten Sortiment zuverlässig im richtigen Feld landen, ungelöste Fehler unter deiner Schwelle bleiben und die Korrekturzeit im Rahmen bleibt. Alles andere ist Demo.

Der nächste Schritt: kritische Werte mit Vicky und Tim durchspielen

Du hast jetzt zwei Werkzeuge: ein Testset mit Verwechslungspaaren, Sollwerten und Ziel-CRM-Feldern, und einen Abnahmebogen mit drei Messgrößen. Beides funktioniert ohne Vendor-Unterstützung. Nimm beides und teste deine eigenen Namen, Beträge und Produktcodes, nicht die eines Demo-Accounts.

  • Spiel die kritischen Fälle aus deinem echten Vertriebsalltag mit den Bliro Phone Assistants (Vicky & Tim) durch: Vorbereitung per Sprachanruf, Debrief nach dem Termin, CRM-Update aus dem Gesagten.
  • Auf der Produktseite für den Außendienst findest du, wie die Assistenten im Alltag deiner Reps arbeiten: Bliro für den Außendienst.
  • Entscheide am Ende mit Daten statt mit Eindruck: Bestehen die kritischen Werte deinen Test, oder nicht.

Quellen

  1. https://en.wikipedia.org/wiki/Word_error_rate
  2. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/how-to-custom-speech-evaluate-data
  3. https://help.bliro.io/en/articles/15068158-meet-vicky-tim-voice-ai-assistants-for-field-sales
  4. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/improve-accuracy-phrase-list

Ein Tag im Außendienst mit Bliro im Einsatz.

Ein Außendienstmitarbeiter steuert Bliro freihändig per Sprache aus dem Auto: Direkt nach dem Kundentermin ruft er Vicky an, den KI-Sprachassistenten von Bliro, und diktiert seinen Besuchsbericht während der Fahrt. Bliro pflegt daraus automatisch das CRM, legt Folgetermine im Kalender an und schreibt die Follow-up-E-Mail - Voice-to-CRM und die komplette Schreibtischarbeit, ohne Nacharbeit am Abend.
Ein Tag im Außendienst mit Bliro im Einsatz.

Mit Klick auf Play stimmst du dem Laden von YouTube und Marketing-Cookies zu.

Deine Fragen, unsere Antworten

Was ist die Wortfehlerrate (WER) und wie wird sie berechnet?
Warum reicht die WER nicht aus, um Voice-to-CRM zu bewerten?
Welche Namen und Zahlen sollte ich in mein Testset aufnehmen?
Wie teste ich Spracherkennung unter realistischen Bedingungen?
Was sind Phrase-Listen und helfen sie bei Namen und Fachbegriffen?
Wie lege ich Abnahmekriterien für Voice-to-CRM fest?

Der persönliche Assistent für das Außendienst-Team

Vicky & Tim sind Bliros KI-Voice-Agenten für B2B-Außendienstteams. Sie bereiten Gespräche vor, pflegen CRM-Einträge und erstellen Follow-ups - per Sprache, ohne Tippen. Eine Transkription von Gesprächen kann optional zusätzlich genutzt werden.
Demo buchen