Zum Inhalt springen

Sprachschnittstellen für Websites

Sprachschnittstellen machen Websites, Portale und Anwendungen per Spracheingabe, Transkription und Sprachausgabe nutzbar.

Ausgangslage

Für Unternehmen zählen Sprachschnittstellen an drei Stellen: Barrierefreiheit, Formulare und Suchfelder sowie Audio- und Videoinhalte, die durchsuchbar werden sollen. Seit Juni 2025 gilt das Barrierefreiheitsstärkungsgesetz (BFSG) für viele digitale Angebote an Verbraucher. Sprache ergänzt dabei eine saubere Grundlage nach WCAG 2.2 AA mit Bedienung per Tastatur und Screenreader. Ersetzen kann sie diese Grundlage nicht.

Typische Einsatzfälle

  • Transkription und Untertitel: für Videos, Webinare und Podcasts. Für aufgezeichnete Videos fordert die WCAG ohnehin Untertitel.

  • Diktat in Formularen: Schadensmeldungen oder Serviceanfragen sprechen statt tippen, hilfreich auf dem Smartphone und bei motorischen Einschränkungen.

  • Sprachsuche: Die Suche versteht gesprochene Fragen.

  • Sprachausgabe: Text-to-Speech liest Inhalte vor, etwa in Portalen oder Apps.

  • Gespräche auswerten: Service- und Beratungsgespräche transkribieren, zusammenfassen und durchsuchbar machen, mit Einwilligung aller Beteiligten.

Technik und Anbieter

Für die Spracherkennung kommen Microsoft Azure, Google Cloud Speech-to-Text oder Open-Source-Modelle wie Whisper auf eigener Infrastruktur infrage. Neuronale Stimmen lesen Fachbegriffe per Aussprachelexikon korrekt.

Die Web Speech API des Browsers ist schnell eingebunden, schickt Aufnahmen je nach Browser aber an Server des Herstellers. Für sensible Eingaben taugt sie meist nicht.

Datenschutz und Betrieb

Sprachaufnahmen sind personenbezogene Daten. Vorab klären wir, wo sie verarbeitet und wie lange sie gespeichert werden. Wo nötig, laufen die Modelle in Rechenzentren in der EU oder auf deinen eigenen Servern. Ohne vereinbarte Speicherung werden Aufnahmen nach der Verarbeitung gelöscht.

Vorgehen

  1. Einsatzfall klären: wer spricht, wo, in welcher Sprache und mit welchem Fachvokabular.

  2. Modelle vergleichen: zwei bis drei Modelle mit echten Aufnahmen testen, nach Fehlerquote beim Fachvokabular, Latenz und Kosten pro Minute.

  3. Integration: in Website, Portal oder App, mit sichtbarem Status und Texteingabe als Alternative.

  4. Test und Betrieb: Prüfung mit Screenreadern und echten Nutzenden, danach Monitoring. Neue Modellversionen laufen vor jedem Wechsel durch denselben Test.

Projekt anfragen

Zurück nach oben