Jede Stimme, Wort für Wort.

Wie genau ist die Transkription? Zahlen und Grenzen

7,90 €pro Datei, bis 3 Stunden

Eine Datei, ein Preis. Kein Abo.

  • Ohne Konto
  • Erste 2 Minuten gratis
  • Vertraulich: ohne Bestellung nach 24 Stunden gelöscht

Dettalo nutzt ElevenLabs Scribe v2 für die Spracherkennung. Hier steht, was unabhängige Tests messen, warum echte Aufnahmen schlechter abschneiden als vorgelesene Sprache und wie du die Qualität an deiner eigenen Datei prüfst, bevor du zahlst.

  • Wörtlich + geglättet
  • 6 Dateien: Word, TXT, Markdown
  • Über 90 Sprachen
  • Jeder Sprecher erkannt
  • Geld zurück innerhalb von 7 Tagen

Zwei Fassungen jedes Transkripts

Wörtlich Jedes Wort wie gesprochen, mit allen Füllwörtern.

Interviewerin

Also, äh, wie hast du, wie hast du mit der Bäckerei angefangen?

Lucia

Na ja, ich hab 2019 angefangen, mit, ähm, einem einzigen Ofen und meinem Freund Marco Belutschi. Das erste Jahr war echt hart.

Geglättet Korrigiert und gegliedert, mit Zwischentiteln und Zusammenfassung. Nichts hinzugefügt.

Die Anfänge

Interviewerin

Also, wie hast du mit der Bäckerei angefangen?

Lucia

Na ja, ich hab 2019 angefangen, mit einem einzigen Ofen und meinem Freund Marco Bellucci. Das erste Jahr war echt hart.

Die Namen, die du angibst, korrigieren die Schreibweise: Aus „Marco Belutschi“ wird „Marco Bellucci“.

Was unabhängige Tests messen

Das Open ASR Leaderboard (Hugging Face und andere, Paper in Version 4 vom 30. März 2026) vergleicht Modelle mit vorgelesener Sprache aus den Datensätzen FLEURS, MLS und CoVoST-2. Wortfehlerrate im mehrsprachigen Teil, niedriger ist besser:

Modell Deutsch Französisch Spanisch Italienisch
ElevenLabs Scribe v2 (nutzt Dettalo) 2,27 % 3,28 % 2,33 % 2,58 %
AssemblyAI Universal-3 Pro (Version März 2026) 2,34 % 3,74 % 2,34 % 3,94 %
Cohere Transcribe (offenes Modell) 3,84 % 4,05 % 2,81 % 3,44 %
Speechmatics Enhanced 2,84 % 5,04 % 2,78 % 5,58 %
Voxtral Small 24B (offenes Modell) 3,01 % 4,13 % 3,04 % 3,91 %
Whisper large-v3 (offenes Modell) 4,26 % 6,36 % 3,65 % 4,69 %

Quelle: Paper des Open ASR Leaderboard auf arXiv. Im Leaderboard von Artificial Analysis, überwiegend Englisch (rund 8 Stunden Gespräche, Parlamentsreden und Telefonkonferenzen zu Geschäftszahlen), liegt Scribe v2 mit 2,2 % knapp hinter MAI-Transcribe-2 (2,0 %) und vor Gemini 3.5 Transcribe (2,6 %), Voxtral Small (2,8 %), AssemblyAI Universal-3 Pro (3,1 %), OpenAI GPT Transcribe (3,3 %) und Deepgram Nova-3 (5,2 %). ElevenLabs selbst führt Deutsch in seiner besten Stufe, mit einer Wortfehlerrate von höchstens 5 % (Dokumentation von ElevenLabs).

Was die Wortfehlerrate bedeutet

Man vergleicht das automatische Transkript mit einem Referenztranskript, das Menschen erstellt haben. Gezählt werden ersetzte, ausgelassene und zusätzliche Wörter, geteilt durch die Zahl der Wörter in der Referenz. 2,27 % heißt: gut 2 Fehler auf 100 Wörter, also etwa 7 auf einer Seite mit 300 Wörtern. Nicht jeder Fehler wiegt gleich: Ein falscher Artikel stört kaum, ein falscher Name oder eine falsche Zahl kann den Sinn ändern.

Warum echte Aufnahmen schlechter abschneiden

Vorgelesene Sprache ist der einfache Fall: eine Stimme zur Zeit, vorher geschriebene Sätze. Echte Aufnahmen sind schwieriger. Lärm, Abstand zum Mikrofon, Stimmen, die sich überlagern, und starke Akzente oder Dialekte erhöhen die Fehlerrate. Ein Interview im Café oder ein Meeting, in dem alle durcheinanderreden, ergibt mehr Fehler als die Tabelle.

Prüf es an deiner eigenen Datei

Darum liest du die ersten 2 Minuten deiner Aufnahme, bevor du zahlst: mit erkannten Sprechern, in beiden Fassungen, nach etwa 2 Minuten. Achte auf Namen, Fachbegriffe und darauf, ob die Sprecher sauber getrennt sind. Ist die erkannte Sprache falsch, wählst du die richtige, und die Vorschau läuft neu.

So funktioniert es

1

Hochladen

Audio- oder Videodatei bis 3 Stunden hineinziehen. Ohne Konto.

2

Kostenlose Vorschau lesen

Nach etwa 2 Minuten liest du die ersten 2 Minuten, mit erkannten Sprechern, wörtlich und geglättet.

3

Einmal bezahlen

E-Mail eingeben und nur diese Datei bezahlen. Kein Abo.

4

Herunterladen

Wir schicken dir einen privaten Link. Namen bestätigen und 6 Dateien herunterladen.

Was ein Transkript kostet

PreisBezahlung
Menschliche Transkription (Rev) 1,99 US-$ pro Minute: etwa 119 US-$ für eine Stunde Pro Audiominute
Abo-Apps (TurboScribe, Otter) 16,99–20 US-$ im Monat, oder 8,33–10 US-$ im Monat bei Jahreszahlung Monats- oder Jahresabo
Dettalo 7,90 € pro Datei, bis 3 Stunden Einmal pro Datei, kein Abo
Preise von rev.com, turboscribe.ai und otter.ai, geprüft am 7. Oktober 2026. [1] [2] [3]

Fragen und Antworten

Ist das Transkript fehlerfrei?

Nein. Keine Spracherkennung ist perfekt: Namen, Zahlen, Stimmen, die sich überlagern, und Hintergrundgeräusche führen zu Fehlern. Die Fassung Geglättet korrigiert eindeutige Fehler und listet jede Änderung auf. Was du zitierst oder veröffentlichst, solltest du trotzdem nachhören.

Welche Spracherkennung nutzt Dettalo?

ElevenLabs Scribe v2, bei einem Ausfall AssemblyAI. Die geglättete Fassung schreibt Claude (Anthropic) auf Grundlage der wörtlichen.

Wie gut wird Deutsch erkannt?

ElevenLabs führt Deutsch in seiner besten Genauigkeitsstufe („Excellent“, Wortfehlerrate höchstens 5 %), zusammen mit Englisch, Französisch, Spanisch, Italienisch, Niederländisch, Portugiesisch und Japanisch. Im Open ASR Leaderboard kam Scribe v2 auf Deutsch auf 2,27 % bei vorgelesener Sprache.

Kommt die Erkennung mit Dialekt zurecht?

Starker Dialekt oder Akzent erhöht die Fehlerrate, genauso wie Lärm oder Abstand zum Mikrofon. Am sichersten prüfst du es an der Vorschau der ersten 2 Minuten deiner eigenen Aufnahme.

Wie bekomme ich weniger Fehler?

Trag vor dem Hochladen Namen und Fachbegriffe ein (bis zu 60) und gib an, wie viele Personen sprechen. Bei der Aufnahme gilt: Mikrofon nah an die Stimmen, und möglichst nicht gleichzeitig reden.

Und wenn mir das Ergebnis nach dem Kauf nicht reicht?

Innerhalb von 7 Tagen bekommst du mit einem Klick auf deiner Bestellseite den vollen Betrag zurück, ohne Begründung. Siehe Erstattung.