Kostenlose Spracherkennung für Spanisch
Laden Sie Ihre spanische Audio- oder Videodatei hoch und erhalten Sie in wenigen Minuten ein bearbeitbares Transkript – Akzente, ñ und umgekehrte Fragezeichen inklusive, direkt im Browser und zum Einstieg kostenlos.
Spanisch wird von rund 500 Millionen Menschen als Muttersprache gesprochen und liegt damit nur hinter dem Mandarin-Chinesischen. Es ist Amtssprache in zwanzig Ländern – Spanien, Äquatorialguinea und achtzehn Staaten Lateinamerikas – sowie in Puerto Rico. Wegen dieser Verbreitung kommen spanische Aufnahmen aus Madrider Redaktionen, Callcentern in Mexiko-Stadt, Podcast-Studios in Buenos Aires und der Feldforschung in den Anden – alle schreiben dieselbe Sprache und keiner spricht sie ganz gleich.
Die spanische Rechtschreibung bildet die Laute sehr genau ab, was den größten Teil der Schwierigkeit anderswohin verschiebt: auf die Zeichen. Der Akzent (die tilde) ist keine Zierde, er trägt Bedeutung. Papá ist Papa und papa eine Kartoffel; sí heißt ja und si heißt wenn; término, termino und terminó sind ein Substantiv, eine erste und eine dritte Person, getrennt allein durch die Stelle des Akzents. Das ñ ist ein eigenständiger Buchstabe und kein n mit Hütchen – año ist ein Jahr, ano nicht. ConvertSpeech schreibt all das, und genau das trennt lesbares Spanisch von abgespeckter Maschinenausgabe.
Dann sind da die umgekehrten Satzzeichen. Spanisch eröffnet eine Frage mit ¿ und einen Ausruf mit ¡ – und zwar dort, wo die Frage tatsächlich beginnt, was oft mitten im Satz ist statt an seinem Anfang. Das wiegt im Spanischen schwerer, als die Symmetrie vermuten lässt: Die Wortstellung unterscheidet Frage und Aussage häufig nicht – „tienes hambre" und „¿tienes hambre?" sind dieselben Wörter –, und erst die Zeichen sagen der Leserin, worum es sich handelt. Das Beispieltranskript weiter unten zeigt, wie die Engine ein ¿ mitten im Satz nach einem Komma setzt, genau dort, wo es auch ein menschlicher Redakteur setzen würde.
Die Aussprache legt eine letzte Schicht darauf, die auch sauberstes Audio nicht entfernt. Sprecher mit Seseo sprechen casa und caza identisch aus, der Yeísmo macht cayó und calló zum selben Laut, b und v sind im Spanischen ein Laut, und h ist stumm – ob also tuvo oder tubo, ob haya, halla oder aya geschrieben wird, entscheidet allein der Kontext. Laden Sie Ihre Audio- oder Videodatei hoch, und die Engine schreibt das gesprochene Spanisch als sauberen, durchsuchbaren Text mit Zeichensetzung nieder. Alles läuft im Browser, ohne Installation, und die ersten Minuten sind kostenlos, ganz ohne Konto.
Wofür Spanisch (Spanien) transkribiert wird
Journalisten und grenzüberschreitende Interviews
Verwandeln Sie aufgezeichnete spanische Interviews in wenigen Minuten in zitierfähigen Text – ob die sprechende Person aus Sevilla, Guadalajara oder Montevideo stammt: ein Projekt, mehrere Akzente, ein Transkript.
Forschung und Feldarbeit
Machen Sie aus spanischen Vorlesungen, Oral-History-Aufnahmen und Fokusgruppen durchsuchbare Notizen, die Sie zitieren, kodieren und auswerten können, ohne sie vorher abzutippen.
Podcaster und Creator
Erstellen Sie spanische Shownotes, Untertitel und Artikel direkt aus dem Audio Ihrer Episode – so wird Ihr gesamter Backkatalog nicht nur hörbar, sondern auch als Text durchsuchbar.
So sieht ein spanisches Transkript wirklich aus
Dies ist eine echte 45-Sekunden-Aufnahme eines menschlichen Sprechers, durch unsere KI-Engine geschickt – genau so, wie Sie Ihre eigene Datei verarbeiten würden. Nichts wurde nachträglich korrigiert. Drücken Sie auf Play und lesen Sie mit.
KI-Engine, 24 Sekunden Verarbeitung
- 00:00Sacristán de la iglesia de Monserrate, le destinaba a seguir la carrera de derecho, porque se le había metido en la cabeza que el mocoso aquel llegaría a ser personaje, quizá orador célebre, ¿por qué no ministro?
- 00:13La futura celebridad habló así a su compañero: «¡Mia tú, Carso!
- 00:21si a mí me dieran esas chanzas, de la galleta que les pegaba les ponía la cara verde.
- 00:26Pero tú no tienes coraje.
- 00:28Yo digo que no se deben poner motes a las personas.
- 00:32¿Sabes tú quién tiene la culpa?
- 00:34Pues Posturitas, el de la casa de empeños; ayer fue contando que su mamá había dicho que a tu abuela y a tus tías las llaman las miau, porque tienen.
Bemerkenswert: Die erste Zeile endet mit ¿por qué no ministro?, und das ¿ wird mitten im Satz nach einem Komma geöffnet – genau dort, wo die Frage beginnt, und nicht am Satzanfang. Das ist die Regel, die automatisch erzeugtes Spanisch am häufigsten verfehlt. Die direkte Rede beginnt mit «¡Mia tú, und die Engine hat sich von selbst für spanische Winkelanführungszeichen und das umgekehrte Ausrufezeichen entschieden. Die Akzente sitzen dort, wo sie das Wort verändern: tú und quién in ¿Sabes tú quién tiene la culpa? sind gesetzt, das unbetonte tu in a tu abuela nicht. Sacristán, había, llegaría, quizá, célebre, compañero, ponía, empeños, mamá und tías kommen alle korrekt heraus. Fehlerfrei ist es nicht – der Junge heißt im Roman Cadalso, das Transkript schreibt Carso, aus der Pfarrei Monserrat wird Monserrate, und bei Eigennamen rutscht ein spanisches Transkript zuerst ab.
Das ist sorgfältiges, klar artikuliertes Vorlesen – näher an einer Vorlesung oder einem Diktat als an echtem Gespräch. Ein lautes Café-Interview, in dem drei Personen durcheinanderreden, oder ein schneller karibischer Sprecher, der jedes silbenauslautende s verschluckt, wird nicht so sauber herauskommen; das schafft kein automatisches System. Die letzte Zeile bricht außerdem mitten im Satz ab, weil dort schlicht die 45 Sekunden enden. Die Aufnahmequalität bleibt der wichtigste Einzelfaktor für das Ergebnis.
Aufnahme: „Miau" von Benito Pérez Galdós, Kapitel 1, LibriVox (2026). Public Domain Mark 1.0. Ausschnitt von 3:29 bis 4:14.
Spanische Akzente und regionale Varianten, die wir abdecken
Das europäische (kastilische) Spanisch bewahrt eine Unterscheidung, die der Großteil der spanischsprachigen Welt verloren hat: c vor e oder i sowie z werden als /θ/ gesprochen, also wie das englische „th" in think – casa und caza sind damit nicht nur auf dem Papier, sondern auch fürs Ohr verschiedene Wörter. Der Fachbegriff dafür lautet distinción, nicht ceceo: Ceceo ist die umgekehrte Zusammenlegung, bei der /s/ selbst als /θ/ realisiert wird, und ein regionales Merkmal von Teilen Andalusiens, nicht die spanische Norm. Im iberischen Spanisch begegnen Ihnen außerdem vosotros und die zugehörigen Verbendungen – habláis, tenéis, sois, vosotros os –, die in lateinamerikanischen Aufnahmen schlicht nicht vorkommen.
Das mexikanische Spanisch ist nach Sprecherzahl die größte Einzelvariante und eine der unkompliziertesten für die Transkription: Das silbenauslautende s bleibt deutlich hörbar, und der Rhythmus ist gleichmäßig. Einen zweiten Blick verdienen Wortschatz und Ortsnamen aus dem Nahuatl – elote, popote, chamaco, guajolote – sowie der Buchstabe x, der in México, Oaxaca und Xalapa wie ein j klingt, in taxi aber als /ks/ und in Xochimilco als „sch". Nichts davon lässt sich aus der Schreibung ableiten, deshalb lohnen Eigennamen einen Kontrollblick.
Das Rioplatense-Spanisch rund um Buenos Aires und Montevideo hat zwei Merkmale, die den Text selbst verändern. Der Voseo ersetzt tú durch vos und bringt eigene Verbformen mit – vos hablás, vos tenés, vos sos sowie Imperative wie vení, mirá, decime –, und das ist korrektes Spanisch und kein Fehler, der zu tú eres normalisiert werden müsste. Das zweite ist der Žeísmo: ll und y werden als „sch"- oder „dsch"-Laut gesprochen, sodass calle wie „cashe" und yo wie „sho" klingt. Die Engine transkribiert, welche Wörter es sind, nicht wie sie ausgesprochen wurden – die Ausgabe bleibt also in der Standardrechtschreibung.
Das karibische Spanisch – Kuba, Puerto Rico, die Dominikanische Republik sowie die Küsten Venezuelas und Kolumbiens – ist für jedes automatische System die schwierigste Gruppe, und das aus einem ehrlichen Grund. Silbenauslautendes s wird zu einem h behaucht oder ganz weggelassen, sodass aus los dos „loh doh" wird und las casas identisch mit la casa klingen kann. Weil genau dieses s den Plural markiert, muss die Engine grammatische Information rekonstruieren, die nie ausgesprochen wurde – allein aus dem Kontext. Endkonsonanten schwächen sich ab, para verkürzt sich zu pa, und das Tempo ist hoch. Klares Audio hilft hier mehr als irgendwo sonst.
Das Andenspanisch im Hochland von Peru, Bolivien und Ecuador steht am anderen Ende: Es ist konservativ, das silbenauslautende s bleibt erhalten, und in Teilen der Region lebt die alte Unterscheidung von ll und y, die der Yeísmo anderswo getilgt hat, noch fort. Die Schwierigkeit liegt hier im Wortschatz statt im Klang – Lehnwörter und Ortsnamen aus dem Quechua und Aymara durchziehen die Alltagssprache, und zweisprachige Sprecher können Vokalmuster aus diesen Sprachen zeigen. Das chilenische Spanisch verdient eine eigene Warnung: schnell, stark behaucht, mit zusammengezogenen Verbendungen wie ¿cachái? und ¿estái?, gehört es zu den anspruchsvollsten Varianten überhaupt.
Tipps für eine präzise spanische Transkription
- Nehmen Sie mit einem guten Mikrofon und möglichst wenig Hintergrundgeräuschen auf – die Audioqualität ist der wichtigste Einzelfaktor.
- Stellen Sie die Sprache fest auf Spanisch statt auf automatische Erkennung, wenn Sie wissen, dass die Aufnahme spanisch ist.
- Am besten spricht immer nur eine Person; starkes Durcheinanderreden senkt in jeder Sprache die Genauigkeit.
- Aktivieren Sie bei Interviews die Sprechererkennung (kostenlose Funktion für registrierte Nutzer), damit gekennzeichnet wird, wer was gesagt hat.
- Lesen Sie zuerst die Akzente gegen, denn im Spanischen ist der Akzent Grammatik und keine Zierde. Prüfen Sie die Paare und Trios, bei denen er der einzige Unterschied ist: término / termino / terminó, público / publico / publicó, papá / papa, sí / si, él / el – und alles mit ñ.
- Nehmen Sie sich danach die Homophone vor, die der Klang allein nicht klären kann. Der Seseo macht casa und caza identisch, der Yeísmo dasselbe mit cayó und calló, b und v sind ein Laut, und h ist stumm – tuvo / tubo, haya / halla, votar / botar und a ver / haber hängen also am Kontext und sind die wahrscheinlichsten Fehlerstellen.