Freie Konvertierungen übrig: 1

Kostenlose Spracherkennung für Spanisch

Laden Sie Ihre spanische Audio- oder Videodatei hoch und erhalten Sie in wenigen Minuten ein bearbeitbares Transkript – Akzente, ñ und umgekehrte Fragezeichen inklusive, direkt im Browser und zum Einstieg kostenlos.

Spanisch (Spanien)-Datei hier ablegen

ODER

Unterstützte Formate: MP3, WAV, MP4, FLAC, WEBM, M4A, OGG, OPUS, AAC, AMR, AIFF, AIF, WMA, MOV, MKV, AVI, MPG, MPEG, 3GP, WMV

Max. Dateigröße pro Upload: 95 MB

Kostenlos testen: Wir transkribieren die ersten 3 Minuten deiner Datei · Registriere dich kostenlos für mehr

Spanisch wird von rund 500 Millionen Menschen als Muttersprache gesprochen und liegt damit nur hinter dem Mandarin-Chinesischen. Es ist Amtssprache in zwanzig Ländern – Spanien, Äquatorialguinea und achtzehn Staaten Lateinamerikas – sowie in Puerto Rico. Wegen dieser Verbreitung kommen spanische Aufnahmen aus Madrider Redaktionen, Callcentern in Mexiko-Stadt, Podcast-Studios in Buenos Aires und der Feldforschung in den Anden – alle schreiben dieselbe Sprache und keiner spricht sie ganz gleich.

Die spanische Rechtschreibung bildet die Laute sehr genau ab, was den größten Teil der Schwierigkeit anderswohin verschiebt: auf die Zeichen. Der Akzent (die tilde) ist keine Zierde, er trägt Bedeutung. Papá ist Papa und papa eine Kartoffel; sí heißt ja und si heißt wenn; término, termino und terminó sind ein Substantiv, eine erste und eine dritte Person, getrennt allein durch die Stelle des Akzents. Das ñ ist ein eigenständiger Buchstabe und kein n mit Hütchen – año ist ein Jahr, ano nicht. ConvertSpeech schreibt all das, und genau das trennt lesbares Spanisch von abgespeckter Maschinenausgabe.

Dann sind da die umgekehrten Satzzeichen. Spanisch eröffnet eine Frage mit ¿ und einen Ausruf mit ¡ – und zwar dort, wo die Frage tatsächlich beginnt, was oft mitten im Satz ist statt an seinem Anfang. Das wiegt im Spanischen schwerer, als die Symmetrie vermuten lässt: Die Wortstellung unterscheidet Frage und Aussage häufig nicht – „tienes hambre" und „¿tienes hambre?" sind dieselben Wörter –, und erst die Zeichen sagen der Leserin, worum es sich handelt. Das Beispieltranskript weiter unten zeigt, wie die Engine ein ¿ mitten im Satz nach einem Komma setzt, genau dort, wo es auch ein menschlicher Redakteur setzen würde.

Die Aussprache legt eine letzte Schicht darauf, die auch sauberstes Audio nicht entfernt. Sprecher mit Seseo sprechen casa und caza identisch aus, der Yeísmo macht cayó und calló zum selben Laut, b und v sind im Spanischen ein Laut, und h ist stumm – ob also tuvo oder tubo, ob haya, halla oder aya geschrieben wird, entscheidet allein der Kontext. Laden Sie Ihre Audio- oder Videodatei hoch, und die Engine schreibt das gesprochene Spanisch als sauberen, durchsuchbaren Text mit Zeichensetzung nieder. Alles läuft im Browser, ohne Installation, und die ersten Minuten sind kostenlos, ganz ohne Konto.

Anwendungsfälle

Wofür Spanisch (Spanien) transkribiert wird

Journalisten und grenzüberschreitende Interviews

Verwandeln Sie aufgezeichnete spanische Interviews in wenigen Minuten in zitierfähigen Text – ob die sprechende Person aus Sevilla, Guadalajara oder Montevideo stammt: ein Projekt, mehrere Akzente, ein Transkript.

Forschung und Feldarbeit

Machen Sie aus spanischen Vorlesungen, Oral-History-Aufnahmen und Fokusgruppen durchsuchbare Notizen, die Sie zitieren, kodieren und auswerten können, ohne sie vorher abzutippen.

Podcaster und Creator

Erstellen Sie spanische Shownotes, Untertitel und Artikel direkt aus dem Audio Ihrer Episode – so wird Ihr gesamter Backkatalog nicht nur hörbar, sondern auch als Text durchsuchbar.

Echtes Beispiel

So sieht ein spanisches Transkript wirklich aus

Dies ist eine echte 45-Sekunden-Aufnahme eines menschlichen Sprechers, durch unsere KI-Engine geschickt – genau so, wie Sie Ihre eigene Datei verarbeiten würden. Nichts wurde nachträglich korrigiert. Drücken Sie auf Play und lesen Sie mit.

KI-Engine, 24 Sekunden Verarbeitung

  1. 00:00Sacristán de la iglesia de Monserrate, le destinaba a seguir la carrera de derecho, porque se le había metido en la cabeza que el mocoso aquel llegaría a ser personaje, quizá orador célebre, ¿por qué no ministro?
  2. 00:13La futura celebridad habló así a su compañero: «¡Mia tú, Carso!
  3. 00:21si a mí me dieran esas chanzas, de la galleta que les pegaba les ponía la cara verde.
  4. 00:26Pero tú no tienes coraje.
  5. 00:28Yo digo que no se deben poner motes a las personas.
  6. 00:32¿Sabes tú quién tiene la culpa?
  7. 00:34Pues Posturitas, el de la casa de empeños; ayer fue contando que su mamá había dicho que a tu abuela y a tus tías las llaman las miau, porque tienen.

Bemerkenswert: Die erste Zeile endet mit ¿por qué no ministro?, und das ¿ wird mitten im Satz nach einem Komma geöffnet – genau dort, wo die Frage beginnt, und nicht am Satzanfang. Das ist die Regel, die automatisch erzeugtes Spanisch am häufigsten verfehlt. Die direkte Rede beginnt mit «¡Mia tú, und die Engine hat sich von selbst für spanische Winkelanführungszeichen und das umgekehrte Ausrufezeichen entschieden. Die Akzente sitzen dort, wo sie das Wort verändern: tú und quién in ¿Sabes tú quién tiene la culpa? sind gesetzt, das unbetonte tu in a tu abuela nicht. Sacristán, había, llegaría, quizá, célebre, compañero, ponía, empeños, mamá und tías kommen alle korrekt heraus. Fehlerfrei ist es nicht – der Junge heißt im Roman Cadalso, das Transkript schreibt Carso, aus der Pfarrei Monserrat wird Monserrate, und bei Eigennamen rutscht ein spanisches Transkript zuerst ab.

Das ist sorgfältiges, klar artikuliertes Vorlesen – näher an einer Vorlesung oder einem Diktat als an echtem Gespräch. Ein lautes Café-Interview, in dem drei Personen durcheinanderreden, oder ein schneller karibischer Sprecher, der jedes silbenauslautende s verschluckt, wird nicht so sauber herauskommen; das schafft kein automatisches System. Die letzte Zeile bricht außerdem mitten im Satz ab, weil dort schlicht die 45 Sekunden enden. Die Aufnahmequalität bleibt der wichtigste Einzelfaktor für das Ergebnis.

Aufnahme: „Miau" von Benito Pérez Galdós, Kapitel 1, LibriVox (2026). Public Domain Mark 1.0. Ausschnitt von 3:29 bis 4:14.

Varianten & Akzente

Spanische Akzente und regionale Varianten, die wir abdecken

Das europäische (kastilische) Spanisch bewahrt eine Unterscheidung, die der Großteil der spanischsprachigen Welt verloren hat: c vor e oder i sowie z werden als /θ/ gesprochen, also wie das englische „th" in think – casa und caza sind damit nicht nur auf dem Papier, sondern auch fürs Ohr verschiedene Wörter. Der Fachbegriff dafür lautet distinción, nicht ceceo: Ceceo ist die umgekehrte Zusammenlegung, bei der /s/ selbst als /θ/ realisiert wird, und ein regionales Merkmal von Teilen Andalusiens, nicht die spanische Norm. Im iberischen Spanisch begegnen Ihnen außerdem vosotros und die zugehörigen Verbendungen – habláis, tenéis, sois, vosotros os –, die in lateinamerikanischen Aufnahmen schlicht nicht vorkommen.

Das mexikanische Spanisch ist nach Sprecherzahl die größte Einzelvariante und eine der unkompliziertesten für die Transkription: Das silbenauslautende s bleibt deutlich hörbar, und der Rhythmus ist gleichmäßig. Einen zweiten Blick verdienen Wortschatz und Ortsnamen aus dem Nahuatl – elote, popote, chamaco, guajolote – sowie der Buchstabe x, der in México, Oaxaca und Xalapa wie ein j klingt, in taxi aber als /ks/ und in Xochimilco als „sch". Nichts davon lässt sich aus der Schreibung ableiten, deshalb lohnen Eigennamen einen Kontrollblick.

Das Rioplatense-Spanisch rund um Buenos Aires und Montevideo hat zwei Merkmale, die den Text selbst verändern. Der Voseo ersetzt tú durch vos und bringt eigene Verbformen mit – vos hablás, vos tenés, vos sos sowie Imperative wie vení, mirá, decime –, und das ist korrektes Spanisch und kein Fehler, der zu tú eres normalisiert werden müsste. Das zweite ist der Žeísmo: ll und y werden als „sch"- oder „dsch"-Laut gesprochen, sodass calle wie „cashe" und yo wie „sho" klingt. Die Engine transkribiert, welche Wörter es sind, nicht wie sie ausgesprochen wurden – die Ausgabe bleibt also in der Standardrechtschreibung.

Das karibische Spanisch – Kuba, Puerto Rico, die Dominikanische Republik sowie die Küsten Venezuelas und Kolumbiens – ist für jedes automatische System die schwierigste Gruppe, und das aus einem ehrlichen Grund. Silbenauslautendes s wird zu einem h behaucht oder ganz weggelassen, sodass aus los dos „loh doh" wird und las casas identisch mit la casa klingen kann. Weil genau dieses s den Plural markiert, muss die Engine grammatische Information rekonstruieren, die nie ausgesprochen wurde – allein aus dem Kontext. Endkonsonanten schwächen sich ab, para verkürzt sich zu pa, und das Tempo ist hoch. Klares Audio hilft hier mehr als irgendwo sonst.

Das Andenspanisch im Hochland von Peru, Bolivien und Ecuador steht am anderen Ende: Es ist konservativ, das silbenauslautende s bleibt erhalten, und in Teilen der Region lebt die alte Unterscheidung von ll und y, die der Yeísmo anderswo getilgt hat, noch fort. Die Schwierigkeit liegt hier im Wortschatz statt im Klang – Lehnwörter und Ortsnamen aus dem Quechua und Aymara durchziehen die Alltagssprache, und zweisprachige Sprecher können Vokalmuster aus diesen Sprachen zeigen. Das chilenische Spanisch verdient eine eigene Warnung: schnell, stark behaucht, mit zusammengezogenen Verbendungen wie ¿cachái? und ¿estái?, gehört es zu den anspruchsvollsten Varianten überhaupt.

Tipps

Tipps für eine präzise spanische Transkription

FAQ

Spanisch (Spanien)-Spracherkennung — Fragen

Ist die Spracherkennung für Spanisch wirklich kostenlos?
Ja – Sie können spanische Audiodateien kostenlos und ohne Anmeldung transkribieren. Wenn Sie mehr Transkriptionszeit benötigen, legen Sie einfach ein kostenloses Konto an.
Funktioniert es sowohl für europäisches als auch für lateinamerikanisches Spanisch?
Ja. Die Engine beherrscht kastilisches Spanisch, in dem c und z als /θ/ gesprochen werden, ebenso wie den Seseo Lateinamerikas und der Kanaren, wo dieselben Buchstaben wie ein s klingen. Weil die Schrift die Unterscheidung bewahrt, die der Seseo im Klang verliert, werden Paare wie casa und caza aus dem Kontext aufgelöst – klares Audio liefert das zuverlässigste Ergebnis.
Verwendet das Transkript die umgekehrten ¿ und ¡?
Ja, und es setzt sie dorthin, wo die Frage oder der Ausruf tatsächlich beginnt – im Spanischen häufig mitten im Satz statt am Anfang. Das Beispieltranskript oben zeigt ein ¿, das nach einem Komma innerhalb eines längeren Satzes geöffnet wird. Beim Korrekturlesen lohnt ein kurzer Blick darauf, denn ein fehlendes Eröffnungszeichen ist das sichtbarste Anzeichen für maschinell geschriebenes Spanisch.
Werden Akzente und der Buchstabe ñ korrekt geschrieben?
Ja. Der Akzent wird dort gesetzt, wo er hingehört – tú gegen tu, quién gegen quien, terminó gegen termino –, und ñ wird als eigener Buchstabe geschrieben statt zu n plattgedrückt. Das Transkript ist normaler spanischer Text, den Sie direkt in ein Dokument einfügen können.
Kommt das System mit dem Voseo zurecht – vos hablás, vos sos?
Ja. Voseo-Formen aus Argentinien, Uruguay, Paraguay, Mittelamerika und Teilen Kolumbiens werden so transkribiert, wie sie gesprochen wurden, und nicht in tú-Formen umgeschrieben. Sagt jemand vos tenés, dann steht das auch im Transkript.
Und das karibische Spanisch, in dem das Schluss-s verschwindet?
Es funktioniert – und ist die Variante, bei der die Aufnahmequalität am meisten zählt. Wird das silbenauslautende s behaucht oder weggelassen, fehlt die Pluralmarkierung im Klang, und die Engine rekonstruiert sie aus dem Kontext. Bei einer kubanischen, dominikanischen oder puerto-ricanischen Aufnahme sind los dos, las casas und ähnliche Wendungen deshalb die erste Stelle zum Prüfen.
Kann ich auch spanische Videos transkribieren, und welche Formate kann ich hochladen?
Videos: ja – MP4, MOV, MKV, AVI und WEBM funktionieren alle, und wir extrahieren das gesprochene Spanisch automatisch. Insgesamt werden zwanzig Formate unterstützt, darunter Audio wie MP3, WAV, M4A, OGG und FLAC.
Wie lange dauert die Transkription?
Die meisten Dateien sind je nach Länge der Aufnahme innerhalb weniger Minuten fertig. Das 45-Sekunden-Beispiel oben brauchte 24 Sekunden.
Weitere Sprachen

Andere Sprache transkribieren