Freie Konvertierungen übrig: 1

Kostenlose Spracherkennung für Japanisch

Laden Sie Ihre japanische Audio- oder Videodatei hoch und erhalten Sie in wenigen Minuten ein präzises, bearbeitbares Transkript – automatisch, direkt im Browser und zum Einstieg kostenlos.

Japanisch-Datei hier ablegen

ODER

Unterstützte Formate: MP3, WAV, MP4, FLAC, WEBM, M4A, OGG, OPUS, AAC, AMR, AIFF, AIF, WMA, MOV, MKV, AVI, MPG, MPEG, 3GP, WMV

Max. Dateigröße pro Upload: 95 MB

Kostenlos testen: Wir transkribieren die ersten 3 Minuten deiner Datei · Registriere dich kostenlos für mehr

Japanisch wird von rund 125 Millionen Menschen gesprochen, fast ausschließlich in Japan, und trägt eine der größten Medien-, Wirtschafts- und Forschungslandschaften der Welt. Interviews, Vorlesungen, Vorstandssitzungen und Videoinhalte auf Japanisch werden ununterbrochen aufgezeichnet, und das meiste davon muss irgendwann durchsuchbarer Text werden.

Japanisch verlangt einer Spracherkennung außerdem etwas ab, das fast keine andere Sprache verlangt: Es wird in drei Schriften zugleich geschrieben, und die stehen innerhalb eines einzigen Satzes verschränkt nebeneinander. Kanji tragen die Inhaltswörter, Hiragana die Grammatik und die Flexion, Katakana die Lehnwörter, fremden Namen und Lautmalereien. Die Wahl zwischen ihnen ist keine Formatierungsfrage – sie ist die Transkription. Dieselben Silben, gesprochen als „kami", sind 紙 für Papier, 神 für einen Gott und 髪 für Haar: in der Luft identisch, auf dem Papier drei verschiedene Zeichen, und nur der umgebende Satz entscheidet, welches richtig ist. Im Beispiel unten können Sie dabei zusehen: ゴム, das aus dem Niederländischen entlehnte Wort für Gummi, steht korrekt in Katakana, während 西洋人 und 手拭 in derselben Passage in Kanji stehen und die Partikeln drumherum in Hiragana.

Dazu kommt: Geschriebenes Japanisch setzt keine Leerzeichen zwischen die Wörter. Eine Engine kann nicht einfach Laute notieren und den Rest den Leerzeichen überlassen – sie muss entscheiden, wo jedes Wort endet, weil es keine sichtbare Grenze gibt, auf die sie zurückfallen könnte. Auch Satzzeichen werden nicht gesprochen, die 、und 。 in einem Transkript werden also aus der Phrasierung erschlossen und nicht gehört. Gesprochenes Japanisch stützt sich für einen Teil der Arbeit auf den Tonhöhenakzent: 箸 (Essstäbchen), 橋 (Brücke) und 端 (Rand) heißen alle „hashi" und werden im Tokioter Japanisch daran unterschieden, wo die Tonhöhe fällt. Das Zählen legt eine weitere Schicht darauf, denn Japanisch zählt Dinge mit einem Zählwort, das seine Form mit der Zahl verändert: Drei lange Gegenstände sind 三本 (sanbon), sechs aber 六本 (roppon), während flache Dinge 枚 nehmen und kleine Tiere 匹.

Höflichkeit ist grammatisch und nicht dekorativ. Der Weg vom lockeren Ton zum Keigo mildert ein Verb nicht ab, er ersetzt es: 見る wird zu ご覧になる, wenn die angesprochene Person schaut, und zu 拝見する, wenn die sprechende Person schaut; 言う wird auf dieselbe Weise zu おっしゃる oder 申す. Ein Transkript, das das falsch macht, liest sich nicht nur schräg – es gibt das falsche soziale Register wieder. Laden Sie Ihre Audio- oder Videodatei hoch, und die Engine schreibt das gesprochene Japanisch als sauberen, durchsuchbaren Text nieder, mit denselben Schriftmischungen, die auch ein japanischer Schreiber verwenden würde. Alles läuft im Browser, ohne Installation, und die ersten Minuten sind kostenlos, ganz ohne Konto.

Anwendungsfälle

Wofür Japanisch transkribiert wird

Business und Meetings

Halten Sie japanische Meetings und Telefonate schriftlich fest, damit Entscheidungen und To-dos als durchsuchbarer Text vorliegen.

Medien und Creator

Erstellen Sie japanische Untertitel und Shownotes direkt aus dem Audio Ihres Videos oder Podcasts – in korrektem Kanji und Kana.

Forschende und Studierende

Wandeln Sie japanische Vorlesungen und Feldinterviews in durchsuchbaren Text um, den Sie zitieren, belegen und zum Lernen nutzen können.

Echtes Beispiel

So sieht ein japanisches Transkript wirklich aus

Dies ist eine echte 45-Sekunden-Aufnahme eines menschlichen Sprechers, durch unsere KI-Engine geschickt – genau so, wie Sie Ihre eigene Datei verarbeiten würden. Nichts wurde nachträglich korrigiert. Drücken Sie auf Play und lesen Sie mit.

KI-Engine, 20 Sekunden Verarbeitung

  1. 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
  2. 00:09女はことさら肉を隠しがちであった。
  3. 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
  4. 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
  5. 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、

Bemerkenswert: Die drei Schriften sind so gemischt, wie sie ein japanischer Schreiber mischen würde, ohne dass jemand der Engine das gesagt hätte. ゴム – das niederländische Lehnwort für Gummi – steht in Katakana, während 西洋人, 手拭 und 日本人 in derselben Passage in Kanji stehen und jede Partikel und jede Verbendung in Hiragana. 一言二言 ist in Kanji geschrieben statt lautlich ausbuchstabiert, und das literarische 否や bleibt unversehrt. Die Kommas und Punkte wurden nie gesprochen; sie wurden aus der Phrasierung des Vorlesers gesetzt und landen an den Satzgrenzen, an die sie auch ein japanischer Lektor setzen würde.

Perfekt ist es nicht, und die Fehler sind lehrreich. Sōseki schrieb 猿股一つ – der Westler steht dort in nichts als einer Badehose –, und die Engine hörte それまたひとつ, eine echt klingende Kana-Folge, die hier nichts bedeutet. Die Farbaufzählung 海老茶や紺や藍 kam als 海茶や昆夜藍 heraus, mit nach Klang statt nach Sinn gewählten Kanji. So sieht Homophon-Druck in der Praxis aus. Und dies ist sorgfältiges, klar artikuliertes Vorlesen, nah an einer Vorlesung oder einem Diktat. Ein Interview in einer lauten Izakaya, in dem drei Personen durcheinanderreden, wird nicht so sauber herauskommen; das schafft kein automatisches System. Die Aufnahmequalität bleibt der wichtigste Einzelfaktor für das Ergebnis.

Aufnahme: Abschnitt 2 von こころ (Kokoro) von Natsume Sōseki, LibriVox (2014). Public Domain Mark 1.0. Ausschnitt von 1:30 bis 2:15.

Varianten & Akzente

So verarbeitet ConvertSpeech gesprochenes Japanisch

Standardjapanisch – Hyōjungo, aufgebaut auf der Sprache Tokios – ist das, was Rundfunk-, Business- und Wissenschaftsaufnahmen verwenden, und genau darauf ist ConvertSpeech abgestimmt. Es ist zugleich die Varietät, deren Tonhöhenakzent die Engine als Referenz nimmt, und das ist wichtig, weil die Tonhöhe mehrere häufige Wortpaare schon im Klang trennt, bevor der Kontext überhaupt zum Zug kommt.

Das Kansai-ben rund um Osaka, Kyoto und Kobe ist die stärkste regionale Varietät, die Sie wahrscheinlich aufnehmen werden, und sie unterscheidet sich in mehr als nur im Akzent. Die Kopula lautet や statt だ, Verneinungen werden mit -へん oder -ん gebildet statt mit -ない, und Alltagswörter sind schlicht andere: おおきに für danke, あかん für „taugt nichts", ちゃう für „so ist es nicht". Klar gesprochenes Kansai-Japanisch wird brauchbar transkribiert, aber rechnen Sie damit, dass die Engine stellenweise zu Standardformen neigt, und lesen Sie dialektlastiges Audio genauer gegen. Tōhoku- und Kyushu-Varietäten liegen noch weiter vom Standard entfernt; je dialektaler die Aufnahme, desto mehr liest sich das Transkript wie Standardjapanisch im Regionalgewand.

Höflichkeit wird in beide Richtungen so wiedergegeben, wie sie gesprochen wurde. Keigo-lastige Sprache – ein Kundenservice-Anruf, eine formelle Präsentation, ein Interview mit einer ranghöheren Person – ergibt いらっしゃいます, させていただきます und ございます genau so, wie sie gesagt wurden, und lockere Sprache unter Freunden ergibt einfache Formen und ausgelassene Partikeln, ebenfalls so, wie sie gesagt wurden. Die Engine normalisiert das eine nicht zum anderen, und das ist auch das gewünschte Verhalten: Im Japanischen ist die Höflichkeitsstufe Teil des Inhalts und keine Stileinstellung. Schwer tut sie sich an derselben Stelle wie Menschen – bescheidene und ehrerbietige Formen desselben Verbs klingen völlig anders als die Wörterbuchform, weshalb ungewöhnliches Keigo beim Korrekturlesen einen Blick verdient.

Tipps

Tipps für eine präzise japanische Transkription

FAQ

Japanisch-Spracherkennung — Fragen

Ist die Spracherkennung für Japanisch wirklich kostenlos?
Ja – Sie können japanische Audiodateien kostenlos und ohne Anmeldung transkribieren. Wenn Sie mehr Transkriptionszeit benötigen, legen Sie einfach ein kostenloses Konto an.
Kommt das Transkript in Kanji und Kana oder in Romaji?
In Kanji und Kana – normales geschriebenes Japanisch, so wie man das Gesprochene üblicherweise notieren würde. Sie erhalten eine Mischung aus Kanji, Hiragana und Katakana mit japanischer Zeichensetzung, keine romanisierte Lautschriftfassung. Brauchen Sie Romaji, wandeln Sie den fertigen Text anschließend um.
Wie entscheidet die Engine zwischen Kanji, Hiragana und Katakana?
Aus dem Kontext, so wie es auch ein Schreiber tut. Inhaltswörter kommen in Kanji, grammatische Endungen und Partikeln in Hiragana, Lehnwörter, fremde Namen und Lautmalereien in Katakana. Im Beispiel oben steht das aus dem Niederländischen stammende Wort ゴム korrekt in Katakana, während 西洋人 im selben Satz in Kanji steht.
Was passiert mit Homophonen wie 機械 und 機会?
Die Engine wählt das Kanji, das zum umgebenden Satz passt. Das funktioniert in gewöhnlicher Sprache gut – und ist zugleich die wahrscheinlichste Fehlerstelle: Das Beispieltranskript auf dieser Seite enthält genau so einen Ausrutscher, absichtlich stehen gelassen. Homophondichter Fachwortschatz verdient einen Korrekturdurchgang.
Kommt das System mit Kansai-ben und anderem regionalem Japanisch zurecht?
Klar gesprochenes Kansai-ben wird brauchbar transkribiert, auch wenn das Transkript stellenweise zu Standardformen neigt. Standardjapanisch liefert die zuverlässigsten Ergebnisse; je weiter eine Aufnahme davon entfernt liegt – etwa bei ausgeprägtem Tōhoku- oder Kyushu-Japanisch –, desto mehr Korrekturlesen braucht sie, und das gilt für jedes automatische System.
Kommt es mit Keigo genauso zurecht wie mit Umgangssprache?
Mit beidem, so wie gesprochen. Ehrerbietige und bescheidene Formen wie いらっしゃいます oder 拝見する werden so transkribiert, wie sie gesagt wurden, und nicht zu einfachen Formen eingeebnet; lockere Sprache bleibt locker. Da Höflichkeit im Japanischen grammatisch ist, bleibt so das Register des Originals erhalten.
Kann ich auch japanische Videos transkribieren, und welche Formate kann ich hochladen?
Videos: ja – MP4 und WEBM funktionieren, und wir extrahieren das gesprochene Japanisch automatisch. Alle gängigen Formate werden unterstützt, 20 insgesamt: Audio wie MP3, WAV, M4A, OGG oder FLAC und Video wie MP4, MOV, MKV, AVI oder WEBM.
Wie lange dauert die Transkription?
Die meisten Dateien sind je nach Länge der Aufnahme innerhalb weniger Minuten fertig. Das 45-Sekunden-Beispiel oben brauchte 20 Sekunden.
Weitere Sprachen

Andere Sprache transkribieren