Kostenlose Spracherkennung für Japanisch
Laden Sie Ihre japanische Audio- oder Videodatei hoch und erhalten Sie in wenigen Minuten ein präzises, bearbeitbares Transkript – automatisch, direkt im Browser und zum Einstieg kostenlos.
Japanisch wird von rund 125 Millionen Menschen gesprochen, fast ausschließlich in Japan, und trägt eine der größten Medien-, Wirtschafts- und Forschungslandschaften der Welt. Interviews, Vorlesungen, Vorstandssitzungen und Videoinhalte auf Japanisch werden ununterbrochen aufgezeichnet, und das meiste davon muss irgendwann durchsuchbarer Text werden.
Japanisch verlangt einer Spracherkennung außerdem etwas ab, das fast keine andere Sprache verlangt: Es wird in drei Schriften zugleich geschrieben, und die stehen innerhalb eines einzigen Satzes verschränkt nebeneinander. Kanji tragen die Inhaltswörter, Hiragana die Grammatik und die Flexion, Katakana die Lehnwörter, fremden Namen und Lautmalereien. Die Wahl zwischen ihnen ist keine Formatierungsfrage – sie ist die Transkription. Dieselben Silben, gesprochen als „kami", sind 紙 für Papier, 神 für einen Gott und 髪 für Haar: in der Luft identisch, auf dem Papier drei verschiedene Zeichen, und nur der umgebende Satz entscheidet, welches richtig ist. Im Beispiel unten können Sie dabei zusehen: ゴム, das aus dem Niederländischen entlehnte Wort für Gummi, steht korrekt in Katakana, während 西洋人 und 手拭 in derselben Passage in Kanji stehen und die Partikeln drumherum in Hiragana.
Dazu kommt: Geschriebenes Japanisch setzt keine Leerzeichen zwischen die Wörter. Eine Engine kann nicht einfach Laute notieren und den Rest den Leerzeichen überlassen – sie muss entscheiden, wo jedes Wort endet, weil es keine sichtbare Grenze gibt, auf die sie zurückfallen könnte. Auch Satzzeichen werden nicht gesprochen, die 、und 。 in einem Transkript werden also aus der Phrasierung erschlossen und nicht gehört. Gesprochenes Japanisch stützt sich für einen Teil der Arbeit auf den Tonhöhenakzent: 箸 (Essstäbchen), 橋 (Brücke) und 端 (Rand) heißen alle „hashi" und werden im Tokioter Japanisch daran unterschieden, wo die Tonhöhe fällt. Das Zählen legt eine weitere Schicht darauf, denn Japanisch zählt Dinge mit einem Zählwort, das seine Form mit der Zahl verändert: Drei lange Gegenstände sind 三本 (sanbon), sechs aber 六本 (roppon), während flache Dinge 枚 nehmen und kleine Tiere 匹.
Höflichkeit ist grammatisch und nicht dekorativ. Der Weg vom lockeren Ton zum Keigo mildert ein Verb nicht ab, er ersetzt es: 見る wird zu ご覧になる, wenn die angesprochene Person schaut, und zu 拝見する, wenn die sprechende Person schaut; 言う wird auf dieselbe Weise zu おっしゃる oder 申す. Ein Transkript, das das falsch macht, liest sich nicht nur schräg – es gibt das falsche soziale Register wieder. Laden Sie Ihre Audio- oder Videodatei hoch, und die Engine schreibt das gesprochene Japanisch als sauberen, durchsuchbaren Text nieder, mit denselben Schriftmischungen, die auch ein japanischer Schreiber verwenden würde. Alles läuft im Browser, ohne Installation, und die ersten Minuten sind kostenlos, ganz ohne Konto.
Wofür Japanisch transkribiert wird
Business und Meetings
Halten Sie japanische Meetings und Telefonate schriftlich fest, damit Entscheidungen und To-dos als durchsuchbarer Text vorliegen.
Medien und Creator
Erstellen Sie japanische Untertitel und Shownotes direkt aus dem Audio Ihres Videos oder Podcasts – in korrektem Kanji und Kana.
Forschende und Studierende
Wandeln Sie japanische Vorlesungen und Feldinterviews in durchsuchbaren Text um, den Sie zitieren, belegen und zum Lernen nutzen können.
So sieht ein japanisches Transkript wirklich aus
Dies ist eine echte 45-Sekunden-Aufnahme eines menschlichen Sprechers, durch unsere KI-Engine geschickt – genau so, wie Sie Ihre eigene Datei verarbeiten würden. Nichts wurde nachträglich korrigiert. Drücken Sie auf Play und lesen Sie mit.
KI-Engine, 20 Sekunden Verarbeitung
- 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
- 00:09女はことさら肉を隠しがちであった。
- 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
- 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
- 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、
Bemerkenswert: Die drei Schriften sind so gemischt, wie sie ein japanischer Schreiber mischen würde, ohne dass jemand der Engine das gesagt hätte. ゴム – das niederländische Lehnwort für Gummi – steht in Katakana, während 西洋人, 手拭 und 日本人 in derselben Passage in Kanji stehen und jede Partikel und jede Verbendung in Hiragana. 一言二言 ist in Kanji geschrieben statt lautlich ausbuchstabiert, und das literarische 否や bleibt unversehrt. Die Kommas und Punkte wurden nie gesprochen; sie wurden aus der Phrasierung des Vorlesers gesetzt und landen an den Satzgrenzen, an die sie auch ein japanischer Lektor setzen würde.
Perfekt ist es nicht, und die Fehler sind lehrreich. Sōseki schrieb 猿股一つ – der Westler steht dort in nichts als einer Badehose –, und die Engine hörte それまたひとつ, eine echt klingende Kana-Folge, die hier nichts bedeutet. Die Farbaufzählung 海老茶や紺や藍 kam als 海茶や昆夜藍 heraus, mit nach Klang statt nach Sinn gewählten Kanji. So sieht Homophon-Druck in der Praxis aus. Und dies ist sorgfältiges, klar artikuliertes Vorlesen, nah an einer Vorlesung oder einem Diktat. Ein Interview in einer lauten Izakaya, in dem drei Personen durcheinanderreden, wird nicht so sauber herauskommen; das schafft kein automatisches System. Die Aufnahmequalität bleibt der wichtigste Einzelfaktor für das Ergebnis.
Aufnahme: Abschnitt 2 von こころ (Kokoro) von Natsume Sōseki, LibriVox (2014). Public Domain Mark 1.0. Ausschnitt von 1:30 bis 2:15.
So verarbeitet ConvertSpeech gesprochenes Japanisch
Standardjapanisch – Hyōjungo, aufgebaut auf der Sprache Tokios – ist das, was Rundfunk-, Business- und Wissenschaftsaufnahmen verwenden, und genau darauf ist ConvertSpeech abgestimmt. Es ist zugleich die Varietät, deren Tonhöhenakzent die Engine als Referenz nimmt, und das ist wichtig, weil die Tonhöhe mehrere häufige Wortpaare schon im Klang trennt, bevor der Kontext überhaupt zum Zug kommt.
Das Kansai-ben rund um Osaka, Kyoto und Kobe ist die stärkste regionale Varietät, die Sie wahrscheinlich aufnehmen werden, und sie unterscheidet sich in mehr als nur im Akzent. Die Kopula lautet や statt だ, Verneinungen werden mit -へん oder -ん gebildet statt mit -ない, und Alltagswörter sind schlicht andere: おおきに für danke, あかん für „taugt nichts", ちゃう für „so ist es nicht". Klar gesprochenes Kansai-Japanisch wird brauchbar transkribiert, aber rechnen Sie damit, dass die Engine stellenweise zu Standardformen neigt, und lesen Sie dialektlastiges Audio genauer gegen. Tōhoku- und Kyushu-Varietäten liegen noch weiter vom Standard entfernt; je dialektaler die Aufnahme, desto mehr liest sich das Transkript wie Standardjapanisch im Regionalgewand.
Höflichkeit wird in beide Richtungen so wiedergegeben, wie sie gesprochen wurde. Keigo-lastige Sprache – ein Kundenservice-Anruf, eine formelle Präsentation, ein Interview mit einer ranghöheren Person – ergibt いらっしゃいます, させていただきます und ございます genau so, wie sie gesagt wurden, und lockere Sprache unter Freunden ergibt einfache Formen und ausgelassene Partikeln, ebenfalls so, wie sie gesagt wurden. Die Engine normalisiert das eine nicht zum anderen, und das ist auch das gewünschte Verhalten: Im Japanischen ist die Höflichkeitsstufe Teil des Inhalts und keine Stileinstellung. Schwer tut sie sich an derselben Stelle wie Menschen – bescheidene und ehrerbietige Formen desselben Verbs klingen völlig anders als die Wörterbuchform, weshalb ungewöhnliches Keigo beim Korrekturlesen einen Blick verdient.
Tipps für eine präzise japanische Transkription
- Nehmen Sie mit einem guten Mikrofon und möglichst wenig Hintergrundgeräuschen auf – die Audioqualität ist der wichtigste Einzelfaktor.
- Stellen Sie die Sprache fest auf Japanisch statt auf automatische Erkennung, wenn Sie wissen, dass die Aufnahme japanisch ist.
- Am besten spricht immer nur eine Person; starkes Durcheinanderreden senkt die Genauigkeit.
- Aktivieren Sie bei Interviews die Sprechererkennung (kostenlose Funktion für registrierte Nutzer), damit gekennzeichnet wird, wer was gesagt hat.
- Lesen Sie zuerst die Namen gegen. Japanische Personen- und Ortsnamen sind das Schwierigste in jeder Aufnahme, weil dieselbe Lesung auf mehrere mögliche Kanji fällt – ein als Hiroshi vorgestellter Mann kann 博, 浩 oder 寛 sein – und der Klang allein sie nicht trennen kann.
- Nehmen Sie sich danach den homophonreichen Wortschatz vor. 機械 und 機会 sind beide „kikai", 以外 und 意外 beide „igai", 関心 und 感心 beide „kanshin". Nur der Kontext wählt das Kanji, weshalb sich ein falsches Zeichen am ehesten in fachlichen und abstrakten Passagen versteckt.