Darmowa transkrypcja mowy na tekst — język japoński
Prześlij japońskie nagranie audio lub wideo i w kilka minut otrzymaj dokładny, edytowalny transkrypt — automatycznie, w przeglądarce i z darmowym startem.
Japońskim mówi około 125 milionów ludzi, niemal wyłącznie w Japonii, a język ten obsługuje jedną z największych na świecie gospodarek mediów, biznesu i badań. Wywiady, wykłady, posiedzenia zarządów i treści wideo po japońsku nagrywane są nieustannie, a większość z nich prędzej czy później musi stać się przeszukiwalnym tekstem.
Japoński wymaga też od silnika rozpoznawania mowy czegoś, czego nie wymaga prawie żaden inny język: zapisuje się go trzema systemami pisma naraz, przeplatanymi w obrębie jednego zdania. Kanji niosą wyrazy treściowe, hiragana — gramatykę i końcówki fleksyjne, a katakana — zapożyczenia, obce nazwy i onomatopeje. Wybór między nimi nie jest kwestią formatowania; on jest transkrypcją. Te same sylaby wypowiedziane jako „kami" to 紙 (papier), 神 (bóstwo) i 髪 (włosy): w powietrzu identyczne, na papierze trzy różne znaki, a o tym, który jest właściwy, decyduje wyłącznie otaczające zdanie. W próbce poniżej można to zobaczyć na żywo: ゴム, słowo oznaczające gumę, które japoński zapożyczył z niderlandzkiego, jest poprawnie zapisane katakaną, podczas gdy 西洋人 i 手拭 w tym samym fragmencie zapisano w kanji, a partykuły wokół nich w hiraganie.
Do tego pisany japoński nie stawia spacji między wyrazami. Silnik nie może po prostu zapisać dźwięków i zostawić reszty odstępom — musi zdecydować, gdzie kończy się każdy wyraz, bo nie ma żadnej widocznej granicy, na której mógłby się oprzeć. Interpunkcja też nie jest wypowiadana, więc 、 i 。 w transkrypcie są wywnioskowane z frazowania, a nie usłyszane. Mówiony japoński część pracy zrzuca na akcent toniczny: 箸 (pałeczki), 橋 (most) i 端 (skraj) to wszystko „hashi", a w mowie tokijskiej odróżnia je miejsce, w którym opada ton. Liczenie dokłada kolejną warstwę, bo japoński liczy rzeczy klasyfikatorem, który zmienia postać razem z liczbą: trzy przedmioty podłużne to 三本 (sanbon), ale sześć to już 六本 (roppon), rzeczy płaskie biorą 枚, a małe zwierzęta 匹.
Grzeczność jest tu kategorią gramatyczną, nie ozdobną. Przejście z mowy potocznej do keigo nie łagodzi czasownika, tylko go zastępuje: 見る staje się ご覧になる, gdy patrzy rozmówca, i 拝見する, gdy patrzy mówiący, a 言う przechodzi tak samo w おっしゃる albo 申す. Transkrypt, który się w tym pomyli, nie tylko dziwnie się czyta — przekłamuje rejestr społeczny wypowiedzi. Prześlij audio lub wideo, a silnik zapisze wypowiedziany japoński jako czysty, przeszukiwalny tekst z systemami pisma pomieszanymi tak, jak pomieszałby je japoński piszący. Działa w przeglądarce, nie wymaga instalacji, a pierwsze minuty są darmowe, bez zakładania konta.
Do czego transkrybuje się język japoński
Biznes i spotkania
Prowadź pisemne protokoły japońskich spotkań i rozmów, aby decyzje i ustalenia zostały utrwalone w tekście, który da się przeszukać.
Media i twórcy
Generuj japońskie napisy i notatki do odcinków bezpośrednio z audio Twojego wideo lub podcastu, w prawidłowych kanji i kanie.
Naukowcy i studenci
Przekształcaj japońskie wykłady i wywiady terenowe w przeszukiwalny tekst, który można cytować, przywoływać w przypisach i z którego można się uczyć.
Jak naprawdę wygląda japoński transkrypt
To prawdziwe, 45-sekundowe nagranie czytane przez człowieka, przepuszczone przez nasz silnik AI dokładnie tak, jak przepuścisz własny plik. Nic nie zostało potem poprawione. Włącz odtwarzanie i czytaj razem z lektorem.
silnik AI, 20 sekund przetwarzania
- 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
- 00:09女はことさら肉を隠しがちであった。
- 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
- 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
- 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、
Warto zwrócić uwagę: trzy systemy pisma są pomieszane tak, jak pomieszałby je japoński piszący, i nikt silnikowi tego nie kazał. ゴム — niderlandzkie zapożyczenie oznaczające gumę — stoi w katakanie, podczas gdy 西洋人, 手拭 i 日本人 w tym samym fragmencie są w kanji, a każda partykuła i każda końcówka czasownika siedzi w hiraganie. 一言二言 zapisano w kanji, a nie fonetycznie, a literackie 否や przetrwało nietknięte. Przecinki i kropki nigdy nie zostały wypowiedziane; zostały postawione na podstawie frazowania lektora i trafiają na granice zdań składowych, tam gdzie postawiłby je japoński redaktor.
Nie jest idealnie, a błędy są pouczające. Sōseki napisał 猿股一つ — obcokrajowiec stoi tam w samych kąpielówkach — a silnik usłyszał それまたひとつ, prawdziwie brzmiący ciąg kany, który nic tu nie znaczy. Wyliczenie barw 海老茶や紺や藍 wyszło jako 海茶や昆夜藍, ze znakami kanji dobranymi pod brzmienie, a nie pod sens. Tak w praktyce wygląda presja homofonów. A jest to staranne, wyraźnie artykułowane czytanie, blisko wykładu albo dyktowanej notatki. Wywiad w gwarnej izakai, gdzie trzy osoby mówią jedna przez drugą, nie wyjdzie tak czysto; nie wyjdzie tak w żadnym automatycznym systemie. Jakość nagrania pozostaje najważniejszym czynnikiem decydującym o wyniku.
Nagranie: część 2 powieści こころ (Kokoro) Natsume Sōsekiego, LibriVox (2014). Public Domain Mark 1.0. Fragment od 1:30 do 2:15.
Jak ConvertSpeech radzi sobie z mówionym japońskim
Standardowy japoński — hyōjungo, zbudowany na mowie Tokio — to język nagrań radiowo-telewizyjnych, biznesowych i akademickich, i właśnie do niego ConvertSpeech jest dostrojony. To także odmiana, której akcent toniczny silnik traktuje jako punkt odniesienia, a ma to znaczenie, bo w mowie to właśnie ton rozdziela kilka częstych par wyrazów, zanim kontekst zdąży się odezwać.
Kansai-ben, używany w okolicach Osaki, Kioto i Kobe, to najsilniejsza odmiana regionalna, jaką realnie możesz nagrać, i różni się nie tylko akcentem. Spójka orzeczeniowa brzmi や zamiast だ, przeczenia tworzy się przez -へん lub -ん zamiast -ない, a codzienne słowa są po prostu inne: おおきに na „dziękuję", あかん na „nic z tego", ちゃう na „nie o to chodzi". Wyraźna mowa z Kansai transkrybuje się użytecznie, ale licz się z tym, że silnik będzie miejscami ciążył ku formom standardowym — nagraniom mocno dialektalnym daj dokładniejszą korektę. Odmiany z Tōhoku i Kiusiu są od standardu jeszcze dalsze; im bardziej dialektalne nagranie, tym bardziej transkrypt czyta się jak standardowy japoński ubrany w regionalne słownictwo.
Grzeczność jest oddawana tak, jak została wypowiedziana, w obie strony. Mowa nasycona keigo — rozmowa z obsługą klienta, formalna prezentacja, wywiad z osobą wyższą rangą — daje いらっしゃいます, させていただきます i ございます dokładnie tak, jak padły, a swobodna rozmowa wśród znajomych daje formy proste i opuszczone partykuły dokładnie tak, jak padły. Silnik nie normalizuje jednego do drugiego, i o to właśnie chodzi: w japońskim poziom grzeczności jest częścią treści, a nie ustawieniem stylu. Trudność pojawia się tam, gdzie mają ją także ludzie — formy skromne i honoryfikatywne tego samego czasownika nie przypominają brzmieniem formy słownikowej, więc nietypowe keigo warto przy korekcie sprawdzić.
Wskazówki dla dokładnej transkrypcji japońskiego
- Nagrywaj dobrym mikrofonem i przy minimalnym hałasie w tle — jakość dźwięku to najważniejszy czynnik.
- Gdy wiesz, że nagranie jest po japońsku, ustaw język na japoński zamiast automatycznego wykrywania.
- Najlepiej transkrybuje się jeden mówca naraz; mocne nakładanie się głosów obniża dokładność.
- Przy wywiadach włącz rozpoznawanie mówców (darmowa funkcja dla zarejestrowanych), aby oznaczyć, kto co powiedział.
- Najpierw sprawdź nazwy własne. Japońskie imiona, nazwiska i nazwy miejscowe są najtrudniejszą rzeczą w każdym nagraniu, bo to samo odczytanie odpowiada kilku możliwym zestawom kanji — mężczyzna przedstawiony jako Hiroshi może być 博, 浩 albo 寛 — a samo brzmienie ich nie rozróżni.
- Potem przejrzyj słownictwo bogate w homofony. 機械 i 機会 to obie „kikai", 以外 i 意外 to obie „igai", 関心 i 感心 to obie „kanshin". Kanji wybiera wyłącznie kontekst, więc to w partiach technicznych i abstrakcyjnych najłatwiej ukryje się niewłaściwy znak.