무료 일본어 음성 텍스트 변환
일본어 오디오나 비디오를 업로드하면 몇 분 안에 정확하고 편집 가능한 녹취록을 받을 수 있습니다 — 자동으로, 브라우저에서, 무료로 시작하세요.
일본어는 약 1억 2,500만 명이 사용하며, 그 대부분이 일본에 있습니다. 세계 최대 규모에 속하는 미디어·비즈니스·연구 경제를 움직이는 언어이기도 하죠. 일본어 인터뷰, 강의, 이사회 회의, 영상 콘텐츠는 끊임없이 녹음되고, 그 대부분이 결국 검색 가능한 텍스트가 되어야 합니다.
일본어는 다른 어떤 언어도 거의 요구하지 않는 것을 음성 인식 엔진에 요구합니다. 세 가지 문자로 동시에 쓰이고, 그 문자들이 한 문장 안에서 서로 엮인다는 점입니다. 한자는 내용어를, 히라가나는 문법과 활용을, 가타카나는 외래어·외국 이름·의성의태어를 맡습니다. 이 셋 중 무엇을 고르느냐는 서식 취향의 문제가 아니라 전사 그 자체입니다. “かみ”로 발음되는 같은 음절이 종이는 紙, 신은 神, 머리카락은 髪입니다 — 공기 중에서는 똑같고 종이 위에서는 세 개의 다른 글자이며, 어느 쪽이 맞는지는 주변 문장만이 결정합니다. 아래 예시에서 그 과정을 직접 볼 수 있습니다. 일본어가 네덜란드어에서 들여온 고무를 뜻하는 단어 ゴム는 가타카나로 정확하게 적히고, 같은 대목의 西洋人과 手拭은 한자로, 그 주위의 조사는 히라가나로 적힙니다.
거기에 더해, 쓰인 일본어에는 단어 사이 띄어쓰기가 없습니다. 엔진은 소리를 그냥 받아 적고 나머지를 띄어쓰기에 맡길 수 없습니다 — 기댈 만한 눈에 보이는 경계가 없으므로 각 단어가 어디서 끝나는지를 스스로 정해야 합니다. 구두점도 발음되지 않기 때문에, 녹취록의 、와 。는 들은 것이 아니라 어조와 끊어 읽기에서 추론한 것입니다. 말로 하는 일본어는 일부를 고저 악센트에 기댑니다. 箸(젓가락), 橋(다리), 端(가장자리)은 모두 “hashi”이고, 도쿄 발화에서는 음높이가 어디서 떨어지느냐로 구별됩니다. 세는 방식이 층을 하나 더 얹습니다. 일본어는 사물을 셀 때 조수사를 쓰는데, 이 조수사가 숫자에 따라 모양을 바꿉니다. 긴 물건 세 개는 三本(さんぼん)이지만 여섯 개는 六本(ろっぽん)이고, 납작한 것은 枚, 작은 동물은 匹를 씁니다.
경어는 꾸밈이 아니라 문법입니다. 반말에서 케이고로 옮겨 가는 것은 동사를 부드럽게 만드는 일이 아니라 아예 갈아 끼우는 일입니다. 見る는 듣는 사람이 보는 경우 ご覧になる가 되고, 말하는 사람이 보는 경우 拝見する가 됩니다. 言う도 같은 방식으로 おっしゃる 또는 申す가 됩니다. 이걸 틀린 녹취록은 그저 어색하게 읽히는 데 그치지 않고, 잘못된 사회적 위계를 보고하게 됩니다. 오디오나 비디오를 업로드하면 엔진이 말한 일본어를, 일본어 필자가 섞어 쓰듯 세 문자를 섞어 깔끔하고 검색 가능한 텍스트로 옮겨 적습니다. 브라우저에서 작동해 설치가 필요 없으며, 처음 몇 분은 계정 없이 무료입니다.
일본어 음성 변환의 활용 분야
비즈니스와 회의
일본어 회의와 통화를 서면 회의록으로 남겨 결정 사항과 실행 항목을 검색 가능한 텍스트로 붙잡아 두세요.
미디어와 크리에이터
비디오나 팟캐스트 오디오에서 제대로 된 한자와 가나로 일본어 자막과 쇼 노트를 바로 만들어 내세요.
연구자와 학생
일본어 강의와 현장 인터뷰를 인용하고 출처를 밝히고 공부할 수 있는 검색 가능한 텍스트로 변환하세요.
일본어 녹취록은 실제로 이렇게 나옵니다
사람이 읽은 45초짜리 실제 녹음을, 여러분이 직접 파일을 올릴 때와 똑같이 저희 AI 엔진에 통과시킨 결과입니다. 이후에 손으로 고친 곳은 하나도 없습니다. 재생 버튼을 누르고 함께 읽어 보세요.
AI 엔진, 처리 20초
- 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
- 00:09女はことさら肉を隠しがちであった。
- 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
- 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
- 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、
눈여겨볼 점: 아무도 시키지 않았는데도 세 문자가 일본어 필자가 섞어 쓰는 방식 그대로 섞여 있습니다. 네덜란드어에서 온 고무를 뜻하는 ゴム는 가타카나로, 같은 대목의 西洋人, 手拭, 日本人은 한자로, 모든 조사와 활용 어미는 히라가나로 들어가 있습니다. 一言二言은 소리대로 풀어 쓰지 않고 한자로 적혔고, 문어적인 否や도 온전히 살아남았습니다. 쉼표와 마침표는 애초에 발음되지 않았습니다 — 낭독자의 끊어 읽기에서 찍힌 것이고, 일본어 편집자가 넣을 절 경계에 정확히 떨어졌습니다.
완벽하지는 않고, 그 실수들이 오히려 교훈적입니다. 소세키가 쓴 것은 猿股一つ — 그 서양인은 수영복 한 장만 걸치고 서 있습니다 — 인데, 엔진은 それまたひとつ로 들었습니다. 가나로는 그럴듯하지만 여기서는 아무 뜻도 없는 문자열이죠. 색깔을 늘어놓은 海老茶や紺や藍은 海茶や昆夜藍으로 나왔는데, 뜻이 아니라 소리에 맞춰 한자가 골라진 결과입니다. 동음이의어의 압력이 실제로 어떻게 작동하는지를 보여 주는 장면입니다. 그리고 이 녹음은 또박또박 정성 들여 읽은 것으로, 강의나 구술 메모에 가깝습니다. 세 사람이 동시에 떠드는 시끄러운 이자카야 인터뷰라면 이만큼 깨끗하게 나오지 않습니다 — 어떤 자동 시스템도 마찬가지죠. 결과를 좌우하는 가장 큰 요인은 여전히 녹음 품질입니다.
녹음: 나쓰메 소세키 『こころ』(마음) 2절, LibriVox(2014). Public Domain Mark 1.0. 1:30~2:15 구간 발췌.
ConvertSpeech가 일본어 음성을 처리하는 방식
표준 일본어 — 도쿄 말을 바탕으로 한 효준고(標準語) — 는 방송, 비즈니스, 학술 녹음이 쓰는 형태이며, ConvertSpeech는 여기에 맞춰 튜닝되어 있습니다. 엔진이 기준으로 삼는 고저 악센트도 이 변이의 것입니다. 문맥이 개입하기 전에 음높이가 흔한 단어 짝들을 먼저 갈라놓기 때문에 이는 중요한 문제입니다.
오사카·교토·고베 일대에서 쓰이는 간사이벤은 여러분이 녹음하게 될 가장 강한 지역 변이이고, 억양 이상으로 다릅니다. 계사가 だ가 아니라 や이고, 부정은 -ない 대신 -へん이나 -ん으로 만들며, 일상 단어 자체가 다릅니다. 고맙다는 おおきに, 안 된다는 あかん, 그게 아니라는 ちゃう죠. 또렷한 간사이 발화는 쓸 만하게 전사되지만, 엔진이 군데군데 표준형 쪽으로 기울 수 있으니 방언이 짙은 오디오는 더 꼼꼼히 교정하세요. 도호쿠와 규슈 변이는 표준에서 한층 더 멀고, 녹음이 방언에 가까울수록 녹취록은 지역 어휘를 걸친 표준 일본어처럼 읽힙니다.
경어는 양방향 모두 말한 그대로 처리됩니다. 케이고가 많은 발화 — 고객 응대 통화, 격식 있는 발표, 윗사람과의 인터뷰 — 는 いらっしゃいます, させていただきます, ございます를 말한 그대로 내놓고, 친구들끼리의 편한 말투는 반말과 생략된 조사를 말한 그대로 내놓습니다. 엔진은 한쪽을 다른 쪽으로 정규화하지 않는데, 이것이 여러분이 원하는 동작입니다. 일본어에서 공손함의 수준은 스타일 설정이 아니라 내용의 일부이기 때문입니다. 엔진이 어려워하는 지점은 사람이 어려워하는 지점과 같습니다 — 같은 동사의 겸양어와 존경어는 사전형과 소리가 전혀 달라서, 흔치 않은 케이고는 교정할 때 한 번 눈여겨볼 만합니다.
정확한 일본어 전사를 위한 팁
- 좋은 마이크로, 배경 소음을 최소화해 녹음하세요 — 오디오 품질이 가장 큰 요인입니다.
- 녹음이 일본어인 것을 알고 있다면 자동 감지 대신 언어를 일본어로 지정해 두세요.
- 한 번에 한 사람씩 말할 때 가장 잘 전사됩니다. 말이 심하게 겹치면 정확도가 떨어집니다.
- 인터뷰라면 화자 구분 기능(가입 시 무료 제공)을 켜서 누가 무슨 말을 했는지 표시하세요.
- 이름부터 교정하세요. 일본어 인명과 지명은 어떤 녹음에서든 가장 어려운 부분입니다. 같은 읽기가 여러 한자에 대응하기 때문이죠 — Hiroshi라고 소개받은 사람이 博일 수도, 浩일 수도, 寛일 수도 있고, 소리만으로는 구별할 수 없습니다.
- 그다음에는 동음이의어가 많은 어휘를 훑으세요. 機械와 機会는 둘 다 “kikai”, 以外와 意外는 둘 다 “igai”, 関心과 感心은 둘 다 “kanshin”입니다. 한자를 고르는 것은 문맥뿐이므로, 전문적이거나 추상적인 대목이 잘못된 글자가 숨어 있기 가장 쉬운 자리입니다.