남은 무료 변환: 1

무료 일본어 음성 텍스트 변환

일본어 오디오나 비디오를 업로드하면 몇 분 안에 정확하고 편집 가능한 녹취록을 받을 수 있습니다 — 자동으로, 브라우저에서, 무료로 시작하세요.

여기에 일본어 파일을 끌어다 놓으세요

또는

지원 형식: MP3, WAV, MP4, FLAC, WEBM, M4A, OGG, OPUS, AAC, AMR, AIFF, AIF, WMA, MOV, MKV, AVI, MPG, MPEG, 3GP, WMV

업로드당 최대 파일 크기: 95 MB

무료 체험: 파일의 처음 3분을 변환해 드려요 · 무료 가입하고 더 이용하기

일본어는 약 1억 2,500만 명이 사용하며, 그 대부분이 일본에 있습니다. 세계 최대 규모에 속하는 미디어·비즈니스·연구 경제를 움직이는 언어이기도 하죠. 일본어 인터뷰, 강의, 이사회 회의, 영상 콘텐츠는 끊임없이 녹음되고, 그 대부분이 결국 검색 가능한 텍스트가 되어야 합니다.

일본어는 다른 어떤 언어도 거의 요구하지 않는 것을 음성 인식 엔진에 요구합니다. 세 가지 문자로 동시에 쓰이고, 그 문자들이 한 문장 안에서 서로 엮인다는 점입니다. 한자는 내용어를, 히라가나는 문법과 활용을, 가타카나는 외래어·외국 이름·의성의태어를 맡습니다. 이 셋 중 무엇을 고르느냐는 서식 취향의 문제가 아니라 전사 그 자체입니다. “かみ”로 발음되는 같은 음절이 종이는 紙, 신은 神, 머리카락은 髪입니다 — 공기 중에서는 똑같고 종이 위에서는 세 개의 다른 글자이며, 어느 쪽이 맞는지는 주변 문장만이 결정합니다. 아래 예시에서 그 과정을 직접 볼 수 있습니다. 일본어가 네덜란드어에서 들여온 고무를 뜻하는 단어 ゴム는 가타카나로 정확하게 적히고, 같은 대목의 西洋人과 手拭은 한자로, 그 주위의 조사는 히라가나로 적힙니다.

거기에 더해, 쓰인 일본어에는 단어 사이 띄어쓰기가 없습니다. 엔진은 소리를 그냥 받아 적고 나머지를 띄어쓰기에 맡길 수 없습니다 — 기댈 만한 눈에 보이는 경계가 없으므로 각 단어가 어디서 끝나는지를 스스로 정해야 합니다. 구두점도 발음되지 않기 때문에, 녹취록의 、와 。는 들은 것이 아니라 어조와 끊어 읽기에서 추론한 것입니다. 말로 하는 일본어는 일부를 고저 악센트에 기댑니다. 箸(젓가락), 橋(다리), 端(가장자리)은 모두 “hashi”이고, 도쿄 발화에서는 음높이가 어디서 떨어지느냐로 구별됩니다. 세는 방식이 층을 하나 더 얹습니다. 일본어는 사물을 셀 때 조수사를 쓰는데, 이 조수사가 숫자에 따라 모양을 바꿉니다. 긴 물건 세 개는 三本(さんぼん)이지만 여섯 개는 六本(ろっぽん)이고, 납작한 것은 枚, 작은 동물은 匹를 씁니다.

경어는 꾸밈이 아니라 문법입니다. 반말에서 케이고로 옮겨 가는 것은 동사를 부드럽게 만드는 일이 아니라 아예 갈아 끼우는 일입니다. 見る는 듣는 사람이 보는 경우 ご覧になる가 되고, 말하는 사람이 보는 경우 拝見する가 됩니다. 言う도 같은 방식으로 おっしゃる 또는 申す가 됩니다. 이걸 틀린 녹취록은 그저 어색하게 읽히는 데 그치지 않고, 잘못된 사회적 위계를 보고하게 됩니다. 오디오나 비디오를 업로드하면 엔진이 말한 일본어를, 일본어 필자가 섞어 쓰듯 세 문자를 섞어 깔끔하고 검색 가능한 텍스트로 옮겨 적습니다. 브라우저에서 작동해 설치가 필요 없으며, 처음 몇 분은 계정 없이 무료입니다.

활용 사례

일본어 음성 변환의 활용 분야

비즈니스와 회의

일본어 회의와 통화를 서면 회의록으로 남겨 결정 사항과 실행 항목을 검색 가능한 텍스트로 붙잡아 두세요.

미디어와 크리에이터

비디오나 팟캐스트 오디오에서 제대로 된 한자와 가나로 일본어 자막과 쇼 노트를 바로 만들어 내세요.

연구자와 학생

일본어 강의와 현장 인터뷰를 인용하고 출처를 밝히고 공부할 수 있는 검색 가능한 텍스트로 변환하세요.

실제 예시

일본어 녹취록은 실제로 이렇게 나옵니다

사람이 읽은 45초짜리 실제 녹음을, 여러분이 직접 파일을 올릴 때와 똑같이 저희 AI 엔진에 통과시킨 결과입니다. 이후에 손으로 고친 곳은 하나도 없습니다. 재생 버튼을 누르고 함께 읽어 보세요.

AI 엔진, 처리 20초

  1. 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
  2. 00:09女はことさら肉を隠しがちであった。
  3. 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
  4. 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
  5. 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、

눈여겨볼 점: 아무도 시키지 않았는데도 세 문자가 일본어 필자가 섞어 쓰는 방식 그대로 섞여 있습니다. 네덜란드어에서 온 고무를 뜻하는 ゴム는 가타카나로, 같은 대목의 西洋人, 手拭, 日本人은 한자로, 모든 조사와 활용 어미는 히라가나로 들어가 있습니다. 一言二言은 소리대로 풀어 쓰지 않고 한자로 적혔고, 문어적인 否や도 온전히 살아남았습니다. 쉼표와 마침표는 애초에 발음되지 않았습니다 — 낭독자의 끊어 읽기에서 찍힌 것이고, 일본어 편집자가 넣을 절 경계에 정확히 떨어졌습니다.

완벽하지는 않고, 그 실수들이 오히려 교훈적입니다. 소세키가 쓴 것은 猿股一つ — 그 서양인은 수영복 한 장만 걸치고 서 있습니다 — 인데, 엔진은 それまたひとつ로 들었습니다. 가나로는 그럴듯하지만 여기서는 아무 뜻도 없는 문자열이죠. 색깔을 늘어놓은 海老茶や紺や藍은 海茶や昆夜藍으로 나왔는데, 뜻이 아니라 소리에 맞춰 한자가 골라진 결과입니다. 동음이의어의 압력이 실제로 어떻게 작동하는지를 보여 주는 장면입니다. 그리고 이 녹음은 또박또박 정성 들여 읽은 것으로, 강의나 구술 메모에 가깝습니다. 세 사람이 동시에 떠드는 시끄러운 이자카야 인터뷰라면 이만큼 깨끗하게 나오지 않습니다 — 어떤 자동 시스템도 마찬가지죠. 결과를 좌우하는 가장 큰 요인은 여전히 녹음 품질입니다.

녹음: 나쓰메 소세키 『こころ』(마음) 2절, LibriVox(2014). Public Domain Mark 1.0. 1:30~2:15 구간 발췌.

방언과 억양

ConvertSpeech가 일본어 음성을 처리하는 방식

표준 일본어 — 도쿄 말을 바탕으로 한 효준고(標準語) — 는 방송, 비즈니스, 학술 녹음이 쓰는 형태이며, ConvertSpeech는 여기에 맞춰 튜닝되어 있습니다. 엔진이 기준으로 삼는 고저 악센트도 이 변이의 것입니다. 문맥이 개입하기 전에 음높이가 흔한 단어 짝들을 먼저 갈라놓기 때문에 이는 중요한 문제입니다.

오사카·교토·고베 일대에서 쓰이는 간사이벤은 여러분이 녹음하게 될 가장 강한 지역 변이이고, 억양 이상으로 다릅니다. 계사가 だ가 아니라 や이고, 부정은 -ない 대신 -へん이나 -ん으로 만들며, 일상 단어 자체가 다릅니다. 고맙다는 おおきに, 안 된다는 あかん, 그게 아니라는 ちゃう죠. 또렷한 간사이 발화는 쓸 만하게 전사되지만, 엔진이 군데군데 표준형 쪽으로 기울 수 있으니 방언이 짙은 오디오는 더 꼼꼼히 교정하세요. 도호쿠와 규슈 변이는 표준에서 한층 더 멀고, 녹음이 방언에 가까울수록 녹취록은 지역 어휘를 걸친 표준 일본어처럼 읽힙니다.

경어는 양방향 모두 말한 그대로 처리됩니다. 케이고가 많은 발화 — 고객 응대 통화, 격식 있는 발표, 윗사람과의 인터뷰 — 는 いらっしゃいます, させていただきます, ございます를 말한 그대로 내놓고, 친구들끼리의 편한 말투는 반말과 생략된 조사를 말한 그대로 내놓습니다. 엔진은 한쪽을 다른 쪽으로 정규화하지 않는데, 이것이 여러분이 원하는 동작입니다. 일본어에서 공손함의 수준은 스타일 설정이 아니라 내용의 일부이기 때문입니다. 엔진이 어려워하는 지점은 사람이 어려워하는 지점과 같습니다 — 같은 동사의 겸양어와 존경어는 사전형과 소리가 전혀 달라서, 흔치 않은 케이고는 교정할 때 한 번 눈여겨볼 만합니다.

팁

정확한 일본어 전사를 위한 팁

FAQ

일본어 음성-텍스트 변환 — 자주 묻는 질문

일본어 음성 텍스트 변환은 정말 무료인가요?
네 — 일본어 오디오를 가입 없이 무료로 전사할 수 있습니다. 전사 시간이 더 필요하면 무료 계정을 만드세요.
녹취록은 한자와 가나로 나오나요, 로마자로 나오나요?
한자와 가나로 나옵니다 — 그 발화를 보통 글로 적는 방식 그대로의 일본어 문장이죠. 로마자로 음을 옮긴 형태가 아니라 한자, 히라가나, 가타카나가 섞이고 일본어 구두점이 붙은 텍스트를 받습니다. 로마자가 필요하다면 완성된 텍스트에서 나중에 변환하시면 됩니다.
엔진은 한자, 히라가나, 가타카나를 어떻게 골라 쓰나요?
필자가 하는 것과 같은 방식으로, 문맥에서 고릅니다. 내용어는 한자로, 문법적 어미와 조사는 히라가나로, 외래어와 외국 이름, 의성의태어는 가타카나로 갑니다. 위 예시에서는 네덜란드어에서 온 ゴム가 가타카나로 정확히 나오고, 같은 문장의 西洋人은 한자로 나옵니다.
機械와 機会 같은 동음이의어는 어떻게 되나요?
엔진은 주변 문장에 맞는 한자를 고릅니다. 일상 발화에서는 잘 작동하지만, 동시에 실수를 찾을 가능성이 가장 높은 자리이기도 합니다 — 이 페이지의 예시 녹취록에도 바로 그런 실수가 일부러 그대로 남아 있습니다. 동음이의어가 빽빽한 전문 어휘는 교정을 한 번 거칠 만합니다.
간사이벤 같은 지역 일본어도 처리하나요?
또렷한 간사이벤은 쓸 만하게 전사되지만, 녹취록이 군데군데 표준형 쪽으로 기울 수 있습니다. 가장 안정적인 결과를 내는 것은 표준 일본어이고, 녹음이 표준에서 멀수록 — 예를 들어 강한 도호쿠나 규슈 발화 — 교정이 더 필요합니다. 이는 어떤 자동 시스템에서도 마찬가지입니다.
케이고와 반말을 모두 처리하나요?
둘 다, 말한 그대로 처리합니다. いらっしゃいます나 拝見する 같은 존경어·겸양어는 반말로 뭉개지 않고 말한 그대로 전사하고, 편한 말투는 편한 말투로 남습니다. 일본어에서 공손함은 문법이기 때문에, 이렇게 해야 원본의 어조가 그대로 보존됩니다.
일본어 비디오도 전사할 수 있나요? 어떤 형식을 업로드할 수 있나요?
비디오도 됩니다 — MP4와 WEBM이 가능하고, 말한 일본어를 자동으로 추출합니다. 일반적인 형식은 모두 지원되며 총 20가지입니다. 오디오는 MP3, WAV, M4A, OGG, FLAC 등, 비디오는 MP4, MOV, MKV, AVI, WEBM 등이 가능합니다.
전사에 시간이 얼마나 걸리나요?
대부분의 파일은 녹음 길이에 따라 몇 분 안에 완성됩니다. 위의 45초 예시는 20초가 걸렸습니다.
기타 언어

다른 언어 변환하기