日本語の音声テキスト変換(無料)
日本語の音声や動画をアップロードするだけで、数分で正確かつ編集可能な文字起こしが完成します。完全自動・ブラウザ完結で、無料で始められます。
日本語の話者はおよそ1億2,500万人で、そのほとんどが日本国内にいます。世界有数の規模を持つメディア・ビジネス・研究の経済がこの言語の上に成り立っており、日本語のインタビュー、講義、役員会議、動画コンテンツは絶え間なく録音され、その多くがいずれ検索可能なテキストになる必要に迫られます。
その日本語は、他の言語にはほとんど見られない要求を音声認識エンジンに突きつけます。3種類の文字が同時に使われ、しかも一つの文の中で入り混じるという点です。内容語は漢字が担い、文法や活用はひらがなが担い、外来語・外国の固有名詞・擬音語はカタカナが担います。どれを選ぶかは体裁の好みではなく、文字起こしそのものです。「かみ」と発音された同じ音は、紙にも神にも髪にもなります。空気中では同一、紙の上では3つの別の文字であり、どれが正しいかを決めるのは前後の文だけです。下のサンプルではそれが実際に起きています。オランダ語から入った「ゴム」は正しくカタカナで書かれ、同じ一節の「西洋人」や「手拭」は漢字、その周りの助詞はひらがなになっています。
さらに、書かれた日本語には語と語の間に空白がありません。エンジンは音を書き取って区切りは空白に任せる、という手が使えず、目に見える境界がない中で「どこで語が終わるか」を自分で判断しなければなりません。句読点も発音されないため、文字起こしの「、」や「。」は聞き取られたものではなく、話の区切り方から推測されたものです。話し言葉では高低アクセントが一部の役割を担います。箸・橋・端はいずれも「はし」で、東京の話し方ではピッチの下がる位置で区別されます。数え方も一つの層を加えます。日本語は助数詞で数え、その助数詞は数によって形を変えるからです。長いものが3つなら三本(さんぼん)ですが6つなら六本(ろっぽん)、平たいものは枚、小さな動物は匹となります。
敬語は装飾ではなく文法です。くだけた言い方から敬語に移ると、動詞は柔らかくなるのではなく置き換わります。「見る」は、相手が見るなら「ご覧になる」、自分が見るなら「拝見する」になり、「言う」も同じように「おっしゃる」か「申す」になります。ここを取り違えた文字起こしは、読みづらいというだけでなく、社会的な位相そのものを誤って伝えてしまいます。音声や動画をアップロードすれば、エンジンが話された日本語を、書き手が使い分けるのと同じように文字を混ぜながら、きれいで検索可能なテキストとして書き出します。ブラウザだけで動作し、インストール不要、最初の数分間はアカウントなしで無料で使えます。
日本語 の文字起こしの活用シーン
ビジネス・会議
日本語の会議や通話の議事録を文字で残し、決定事項やアクションアイテムを検索できるテキストとして記録できます。
メディア・クリエイター
動画やポッドキャストの音声から、漢字とかなを適切に使い分けた日本語の字幕やショーノートを直接生成できます。
研究者・学生
日本語の講義やフィールド調査のインタビューを、引用・出典明示・学習に使える検索可能なテキストに変換できます。
日本語の文字起こしは実際にどう仕上がるのか
実際の人間の朗読を録音した45秒の音声を、皆さんがご自分のファイルを処理するのとまったく同じようにAIエンジンにかけた結果です。あとから手直しは一切していません。再生しながら読んでみてください。
AIエンジン、処理20秒
- 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
- 00:09女はことさら肉を隠しがちであった。
- 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
- 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
- 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、
注目したいのは、誰かが指示したわけでもないのに、3種類の文字が書き手と同じ配分で混ざっている点です。オランダ語由来の外来語「ゴム」はカタカナ、同じ一節の「西洋人」「手拭」「日本人」は漢字、助詞や活用語尾はすべてひらがなに収まっています。「一言二言」も表音的に開かずに漢字で書かれ、文語的な「否や」もそのまま生きています。読点や句点は一度も発音されていません。読み手の間の取り方から置かれたもので、日本語の編集者が入れるのと同じ節の切れ目に落ちています。
完璧ではありませんし、その誤りがまた示唆に富んでいます。漱石が書いたのは「猿股一つ」 — 西洋人は海水パンツ一枚で立っている — ですが、エンジンは「それまたひとつ」と聞き取りました。かなとしてはいかにもありそうでいて、ここでは何も意味しない並びです。色の列挙「海老茶や紺や藍」は「海茶や昆夜藍」となり、意味ではなく音で漢字が選ばれています。同音異義語の圧力が実際に働くと、こうなります。しかもこれは丁寧にはっきりと読み上げられた音声で、講義や口述メモに近い条件です。三人が同時に話す騒がしい居酒屋でのインタビューが、ここまできれいに仕上がることはありません。どんな自動システムでも同じです。結果を左右する最大の要因は、やはり録音の品質です。
録音:夏目漱石『こころ』第2節、LibriVox(2014年)。Public Domain Mark 1.0。1:30〜2:15の抜粋。
ConvertSpeechによる日本語音声の処理
放送・ビジネス・学術の録音が使うのは、東京の話し言葉を基礎とする標準語であり、ConvertSpeechはこれに最適化されています。エンジンが高低アクセントの基準として扱うのもこの変種です。これは実務上も意味を持ちます。話し言葉では、文脈が働き出す前にピッチが語のペアを分けている場面がいくつもあるからです。
録音で出会う可能性が最も高い強い地域変種は、大阪・京都・神戸を中心とする関西弁で、違いはアクセントだけにとどまりません。断定は「だ」ではなく「や」、否定は「ない」ではなく「へん」「ん」で作り、日常語そのものが別になります。おおきに、あかん、ちゃう、といった具合です。はっきりした関西弁は実用に足る精度で文字起こしできますが、ところどころで標準的な形に引き寄せられると考えてください。方言色の濃い音声は、校正を丁寧にお願いします。東北や九州の変種は標準からさらに離れます。録音が方言的であるほど、文字起こしは「地域語彙をまとった標準語」という姿に近づきます。
敬体・常体は、話されたとおり双方向に扱われます。敬語の多い話し方 — 顧客対応の通話、あらたまったプレゼン、目上の方へのインタビュー — では「いらっしゃいます」「させていただきます」「ございます」が言われたとおりに出力され、友人同士のくだけた話し方では、普通形も助詞の省略も言われたとおりに出力されます。エンジンはどちらか一方に均そうとはしません。日本語では丁寧さの度合いは内容の一部であって、書式の設定ではないからです。苦手なのは人間と同じ箇所です。同じ動詞の謙譲語・尊敬語は辞書形とまるで似ていないため、見慣れない敬語は校正時に一度目を通しておく価値があります。
日本語を正確に文字起こしするコツ
- 良いマイクを使い、背景ノイズを最小限に抑えて録音しましょう。音質こそが最大の決め手です。
- 録音が日本語だと分かっている場合は、自動検出ではなく言語を日本語に設定しておきましょう。
- 一度に一人ずつ話すのが最も正確です。声の重なりが多いと精度が下がります。
- インタビューでは話者識別(登録ユーザー向けの無料機能)を有効にして、誰が何を言ったかをラベル付けしましょう。
- まず名前から校正しましょう。人名・地名はどんな録音でも最も難しい部分です。同じ読みが複数の漢字に対応するからで、「ひろし」と名乗られた方が博なのか浩なのか寛なのか、音だけでは判別できません。
- 次に同音異義語の多い語彙を確認しましょう。機械と機会はどちらも「きかい」、以外と意外はどちらも「いがい」、関心と感心はどちらも「かんしん」です。漢字を選ぶのは文脈だけなので、専門的・抽象的な箇所こそ誤字が潜みやすくなります。