残りの無料変換回数: 1

日本語の音声テキスト変換(無料)

日本語の音声や動画をアップロードするだけで、数分で正確かつ編集可能な文字起こしが完成します。完全自動・ブラウザ完結で、無料で始められます。

日本語 のファイルをここにドロップ

または

対応形式: MP3, WAV, MP4, FLAC, WEBM, M4A, OGG, OPUS, AAC, AMR, AIFF, AIF, WMA, MOV, MKV, AVI, MPG, MPEG, 3GP, WMV

アップロードあたりの最大ファイルサイズ: 95 MB

無料トライアル:ファイルの最初の3分を文字起こしします · 無料登録でさらに利用

日本語の話者はおよそ1億2,500万人で、そのほとんどが日本国内にいます。世界有数の規模を持つメディア・ビジネス・研究の経済がこの言語の上に成り立っており、日本語のインタビュー、講義、役員会議、動画コンテンツは絶え間なく録音され、その多くがいずれ検索可能なテキストになる必要に迫られます。

その日本語は、他の言語にはほとんど見られない要求を音声認識エンジンに突きつけます。3種類の文字が同時に使われ、しかも一つの文の中で入り混じるという点です。内容語は漢字が担い、文法や活用はひらがなが担い、外来語・外国の固有名詞・擬音語はカタカナが担います。どれを選ぶかは体裁の好みではなく、文字起こしそのものです。「かみ」と発音された同じ音は、紙にも神にも髪にもなります。空気中では同一、紙の上では3つの別の文字であり、どれが正しいかを決めるのは前後の文だけです。下のサンプルではそれが実際に起きています。オランダ語から入った「ゴム」は正しくカタカナで書かれ、同じ一節の「西洋人」や「手拭」は漢字、その周りの助詞はひらがなになっています。

さらに、書かれた日本語には語と語の間に空白がありません。エンジンは音を書き取って区切りは空白に任せる、という手が使えず、目に見える境界がない中で「どこで語が終わるか」を自分で判断しなければなりません。句読点も発音されないため、文字起こしの「、」や「。」は聞き取られたものではなく、話の区切り方から推測されたものです。話し言葉では高低アクセントが一部の役割を担います。箸・橋・端はいずれも「はし」で、東京の話し方ではピッチの下がる位置で区別されます。数え方も一つの層を加えます。日本語は助数詞で数え、その助数詞は数によって形を変えるからです。長いものが3つなら三本(さんぼん)ですが6つなら六本(ろっぽん)、平たいものは枚、小さな動物は匹となります。

敬語は装飾ではなく文法です。くだけた言い方から敬語に移ると、動詞は柔らかくなるのではなく置き換わります。「見る」は、相手が見るなら「ご覧になる」、自分が見るなら「拝見する」になり、「言う」も同じように「おっしゃる」か「申す」になります。ここを取り違えた文字起こしは、読みづらいというだけでなく、社会的な位相そのものを誤って伝えてしまいます。音声や動画をアップロードすれば、エンジンが話された日本語を、書き手が使い分けるのと同じように文字を混ぜながら、きれいで検索可能なテキストとして書き出します。ブラウザだけで動作し、インストール不要、最初の数分間はアカウントなしで無料で使えます。

活用例

日本語 の文字起こしの活用シーン

ビジネス・会議

日本語の会議や通話の議事録を文字で残し、決定事項やアクションアイテムを検索できるテキストとして記録できます。

メディア・クリエイター

動画やポッドキャストの音声から、漢字とかなを適切に使い分けた日本語の字幕やショーノートを直接生成できます。

研究者・学生

日本語の講義やフィールド調査のインタビューを、引用・出典明示・学習に使える検索可能なテキストに変換できます。

実際の例

日本語の文字起こしは実際にどう仕上がるのか

実際の人間の朗読を録音した45秒の音声を、皆さんがご自分のファイルを処理するのとまったく同じようにAIエンジンにかけた結果です。あとから手直しは一切していません。再生しながら読んでみてください。

AIエンジン、処理20秒

  1. 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
  2. 00:09女はことさら肉を隠しがちであった。
  3. 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
  4. 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
  5. 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、

注目したいのは、誰かが指示したわけでもないのに、3種類の文字が書き手と同じ配分で混ざっている点です。オランダ語由来の外来語「ゴム」はカタカナ、同じ一節の「西洋人」「手拭」「日本人」は漢字、助詞や活用語尾はすべてひらがなに収まっています。「一言二言」も表音的に開かずに漢字で書かれ、文語的な「否や」もそのまま生きています。読点や句点は一度も発音されていません。読み手の間の取り方から置かれたもので、日本語の編集者が入れるのと同じ節の切れ目に落ちています。

完璧ではありませんし、その誤りがまた示唆に富んでいます。漱石が書いたのは「猿股一つ」 — 西洋人は海水パンツ一枚で立っている — ですが、エンジンは「それまたひとつ」と聞き取りました。かなとしてはいかにもありそうでいて、ここでは何も意味しない並びです。色の列挙「海老茶や紺や藍」は「海茶や昆夜藍」となり、意味ではなく音で漢字が選ばれています。同音異義語の圧力が実際に働くと、こうなります。しかもこれは丁寧にはっきりと読み上げられた音声で、講義や口述メモに近い条件です。三人が同時に話す騒がしい居酒屋でのインタビューが、ここまできれいに仕上がることはありません。どんな自動システムでも同じです。結果を左右する最大の要因は、やはり録音の品質です。

録音:夏目漱石『こころ』第2節、LibriVox(2014年)。Public Domain Mark 1.0。1:30〜2:15の抜粋。

方言とアクセント

ConvertSpeechによる日本語音声の処理

放送・ビジネス・学術の録音が使うのは、東京の話し言葉を基礎とする標準語であり、ConvertSpeechはこれに最適化されています。エンジンが高低アクセントの基準として扱うのもこの変種です。これは実務上も意味を持ちます。話し言葉では、文脈が働き出す前にピッチが語のペアを分けている場面がいくつもあるからです。

録音で出会う可能性が最も高い強い地域変種は、大阪・京都・神戸を中心とする関西弁で、違いはアクセントだけにとどまりません。断定は「だ」ではなく「や」、否定は「ない」ではなく「へん」「ん」で作り、日常語そのものが別になります。おおきに、あかん、ちゃう、といった具合です。はっきりした関西弁は実用に足る精度で文字起こしできますが、ところどころで標準的な形に引き寄せられると考えてください。方言色の濃い音声は、校正を丁寧にお願いします。東北や九州の変種は標準からさらに離れます。録音が方言的であるほど、文字起こしは「地域語彙をまとった標準語」という姿に近づきます。

敬体・常体は、話されたとおり双方向に扱われます。敬語の多い話し方 — 顧客対応の通話、あらたまったプレゼン、目上の方へのインタビュー — では「いらっしゃいます」「させていただきます」「ございます」が言われたとおりに出力され、友人同士のくだけた話し方では、普通形も助詞の省略も言われたとおりに出力されます。エンジンはどちらか一方に均そうとはしません。日本語では丁寧さの度合いは内容の一部であって、書式の設定ではないからです。苦手なのは人間と同じ箇所です。同じ動詞の謙譲語・尊敬語は辞書形とまるで似ていないため、見慣れない敬語は校正時に一度目を通しておく価値があります。

ヒント

日本語を正確に文字起こしするコツ

FAQ

日本語 の音声文字起こし — よくある質問

日本語の文字起こしは本当に無料ですか?
はい。日本語の音声は登録不要で無料で文字起こしできます。もっと多くの文字起こし時間が必要な場合は、無料アカウントを作成してください。
文字起こしは漢字かなまじりですか、それともローマ字ですか?
漢字かなまじりです。その話し言葉が普通に書き取られるとおりの、通常の日本語表記になります。漢字・ひらがな・カタカナが混在し、日本語の句読点が付いた形で、音を写したローマ字版ではありません。ローマ字が必要な場合は、出来上がったテキストから後で変換してください。
漢字・ひらがな・カタカナの使い分けはどう決まりますか?
書き手と同じように、文脈から決まります。内容語は漢字、活用語尾や助詞はひらがな、外来語・外国の固有名詞・擬音語はカタカナです。上のサンプルでは、オランダ語由来の「ゴム」が正しくカタカナになり、同じ文の「西洋人」は漢字になっています。
機械と機会のような同音異義語はどうなりますか?
エンジンは前後の文に合う漢字を選びます。通常の話し言葉ではうまく働きますが、誤りが最も見つかりやすい箇所でもあります。このページのサンプルにも、まさにその種の取り違えが意図的に残してあります。同音異義語の密度が高い専門用語は、校正の一手間をかける価値があります。
関西弁など地域ごとの日本語にも対応していますか?
はっきりした関西弁は実用に足る精度で文字起こしできますが、ところどころ標準的な形に寄ることがあります。最も安定した結果が得られるのは標準的な日本語で、そこから離れるほど — たとえば強い東北弁や九州弁 — 校正の手間は増えます。これはどんな自動システムでも同じです。
敬語もくだけた話し方も扱えますか?
どちらも、話されたとおりに扱います。「いらっしゃいます」「拝見する」といった尊敬語・謙譲語は普通形に均されることなくそのまま書き出され、くだけた話し方はくだけたまま残ります。日本語では丁寧さが文法である以上、これによって原文の位相がそのまま保たれます。
日本語の動画も文字起こしできますか?また、どの形式をアップロードできますか?
動画も可能です。MP4やWEBMに対応し、話された日本語を自動で抽出します。一般的な形式はすべて対応しており、全部で20種類です。音声はMP3・WAV・M4A・OGG・FLACなど、動画はMP4・MOV・MKV・AVI・WEBMなどが使えます。
文字起こしにはどのくらい時間がかかりますか?
ほとんどのファイルは数分以内に完成します。所要時間は録音の長さによって変わります。上のサンプルは45秒の音声で20秒かかりました。
その他の言語

他の言語を文字起こし