Transcription japonais audio en texte, gratuite
Importez votre audio ou votre vidéo en japonais et obtenez en quelques minutes une transcription précise et modifiable — automatique, directement dans votre navigateur et gratuite pour commencer.
Le japonais est parlé par environ 125 millions de personnes, presque toutes au Japon, et porte l'une des plus grandes économies mondiales des médias, des affaires et de la recherche. Interviews, cours, conseils d'administration et contenus vidéo en japonais sont enregistrés en permanence, et la plupart doivent tôt ou tard devenir du texte consultable.
Le japonais exige aussi d'un moteur de reconnaissance vocale quelque chose que presque aucune autre langue ne demande : il s'écrit dans trois systèmes à la fois, entrelacés au sein d'une même phrase. Les kanji portent les mots pleins, les hiragana la grammaire et les flexions, les katakana les emprunts, les noms étrangers et les onomatopées. Choisir entre eux n'est pas une question de mise en forme — c'est la transcription elle-même. Les mêmes syllabes prononcées « kami » s'écrivent 紙 pour le papier, 神 pour une divinité et 髪 pour les cheveux : identiques à l'oreille, trois caractères différents sur la page, et seule la phrase environnante décide lequel est le bon. Dans l'exemple ci-dessous, on voit la chose se produire : ゴム, le mot pour le caoutchouc que le japonais a emprunté au néerlandais, est correctement écrit en katakana, tandis que 西洋人 et 手拭, dans le même passage, sont en kanji et que les particules qui les entourent sont en hiragana.
À cela s'ajoute que le japonais écrit ne met aucun espace entre les mots. Un moteur ne peut pas se contenter de noter des sons en laissant l'espacement faire le reste : il doit décider où chaque mot s'achève, car il n'existe aucune frontière visible sur laquelle se rabattre. La ponctuation n'est pas prononcée non plus : les 、et 。 d'une transcription sont déduits du phrasé plutôt qu'entendus. Le japonais parlé s'appuie sur l'accent de hauteur pour une partie du travail : 箸 (les baguettes), 橋 (le pont) et 端 (le bord) se disent tous « hashi » et ne se distinguent, dans la langue de Tokyo, que par l'endroit où la hauteur retombe. Le comptage ajoute encore une couche, car le japonais compte les choses avec un spécificatif qui change de forme selon le nombre : trois objets longs se disent 三本 (sanbon) mais six 六本 (roppon), tandis que les objets plats prennent 枚 et les petits animaux 匹.
La politesse relève de la grammaire, non de l'ornement. Passer du registre familier au keigo n'adoucit pas un verbe, cela le remplace : 見る devient ご覧になる quand c'est l'interlocuteur qui regarde et 拝見する quand c'est le locuteur, et 言う devient おっしゃる ou 申す de la même façon. Une transcription qui se trompe là-dessus ne se lit pas seulement de travers — elle rapporte un registre social erroné. Importez votre audio ou votre vidéo : le moteur restitue le japonais parlé sous forme de texte propre et consultable, avec les trois écritures mêlées comme les mêlerait une personne qui écrit en japonais. Tout se passe dans votre navigateur, sans aucune installation, et vos premières minutes sont gratuites, sans même créer de compte.
Pourquoi transcrire japonais
Entreprises et réunions
Gardez des comptes rendus écrits de vos réunions et appels en japonais : décisions et points d'action sont consignés dans un texte que vous pouvez interroger.
Médias et créateurs
Générez sous-titres et notes d'épisode en japonais directement à partir de l'audio de vos vidéos ou podcasts, en kanji et en kana corrects.
Chercheurs et étudiants
Convertissez cours et entretiens de terrain en japonais en texte consultable, facile à citer, à référencer et à étudier.
À quoi ressemble vraiment une transcription en japonais
Voici un véritable enregistrement de 45 secondes, lu par une personne réelle et passé dans notre moteur IA exactement comme vous passeriez votre propre fichier. Rien n'a été corrigé après coup. Lancez la lecture et suivez le texte.
moteur IA, 20 secondes de traitement
- 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
- 00:09女はことさら肉を隠しがちであった。
- 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
- 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
- 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、
À remarquer : les trois écritures sont mêlées comme les mêlerait une personne écrivant en japonais, sans que personne n'ait eu à le demander au moteur. ゴム — l'emprunt néerlandais désignant le caoutchouc — est en katakana, tandis que 西洋人, 手拭 et 日本人, dans le même passage, sont en kanji et que chaque particule et chaque désinence verbale se trouve en hiragana. 一言二言 est écrit en kanji plutôt que transcrit phonétiquement, et le 否や littéraire est resté intact. Les virgules et les points n'ont jamais été prononcés : ils ont été placés d'après le phrasé du lecteur, et ils tombent aux frontières de propositions où un correcteur japonais les mettrait.
Ce n'est pas parfait, et les erreurs sont instructives. Sōseki avait écrit 猿股一つ — l'Occidental se tient là en simple caleçon de bain — et le moteur a entendu それまたひとつ, une suite de kana qui sonne vrai mais ne veut rien dire ici. L'énumération de couleurs 海老茶や紺や藍 est ressortie en 海茶や昆夜藍, avec des kanji choisis pour le son plutôt que pour le sens. Voilà à quoi ressemble concrètement la pression des homophones. Et il s'agit ici d'une lecture soignée et clairement articulée, proche d'un cours ou d'une note dictée. Une interview dans un izakaya bruyant, avec trois personnes qui se coupent la parole, ne ressortira pas aussi nette ; aucun système automatique n'y parviendra. La qualité de l'enregistrement reste de loin le facteur le plus déterminant.
Enregistrement : section 2 de こころ (Kokoro) de Natsume Sōseki, LibriVox (2014). Public Domain Mark 1.0. Extrait de 1:30 à 2:15.
Comment ConvertSpeech traite le japonais parlé
Le japonais standard — le hyōjungo, bâti sur la langue de Tokyo — est celui qu'emploient les enregistrements audiovisuels, professionnels et universitaires, et ConvertSpeech est optimisé pour lui. C'est aussi la variante dont le moteur prend l'accent de hauteur comme référence, ce qui compte, car c'est la hauteur qui sépare à l'oral plusieurs paires de mots courantes avant même que le contexte n'ait son mot à dire.
Le Kansai-ben, parlé autour d'Osaka, de Kyoto et de Kobe, est la variante régionale la plus marquée que vous ayez des chances d'enregistrer, et elle ne diffère pas seulement par l'accent. La copule est や et non だ, la négation se forme avec -へん ou -ん au lieu de -ない, et des mots du quotidien sont tout simplement différents : おおきに pour merci, あかん pour « ça ne va pas », ちゃう pour « ce n'est pas ça ». Un Kansai-ben clairement articulé se transcrit utilement, mais attendez-vous à ce que le moteur penche par endroits vers les formes standard, et relisez de plus près un audio fortement dialectal. Les parlers du Tōhoku et de Kyūshū s'écartent davantage encore de la norme ; plus un enregistrement est dialectal, plus la transcription se lit comme du japonais standard revêtu d'un vocabulaire régional.
La politesse est restituée telle qu'elle est prononcée, dans les deux sens. Une parole chargée de keigo — un appel au service client, une présentation formelle, un entretien avec une personne de rang supérieur — produit いらっしゃいます, させていただきます et ございます tels quels, et la conversation familière entre amis produit des formes neutres et des particules omises, également telles quelles. Le moteur ne normalise pas l'un vers l'autre, et c'est bien le comportement souhaitable : en japonais, le niveau de politesse fait partie du contenu, ce n'est pas un réglage de style. Là où il peine, c'est exactement là où les humains peinent aussi — les formes modestes et honorifiques d'un même verbe ne ressemblent en rien à la forme de dictionnaire, un keigo inhabituel mérite donc un coup d'œil à la relecture.
Conseils pour une transcription précise du japonais
- Enregistrez avec un bon micro et un minimum de bruit de fond — la qualité audio est de loin le facteur le plus déterminant.
- Laissez la langue réglée sur le japonais plutôt que sur la détection automatique lorsque vous savez que l'enregistrement est en japonais.
- Un seul intervenant à la fois donne les meilleurs résultats ; les chevauchements de voix réduisent la précision.
- Pour les interviews, activez la détection des intervenants (fonction gratuite avec un compte) afin d'attribuer chaque propos à son auteur.
- Relisez les noms en priorité. Les noms de personnes et de lieux japonais sont ce qu'il y a de plus difficile dans tout enregistrement, parce qu'une même lecture correspond à plusieurs kanji possibles — un homme présenté comme Hiroshi peut être 博, 浩 ou 寛 — et que le son seul ne permet pas de trancher.
- Passez ensuite en revue le vocabulaire riche en homophones. 機械 et 機会 se disent tous deux « kikai », 以外 et 意外 « igai », 関心 et 感心 « kanshin ». Seul le contexte choisit le kanji : c'est donc dans les passages techniques et abstraits qu'un mauvais caractère a le plus de chances de se cacher.