Voz a texto en japonés, gratis
Sube tu audio o vídeo en japonés y obtén en minutos una transcripción precisa y editable — automática, directamente en el navegador y gratis para empezar.
El japonés lo hablan unos 125 millones de personas, casi todas en Japón, y es el idioma de una de las mayores economías del mundo en medios, negocios e investigación. Constantemente se graban entrevistas, clases, reuniones de dirección y contenido en vídeo en japonés, y casi todo ello acaba necesitando convertirse en texto localizable.
El japonés además le pide a un motor de reconocimiento de voz algo que casi ningún otro idioma le pide: se escribe con tres sistemas a la vez, y van entrelazados dentro de una misma frase. Los kanji llevan las palabras de contenido, el hiragana la gramática y las flexiones, y el katakana los préstamos, los nombres extranjeros y las onomatopeyas. Elegir entre ellos no es una preferencia de formato: es la transcripción. Las mismas sílabas pronunciadas «kami» son 紙 para papel, 神 para dios y 髪 para cabello: idénticas en el aire, tres caracteres distintos sobre el papel, y solo la frase que las rodea decide cuál es la correcta. En el ejemplo de más abajo puedes verlo en directo: ゴム, la palabra para caucho que el japonés tomó del neerlandés, está correctamente escrita en katakana, mientras que 西洋人 y 手拭 en el mismo pasaje van en kanji y las partículas que los rodean en hiragana.
Además, el japonés escrito no pone espacios entre las palabras. Un motor no puede limitarse a anotar sonidos y dejar que el espaciado haga el resto: tiene que decidir dónde termina cada palabra, porque no hay ninguna frontera visible a la que recurrir. La puntuación tampoco se pronuncia, así que los 、 y 。 de una transcripción se deducen del fraseo en vez de oírse. El japonés hablado se apoya en el acento tonal para parte del trabajo: 箸 (palillos), 橋 (puente) y 端 (borde) son todos «hashi» y en el habla de Tokio se distinguen por dónde cae el tono. Contar añade otra capa, porque el japonés cuenta las cosas con un clasificador que cambia de forma según el número: tres objetos alargados son 三本 (sanbon) pero seis son 六本 (roppon), mientras que las cosas planas llevan 枚 y los animales pequeños 匹.
La cortesía es gramatical, no decorativa. Pasar del registro coloquial al keigo no suaviza un verbo: lo sustituye. 見る se convierte en ご覧になる cuando es el interlocutor quien mira y en 拝見する cuando es quien habla, y 言う pasa a おっしゃる o 申す de la misma manera. Una transcripción que se equivoque aquí no solo se lee rara: informa de un registro social equivocado. Sube tu audio o vídeo y el motor escribe el japonés hablado como texto limpio y localizable, con los tres sistemas de escritura mezclados como los mezclaría alguien que escribe en japonés. Funciona en tu navegador, no requiere instalación, y tus primeros minutos son gratis sin necesidad de crear una cuenta.
Para qué se transcribe japonés
Empresas y reuniones
Conserva actas escritas de tus reuniones y llamadas en japonés para que las decisiones y tareas pendientes queden en un texto que puedes buscar.
Medios y creadores
Genera subtítulos y notas de episodio en japonés directamente a partir del audio de tu vídeo o pódcast, con kanji y kana correctos.
Investigadores y estudiantes
Transforma clases y entrevistas de campo en japonés en texto localizable que puedes citar y usar para estudiar.
Qué aspecto tiene de verdad una transcripción en japonés
Esta es una grabación real de 45 segundos de una persona leyendo en voz alta, procesada por nuestro motor de IA exactamente igual que procesarías tu propio archivo. Después no se corrigió nada. Dale al play y lee al mismo tiempo.
Motor de IA, 20 segundos de procesamiento
- 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
- 00:09女はことさら肉を隠しがちであった。
- 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
- 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
- 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、
Merece la pena fijarse: los tres sistemas de escritura se mezclan como los mezclaría alguien que escribe en japonés, sin que nadie se lo indique al motor. ゴム — el préstamo neerlandés para caucho — va en katakana, mientras que 西洋人, 手拭 y 日本人 en el mismo pasaje van en kanji y todas las partículas y desinencias verbales en hiragana. 一言二言 se escribe en kanji y no fonéticamente, y el literario 否や sobrevive intacto. Las comas y los puntos no se pronunciaron nunca: se colocaron a partir del fraseo de quien lee, y caen en los límites de oración donde los pondría un corrector japonés.
No es perfecto, y los errores son instructivos. Sōseki escribió 猿股一つ — el occidental está ahí de pie sin más que un bañador — y el motor oyó それまたひとつ, una cadena de kana que suena real pero no significa nada aquí. La lista de colores 海老茶や紺や藍 salió como 海茶や昆夜藍, con los kanji elegidos por sonido y no por sentido. Así es la presión de los homófonos en la práctica. Y esto es una lectura cuidada y bien articulada, parecida a una clase o a una nota dictada. Una entrevista en un izakaya ruidoso con tres personas hablando a la vez no saldrá así de limpia; ningún sistema automático lo consigue. La calidad de la grabación sigue siendo, con diferencia, el factor que más influye en el resultado.
Grabación: sección 2 de こころ (Kokoro), de Natsume Sōseki, LibriVox (2014). Public Domain Mark 1.0. Fragmento de 1:30 a 2:15.
Cómo gestiona ConvertSpeech el japonés hablado
El japonés estándar — el hyōjungo, construido sobre el habla de Tokio — es el que usan los medios, las empresas y el ámbito académico, y ConvertSpeech está optimizado para él. Es además la variedad cuyo acento tonal el motor toma como referencia, algo que importa porque el tono es lo que separa varios pares de palabras frecuentes en el habla antes de que el contexto tenga ocasión de hacerlo.
El Kansai-ben, hablado en la zona de Osaka, Kioto y Kobe, es la variedad regional más marcada que probablemente grabes, y se diferencia en algo más que el acento. La cópula es や en vez de だ, la negación se forma con -へん o -ん en lugar de -ない, y palabras cotidianas son sencillamente distintas: おおきに para dar las gracias, あかん para decir que algo no vale, ちゃう para decir que no es eso. El Kansai hablado con claridad se transcribe de forma útil, pero cuenta con que el motor tienda a las formas estándar en algunos puntos, y revisa con más calma los audios muy dialectales. Las variedades de Tōhoku y Kyushu se alejan todavía más del estándar; cuanto más dialectal sea la grabación, más se leerá la transcripción como japonés estándar vestido con vocabulario regional.
La cortesía se trata tal como se pronuncia, en ambas direcciones. El habla cargada de keigo — una llamada de atención al cliente, una presentación formal, una entrevista con alguien de rango superior — produce いらっしゃいます, させていただきます y ございます tal como se dijeron, y el habla coloquial entre amigos produce formas llanas y partículas omitidas tal como se dijeron. El motor no normaliza una en la otra, que es justo lo que quieres: en japonés el nivel de cortesía forma parte del contenido, no es un ajuste de estilo. Donde sí sufre es en el mismo sitio donde sufren las personas: las formas honoríficas y humildes de un mismo verbo no se parecen en nada a la forma de diccionario, así que el keigo poco habitual merece un vistazo al revisar.
Consejos para una transcripción precisa del japonés
- Graba con un buen micrófono y el mínimo ruido de fondo — la calidad del audio es el factor más determinante.
- Deja el idioma configurado en japonés en lugar de la detección automática cuando sepas que la grabación está en japonés.
- Un solo hablante a la vez se transcribe mejor; las voces muy solapadas reducen la precisión.
- En entrevistas, activa la detección de hablantes (función gratuita para usuarios registrados) para etiquetar quién dijo qué.
- Revisa primero los nombres. Los nombres propios y los topónimos japoneses son lo más difícil de cualquier grabación, porque una misma lectura corresponde a varios kanji posibles — alguien presentado como Hiroshi puede ser 博, 浩 o 寛 — y el sonido por sí solo no los distingue.
- Después repasa el vocabulario con muchos homófonos. 機械 y 機会 son las dos «kikai», 以外 y 意外 son las dos «igai», 関心 y 感心 son las dos «kanshin». Solo el contexto elige el kanji, así que los pasajes técnicos y abstractos son donde más fácilmente se esconde un carácter equivocado.