Conversiones gratuitas restantes: 1

Voz a texto en japonés, gratis

Sube tu audio o vídeo en japonés y obtén en minutos una transcripción precisa y editable — automática, directamente en el navegador y gratis para empezar.

Suelta tu archivo en japonés aquí

O

Formatos admitidos: MP3, WAV, MP4, FLAC, WEBM, M4A, OGG, OPUS, AAC, AMR, AIFF, AIF, WMA, MOV, MKV, AVI, MPG, MPEG, 3GP, WMV

Tamaño máx. por subida: 95 MB

Prueba gratuita: transcribimos los primeros 3 minutos de tu archivo · Regístrate gratis para más

El japonés lo hablan unos 125 millones de personas, casi todas en Japón, y es el idioma de una de las mayores economías del mundo en medios, negocios e investigación. Constantemente se graban entrevistas, clases, reuniones de dirección y contenido en vídeo en japonés, y casi todo ello acaba necesitando convertirse en texto localizable.

El japonés además le pide a un motor de reconocimiento de voz algo que casi ningún otro idioma le pide: se escribe con tres sistemas a la vez, y van entrelazados dentro de una misma frase. Los kanji llevan las palabras de contenido, el hiragana la gramática y las flexiones, y el katakana los préstamos, los nombres extranjeros y las onomatopeyas. Elegir entre ellos no es una preferencia de formato: es la transcripción. Las mismas sílabas pronunciadas «kami» son 紙 para papel, 神 para dios y 髪 para cabello: idénticas en el aire, tres caracteres distintos sobre el papel, y solo la frase que las rodea decide cuál es la correcta. En el ejemplo de más abajo puedes verlo en directo: ゴム, la palabra para caucho que el japonés tomó del neerlandés, está correctamente escrita en katakana, mientras que 西洋人 y 手拭 en el mismo pasaje van en kanji y las partículas que los rodean en hiragana.

Además, el japonés escrito no pone espacios entre las palabras. Un motor no puede limitarse a anotar sonidos y dejar que el espaciado haga el resto: tiene que decidir dónde termina cada palabra, porque no hay ninguna frontera visible a la que recurrir. La puntuación tampoco se pronuncia, así que los 、 y 。 de una transcripción se deducen del fraseo en vez de oírse. El japonés hablado se apoya en el acento tonal para parte del trabajo: 箸 (palillos), 橋 (puente) y 端 (borde) son todos «hashi» y en el habla de Tokio se distinguen por dónde cae el tono. Contar añade otra capa, porque el japonés cuenta las cosas con un clasificador que cambia de forma según el número: tres objetos alargados son 三本 (sanbon) pero seis son 六本 (roppon), mientras que las cosas planas llevan 枚 y los animales pequeños 匹.

La cortesía es gramatical, no decorativa. Pasar del registro coloquial al keigo no suaviza un verbo: lo sustituye. 見る se convierte en ご覧になる cuando es el interlocutor quien mira y en 拝見する cuando es quien habla, y 言う pasa a おっしゃる o 申す de la misma manera. Una transcripción que se equivoque aquí no solo se lee rara: informa de un registro social equivocado. Sube tu audio o vídeo y el motor escribe el japonés hablado como texto limpio y localizable, con los tres sistemas de escritura mezclados como los mezclaría alguien que escribe en japonés. Funciona en tu navegador, no requiere instalación, y tus primeros minutos son gratis sin necesidad de crear una cuenta.

Casos de uso

Para qué se transcribe japonés

Empresas y reuniones

Conserva actas escritas de tus reuniones y llamadas en japonés para que las decisiones y tareas pendientes queden en un texto que puedes buscar.

Medios y creadores

Genera subtítulos y notas de episodio en japonés directamente a partir del audio de tu vídeo o pódcast, con kanji y kana correctos.

Investigadores y estudiantes

Transforma clases y entrevistas de campo en japonés en texto localizable que puedes citar y usar para estudiar.

Ejemplo real

Qué aspecto tiene de verdad una transcripción en japonés

Esta es una grabación real de 45 segundos de una persona leyendo en voz alta, procesada por nuestro motor de IA exactamente igual que procesarías tu propio archivo. Después no se corrigió nada. Dale al play y lee al mismo tiempo.

Motor de IA, 20 segundos de procesamiento

  1. 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
  2. 00:09女はことさら肉を隠しがちであった。
  3. 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
  4. 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
  5. 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、

Merece la pena fijarse: los tres sistemas de escritura se mezclan como los mezclaría alguien que escribe en japonés, sin que nadie se lo indique al motor. ゴム — el préstamo neerlandés para caucho — va en katakana, mientras que 西洋人, 手拭 y 日本人 en el mismo pasaje van en kanji y todas las partículas y desinencias verbales en hiragana. 一言二言 se escribe en kanji y no fonéticamente, y el literario 否や sobrevive intacto. Las comas y los puntos no se pronunciaron nunca: se colocaron a partir del fraseo de quien lee, y caen en los límites de oración donde los pondría un corrector japonés.

No es perfecto, y los errores son instructivos. Sōseki escribió 猿股一つ — el occidental está ahí de pie sin más que un bañador — y el motor oyó それまたひとつ, una cadena de kana que suena real pero no significa nada aquí. La lista de colores 海老茶や紺や藍 salió como 海茶や昆夜藍, con los kanji elegidos por sonido y no por sentido. Así es la presión de los homófonos en la práctica. Y esto es una lectura cuidada y bien articulada, parecida a una clase o a una nota dictada. Una entrevista en un izakaya ruidoso con tres personas hablando a la vez no saldrá así de limpia; ningún sistema automático lo consigue. La calidad de la grabación sigue siendo, con diferencia, el factor que más influye en el resultado.

Grabación: sección 2 de こころ (Kokoro), de Natsume Sōseki, LibriVox (2014). Public Domain Mark 1.0. Fragmento de 1:30 a 2:15.

Variantes y acentos

Cómo gestiona ConvertSpeech el japonés hablado

El japonés estándar — el hyōjungo, construido sobre el habla de Tokio — es el que usan los medios, las empresas y el ámbito académico, y ConvertSpeech está optimizado para él. Es además la variedad cuyo acento tonal el motor toma como referencia, algo que importa porque el tono es lo que separa varios pares de palabras frecuentes en el habla antes de que el contexto tenga ocasión de hacerlo.

El Kansai-ben, hablado en la zona de Osaka, Kioto y Kobe, es la variedad regional más marcada que probablemente grabes, y se diferencia en algo más que el acento. La cópula es や en vez de だ, la negación se forma con -へん o -ん en lugar de -ない, y palabras cotidianas son sencillamente distintas: おおきに para dar las gracias, あかん para decir que algo no vale, ちゃう para decir que no es eso. El Kansai hablado con claridad se transcribe de forma útil, pero cuenta con que el motor tienda a las formas estándar en algunos puntos, y revisa con más calma los audios muy dialectales. Las variedades de Tōhoku y Kyushu se alejan todavía más del estándar; cuanto más dialectal sea la grabación, más se leerá la transcripción como japonés estándar vestido con vocabulario regional.

La cortesía se trata tal como se pronuncia, en ambas direcciones. El habla cargada de keigo — una llamada de atención al cliente, una presentación formal, una entrevista con alguien de rango superior — produce いらっしゃいます, させていただきます y ございます tal como se dijeron, y el habla coloquial entre amigos produce formas llanas y partículas omitidas tal como se dijeron. El motor no normaliza una en la otra, que es justo lo que quieres: en japonés el nivel de cortesía forma parte del contenido, no es un ajuste de estilo. Donde sí sufre es en el mismo sitio donde sufren las personas: las formas honoríficas y humildes de un mismo verbo no se parecen en nada a la forma de diccionario, así que el keigo poco habitual merece un vistazo al revisar.

Consejos

Consejos para una transcripción precisa del japonés

FAQ

Voz a texto en japonés — preguntas

¿La conversión de voz a texto en japonés es realmente gratis?
Sí — puedes transcribir audio en japonés gratis y sin registrarte. Crea una cuenta gratuita si necesitas más tiempo de transcripción.
¿La transcripción sale en kanji y kana o en rōmaji?
En kanji y kana: japonés escrito normal, tal como se escribiría habitualmente lo que se dijo. Obtienes una mezcla de kanji, hiragana y katakana con puntuación japonesa, no una versión fonética romanizada. Si necesitas rōmaji, conviértelo después a partir del texto terminado.
¿Cómo decide el motor entre kanji, hiragana y katakana?
Por contexto, igual que quien escribe. Las palabras de contenido van en kanji, las desinencias gramaticales y las partículas en hiragana, y los préstamos, nombres extranjeros y onomatopeyas en katakana. En el ejemplo de arriba, la palabra de origen neerlandés ゴム está correctamente en katakana mientras que 西洋人, en la misma frase, va en kanji.
¿Qué pasa con homófonos como 機械 y 機会?
El motor elige el kanji que encaja con la frase que lo rodea. Funciona bien en el habla corriente, y es también el sitio donde más probablemente encuentres un error: la transcripción de ejemplo de esta página contiene exactamente un fallo de ese tipo, dejado a propósito. El vocabulario técnico denso en homófonos merece una pasada de corrección.
¿Reconoce el Kansai-ben y otras variedades regionales del japonés?
El Kansai-ben claro se transcribe de forma útil, aunque la transcripción puede tender a las formas estándar en algunos puntos. El japonés estándar da los resultados más fiables; cuanto más se aleje una grabación de él — un habla marcada de Tōhoku o de Kyushu, por ejemplo —, más revisión necesitará, y eso vale para cualquier sistema automático.
¿Reconoce el keigo además del habla coloquial?
Los dos, tal como se pronuncian. Las formas honoríficas y humildes como いらっしゃいます o 拝見する se transcriben tal cual, sin aplanarlas en formas llanas, y el habla coloquial se mantiene coloquial. Como en japonés la cortesía es gramatical, así se conserva intacto el registro del original.
¿Puedo transcribir vídeo en japonés y qué formatos puedo subir?
Sí al vídeo — MP4 y WEBM funcionan, y extraemos el japonés hablado automáticamente. Se admiten todos los formatos habituales, 20 en total: audio como MP3, WAV, M4A, OGG o FLAC, y vídeo como MP4, MOV, MKV, AVI o WEBM.
¿Cuánto tarda la transcripción?
La mayoría de los archivos están listos en un par de minutos, según la duración de la grabación. El ejemplo de 45 segundos de arriba tardó 20 segundos.
Otros idiomas

Transcribir otro idioma