Fala para texto em japonês, grátis
Envie seu áudio ou vídeo em japonês e receba em minutos uma transcrição precisa e editável — automática, direto no navegador e grátis para começar.
O japonês é falado por cerca de 125 milhões de pessoas, quase todas no Japão, e sustenta uma das maiores economias de mídia, negócios e pesquisa do mundo. Entrevistas, aulas, reuniões de diretoria e conteúdo em vídeo em japonês são gravados o tempo todo, e a maior parte disso mais cedo ou mais tarde precisa virar texto pesquisável.
O japonês também exige de um mecanismo de reconhecimento de fala algo que quase nenhum outro idioma exige: ele é escrito em três sistemas ao mesmo tempo, entrelaçados dentro de uma mesma frase. Os kanji carregam as palavras de conteúdo, o hiragana carrega a gramática e as flexões, e o katakana carrega estrangeirismos, nomes estrangeiros e onomatopeias. Escolher entre eles não é uma preferência de formatação — é a própria transcrição. As mesmas sílabas ditas como "kami" são 紙 para papel, 神 para divindade e 髪 para cabelo: idênticas no ar, três caracteres diferentes na página, e só a frase ao redor decide qual é o certo. No exemplo abaixo dá para ver isso acontecendo: ゴム, a palavra para borracha que o japonês tomou emprestada do neerlandês, aparece corretamente em katakana, enquanto 西洋人 e 手拭, na mesma passagem, aparecem em kanji, e as partículas ao redor delas, em hiragana.
Além disso, o japonês escrito não coloca espaços entre as palavras. Um mecanismo não pode simplesmente anotar os sons e deixar o espaçamento resolver o resto — ele precisa decidir onde cada palavra termina, porque não há fronteira visível a que recorrer. A pontuação também não é falada, então o 、e o 。 de uma transcrição são inferidos do fraseado, não ouvidos. O japonês falado se apoia no acento tonal para parte do trabalho: 箸 (hashis), 橋 (ponte) e 端 (borda) são todos "hashi" e se distinguem, na fala de Tóquio, pelo lugar em que o tom cai. A contagem acrescenta mais uma camada, porque o japonês conta as coisas com um classificador que muda de forma conforme o número — três objetos longos são 三本 (sanbon), mas seis são 六本 (roppon), enquanto coisas planas levam 枚 e animais pequenos levam 匹.
A polidez é gramatical, não decorativa. Passar do registro casual para o keigo não suaviza um verbo: substitui-o. 見る vira ご覧になる quando quem olha é o interlocutor e 拝見する quando é quem fala, e 言う vira おっしゃる ou 申す pelo mesmo mecanismo. Uma transcrição que erra isso não fica só estranha — ela informa o registro social errado. Envie seu áudio ou vídeo e o mecanismo escreve o japonês falado como texto limpo e pesquisável, com os sistemas de escrita misturados como um autor japonês os misturaria. Funciona direto no navegador, sem instalar nada, e seus primeiros minutos são grátis, sem precisar de conta.
Para que as pessoas transcrevem japonês
Empresas e reuniões
Mantenha atas escritas de reuniões e chamadas em japonês para que decisões e pendências fiquem registradas em texto que você pode pesquisar.
Mídia e criadores
Gere legendas e show notes em japonês diretamente do áudio do seu vídeo ou podcast, em kanji e kana adequados.
Pesquisadores e estudantes
Converta aulas e entrevistas de campo em japonês em texto pesquisável que você pode citar, referenciar e usar nos estudos.
Como é, de fato, uma transcrição em japonês
Esta é uma gravação real de 45 segundos, com um leitor humano, processada pelo nosso mecanismo de IA exatamente como você processaria seu próprio arquivo. Nada foi corrigido depois. Aperte o play e acompanhe a leitura.
motor de IA, 20 segundos de processamento
- 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
- 00:09女はことさら肉を隠しがちであった。
- 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
- 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
- 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、
Vale reparar: os três sistemas de escrita aparecem misturados como um autor japonês os misturaria, sem que ninguém tenha instruído o mecanismo a fazer isso. ゴム — o empréstimo neerlandês para borracha — está em katakana, enquanto 西洋人, 手拭 e 日本人, na mesma passagem, estão em kanji, e cada partícula e desinência verbal fica em hiragana. 一言二言 aparece em kanji, e não soletrado foneticamente, e o literário 否や sobrevive intacto. As vírgulas e os pontos finais nunca foram falados; foram colocados a partir do fraseado do leitor e caem justamente nas fronteiras de oração em que um editor japonês os poria.
Não está perfeito, e os erros são instrutivos. Sōseki escreveu 猿股一つ — o ocidental está ali de sunga e mais nada — e o mecanismo ouviu それまたひとつ, uma sequência de kana que soa plausível mas não significa nada ali. A lista de cores 海老茶や紺や藍 saiu como 海茶や昆夜藍, com os kanji escolhidos pelo som e não pelo sentido. É assim que a pressão dos homófonos se manifesta na prática. E esta é uma leitura cuidadosa e bem articulada, próxima de uma aula ou de uma nota ditada. Uma entrevista barulhenta em um izakaya, com três pessoas falando por cima umas das outras, não sai tão limpa assim; nada automático sai. A qualidade da gravação continua sendo o maior fator isolado no resultado.
Gravação: seção 2 de こころ (Kokoro), de Natsume Sōseki, LibriVox (2014). Public Domain Mark 1.0. Trecho de 1:30 a 2:15.
Como o ConvertSpeech lida com o japonês falado
O japonês padrão — hyōjungo, construído sobre a fala de Tóquio — é o que as gravações de mídia, negócios e meio acadêmico usam, e o ConvertSpeech é otimizado para ele. É também a variedade cujo acento tonal o mecanismo trata como referência, o que importa porque é o tom que separa vários pares de palavras comuns na fala, antes mesmo de o contexto ter chance de fazê-lo.
O Kansai-ben, falado na região de Osaka, Quioto e Kobe, é a variedade regional mais forte que você provavelmente vai gravar, e ele difere em mais do que o sotaque. A cópula é や, e não だ; a negação se forma com -へん ou -ん em vez de -ない; e palavras do dia a dia são simplesmente outras: おおきに para obrigado, あかん para "não presta", ちゃう para "não é isso". Fala clara em Kansai-ben transcreve de forma útil, mas espere que o mecanismo puxe para as formas padrão em alguns pontos, e revise com mais atenção áudios muito dialetais. As variedades de Tōhoku e Kyushu ficam ainda mais distantes do padrão; quanto mais dialetal a gravação, mais a transcrição se lê como japonês padrão vestido de vocabulário regional.
A polidez é tratada como foi falada, nas duas direções. Fala carregada de keigo — uma ligação de atendimento ao cliente, uma apresentação formal, uma entrevista com alguém sênior — produz いらっしゃいます, させていただきます e ございます tal como foram ditos, e a fala casual entre amigos produz formas simples e partículas omitidas tal como foram ditas. O mecanismo não normaliza uma na outra, que é o comportamento desejável: em japonês, o nível de polidez faz parte do conteúdo, não é um ajuste de estilo. Onde ele tem dificuldade é no mesmo ponto em que humanos têm — as formas humildes e honoríficas de um mesmo verbo não se parecem em nada com a forma de dicionário, então keigo pouco usual merece uma olhada na revisão.
Dicas para uma transcrição precisa do japonês
- Grave com um bom microfone e com o mínimo de ruído de fundo — a qualidade do áudio é o fator mais importante de todos.
- Deixe o idioma definido como japonês em vez de detecção automática quando você já sabe que a gravação é em japonês.
- Uma pessoa falando por vez transcreve melhor; muitas falas sobrepostas reduzem a precisão.
- Em entrevistas, ative a detecção de falantes (recurso grátis para usuários cadastrados) para identificar quem disse o quê.
- Revise primeiro os nomes. Nomes de pessoas e lugares japoneses são a coisa mais difícil de qualquer gravação, porque a mesma leitura corresponde a vários kanji possíveis — alguém apresentado como Hiroshi pode ser 博, 浩 ou 寛 — e só o som não os distingue.
- Depois, examine o vocabulário rico em homófonos. 機械 e 機会 são ambos "kikai", 以外 e 意外 são ambos "igai", 関心 e 感心 são ambos "kanshin". Só o contexto escolhe o kanji, então é nas passagens técnicas e abstratas que um caractere errado tem mais chance de se esconder.