Conversões gratuitas restantes: 1

Fala para texto em japonês, grátis

Envie seu áudio ou vídeo em japonês e receba em minutos uma transcrição precisa e editável — automática, direto no navegador e grátis para começar.

Solte seu arquivo em japonês aqui

OU

Formatos suportados: MP3, WAV, MP4, FLAC, WEBM, M4A, OGG, OPUS, AAC, AMR, AIFF, AIF, WMA, MOV, MKV, AVI, MPG, MPEG, 3GP, WMV

Tamanho máx. por envio: 95 MB

Teste gratuito: transcrevemos os primeiros 3 minutos do seu arquivo · Registre-se grátis para mais

O japonês é falado por cerca de 125 milhões de pessoas, quase todas no Japão, e sustenta uma das maiores economias de mídia, negócios e pesquisa do mundo. Entrevistas, aulas, reuniões de diretoria e conteúdo em vídeo em japonês são gravados o tempo todo, e a maior parte disso mais cedo ou mais tarde precisa virar texto pesquisável.

O japonês também exige de um mecanismo de reconhecimento de fala algo que quase nenhum outro idioma exige: ele é escrito em três sistemas ao mesmo tempo, entrelaçados dentro de uma mesma frase. Os kanji carregam as palavras de conteúdo, o hiragana carrega a gramática e as flexões, e o katakana carrega estrangeirismos, nomes estrangeiros e onomatopeias. Escolher entre eles não é uma preferência de formatação — é a própria transcrição. As mesmas sílabas ditas como "kami" são 紙 para papel, 神 para divindade e 髪 para cabelo: idênticas no ar, três caracteres diferentes na página, e só a frase ao redor decide qual é o certo. No exemplo abaixo dá para ver isso acontecendo: ゴム, a palavra para borracha que o japonês tomou emprestada do neerlandês, aparece corretamente em katakana, enquanto 西洋人 e 手拭, na mesma passagem, aparecem em kanji, e as partículas ao redor delas, em hiragana.

Além disso, o japonês escrito não coloca espaços entre as palavras. Um mecanismo não pode simplesmente anotar os sons e deixar o espaçamento resolver o resto — ele precisa decidir onde cada palavra termina, porque não há fronteira visível a que recorrer. A pontuação também não é falada, então o 、e o 。 de uma transcrição são inferidos do fraseado, não ouvidos. O japonês falado se apoia no acento tonal para parte do trabalho: 箸 (hashis), 橋 (ponte) e 端 (borda) são todos "hashi" e se distinguem, na fala de Tóquio, pelo lugar em que o tom cai. A contagem acrescenta mais uma camada, porque o japonês conta as coisas com um classificador que muda de forma conforme o número — três objetos longos são 三本 (sanbon), mas seis são 六本 (roppon), enquanto coisas planas levam 枚 e animais pequenos levam 匹.

A polidez é gramatical, não decorativa. Passar do registro casual para o keigo não suaviza um verbo: substitui-o. 見る vira ご覧になる quando quem olha é o interlocutor e 拝見する quando é quem fala, e 言う vira おっしゃる ou 申す pelo mesmo mecanismo. Uma transcrição que erra isso não fica só estranha — ela informa o registro social errado. Envie seu áudio ou vídeo e o mecanismo escreve o japonês falado como texto limpo e pesquisável, com os sistemas de escrita misturados como um autor japonês os misturaria. Funciona direto no navegador, sem instalar nada, e seus primeiros minutos são grátis, sem precisar de conta.

Casos de uso

Para que as pessoas transcrevem japonês

Empresas e reuniões

Mantenha atas escritas de reuniões e chamadas em japonês para que decisões e pendências fiquem registradas em texto que você pode pesquisar.

Mídia e criadores

Gere legendas e show notes em japonês diretamente do áudio do seu vídeo ou podcast, em kanji e kana adequados.

Pesquisadores e estudantes

Converta aulas e entrevistas de campo em japonês em texto pesquisável que você pode citar, referenciar e usar nos estudos.

Exemplo real

Como é, de fato, uma transcrição em japonês

Esta é uma gravação real de 45 segundos, com um leitor humano, processada pelo nosso mecanismo de IA exatamente como você processaria seu próprio arquivo. Nada foi corrigido depois. Aperte o play e acompanhe a leitura.

motor de IA, 20 segundos de processamento

  1. 00:00私のじっとしている間にだいぶ多くの男が塩を浴びに出て来たが、いずれも胴と腕と股は出していなかった。
  2. 00:09女はことさら肉を隠しがちであった。
  3. 00:13大抵は頭にゴム線のずきんをかぶって海茶や昆夜藍の色を波間に浮していた。
  4. 00:20そういうあり様を目撃したばかりの私の目には――それまたひとつで済まして、みんなの前に立っているこの西洋人がいかにも珍しく見えた。
  5. 00:31彼はやがて自分の脇をかえりみて、そこに転んでいる日本人に一言二言何か言った。その日本人は砂の上に落ちた手拭を拾い上げているところであったがそれを取り上げるや否や腰に牽いて、

Vale reparar: os três sistemas de escrita aparecem misturados como um autor japonês os misturaria, sem que ninguém tenha instruído o mecanismo a fazer isso. ゴム — o empréstimo neerlandês para borracha — está em katakana, enquanto 西洋人, 手拭 e 日本人, na mesma passagem, estão em kanji, e cada partícula e desinência verbal fica em hiragana. 一言二言 aparece em kanji, e não soletrado foneticamente, e o literário 否や sobrevive intacto. As vírgulas e os pontos finais nunca foram falados; foram colocados a partir do fraseado do leitor e caem justamente nas fronteiras de oração em que um editor japonês os poria.

Não está perfeito, e os erros são instrutivos. Sōseki escreveu 猿股一つ — o ocidental está ali de sunga e mais nada — e o mecanismo ouviu それまたひとつ, uma sequência de kana que soa plausível mas não significa nada ali. A lista de cores 海老茶や紺や藍 saiu como 海茶や昆夜藍, com os kanji escolhidos pelo som e não pelo sentido. É assim que a pressão dos homófonos se manifesta na prática. E esta é uma leitura cuidadosa e bem articulada, próxima de uma aula ou de uma nota ditada. Uma entrevista barulhenta em um izakaya, com três pessoas falando por cima umas das outras, não sai tão limpa assim; nada automático sai. A qualidade da gravação continua sendo o maior fator isolado no resultado.

Gravação: seção 2 de こころ (Kokoro), de Natsume Sōseki, LibriVox (2014). Public Domain Mark 1.0. Trecho de 1:30 a 2:15.

Variantes e sotaques

Como o ConvertSpeech lida com o japonês falado

O japonês padrão — hyōjungo, construído sobre a fala de Tóquio — é o que as gravações de mídia, negócios e meio acadêmico usam, e o ConvertSpeech é otimizado para ele. É também a variedade cujo acento tonal o mecanismo trata como referência, o que importa porque é o tom que separa vários pares de palavras comuns na fala, antes mesmo de o contexto ter chance de fazê-lo.

O Kansai-ben, falado na região de Osaka, Quioto e Kobe, é a variedade regional mais forte que você provavelmente vai gravar, e ele difere em mais do que o sotaque. A cópula é や, e não だ; a negação se forma com -へん ou -ん em vez de -ない; e palavras do dia a dia são simplesmente outras: おおきに para obrigado, あかん para "não presta", ちゃう para "não é isso". Fala clara em Kansai-ben transcreve de forma útil, mas espere que o mecanismo puxe para as formas padrão em alguns pontos, e revise com mais atenção áudios muito dialetais. As variedades de Tōhoku e Kyushu ficam ainda mais distantes do padrão; quanto mais dialetal a gravação, mais a transcrição se lê como japonês padrão vestido de vocabulário regional.

A polidez é tratada como foi falada, nas duas direções. Fala carregada de keigo — uma ligação de atendimento ao cliente, uma apresentação formal, uma entrevista com alguém sênior — produz いらっしゃいます, させていただきます e ございます tal como foram ditos, e a fala casual entre amigos produz formas simples e partículas omitidas tal como foram ditas. O mecanismo não normaliza uma na outra, que é o comportamento desejável: em japonês, o nível de polidez faz parte do conteúdo, não é um ajuste de estilo. Onde ele tem dificuldade é no mesmo ponto em que humanos têm — as formas humildes e honoríficas de um mesmo verbo não se parecem em nada com a forma de dicionário, então keigo pouco usual merece uma olhada na revisão.

Dicas

Dicas para uma transcrição precisa do japonês

FAQ

Voz para texto em japonês — perguntas

A conversão de fala em texto em japonês é grátis mesmo?
Sim — você pode transcrever áudio em japonês grátis, sem cadastro. Crie uma conta gratuita se precisar de mais tempo de transcrição.
A transcrição sai em kanji e kana ou em romaji?
Em kanji e kana — japonês escrito normal, do jeito que a fala seria escrita normalmente. Você recebe uma mistura de kanji, hiragana e katakana com pontuação japonesa, não uma versão fonética romanizada. Se precisar de romaji, converta o texto pronto depois.
Como o mecanismo decide entre kanji, hiragana e katakana?
Pelo contexto, do mesmo jeito que um autor faz. As palavras de conteúdo vão para kanji, as desinências gramaticais e partículas para hiragana, e estrangeirismos, nomes estrangeiros e onomatopeias para katakana. No exemplo acima, a palavra de origem neerlandesa ゴム está corretamente em katakana, enquanto 西洋人, na mesma frase, está em kanji.
O que acontece com homófonos como 機械 e 機会?
O mecanismo escolhe o kanji que se encaixa na frase ao redor. Isso funciona bem na fala comum e é também o lugar mais provável de encontrar um erro — a transcrição de exemplo desta página contém exatamente um desses deslizes, mantido de propósito. Vocabulário técnico denso em homófonos merece uma passada de revisão.
Funciona com Kansai-ben e outros regionalismos japoneses?
Kansai-ben falado com clareza transcreve de forma útil, embora a transcrição possa puxar para as formas padrão em alguns pontos. O japonês padrão dá os resultados mais confiáveis; quanto mais distante dele estiver a gravação — fala carregada de Tōhoku ou de Kyushu, por exemplo —, mais revisão ela exige, e isso vale para qualquer sistema automático.
Ele lida com keigo além da fala casual?
Com os dois, tal como foram falados. Formas honoríficas e humildes como いらっしゃいます ou 拝見する são transcritas como foram ditas, sem serem achatadas em formas simples, e a fala casual continua casual. Como a polidez em japonês é gramatical, isso preserva intacto o registro do original.
Posso transcrever vídeo em japonês e quais formatos posso enviar?
Sim para vídeo — MP4 e WEBM funcionam, e extraímos o japonês falado automaticamente. Todos os formatos comuns são aceitos, 20 no total: áudio como MP3, WAV, M4A, OGG ou FLAC, e vídeo como MP4, MOV, MKV, AVI ou WEBM.
Quanto tempo leva a transcrição?
A maioria dos arquivos fica pronta em poucos minutos, dependendo da duração da gravação. O exemplo de 45 segundos acima levou 20 segundos.
Outros idiomas

Transcrever outro idioma