Kostenlose Spracherkennung für Telugu
Laden Sie Ihre Telugu-Audio- oder -Videodatei hoch und erhalten Sie innerhalb weniger Minuten ein bearbeitbares Transkript in Telugu-Schrift – automatisch, direkt im Browser und zum Einstieg kostenlos.
Telugu hat laut der indischen Volkszählung von 2011 rund 83 Millionen Muttersprachler und ist damit nach Hindi, Bengali und Marathi die viertmeistgesprochene Muttersprache Indiens sowie die meistgesprochene der dravidischen Sprachen. Es ist Amtssprache von Andhra Pradesh und Telangana sowie des Distrikts Yanam von Puducherry und trägt sehr viel aufgezeichnete Sprache: Nachrichtensender, Universitätsvorlesungen, YouTube- und Podcast-Audio, Callcenter- und Büroaufnahmen sowie die in Hyderabad ansässige Filmindustrie, eine der größten Indiens.
Das Erste, was die meisten wissen wollen, ist, wie das Transkript eigentlich aussieht. Telugu hat eine eigene Schrift – eine Abugida, die aus dem gemeinsamen Telugu-Kannada-Schriftsystem des Mittelalters hervorging, mit ihren charakteristischen runden Buchstabenformen und dem kleinen v-förmigen Kopfstrich namens Talakattu. Jeder Konsonant trägt einen eingebauten Vokal, andere Vokale werden als angesetzte Zeichen geschrieben, und Konsonantenhäufungen werden als untergestellte Formen unter den Hauptbuchstaben gestapelt. ConvertSpeech schreibt Ihr Transkript in dieser Schrift, als తెలుగు, und nicht als romanisiertes „telugu" in lateinischen Buchstaben. Das ist praktisch relevant, denn die Schrift unterscheidet auch aspirierte von unaspirierten Konsonanten und kurze von langen Vokalen – und diese Unterschiede verändern die Bedeutung und nicht nur die Schreibung.
Telugu ist außerdem ganz anders gebaut als Hindi oder Englisch, und das prägt, wie ein Transkript aussieht. Es ist dravidisch und nicht indogermanisch, seine Grundwortstellung ist Subjekt-Objekt-Verb, und grammatische Beziehungen werden ausschließlich dadurch ausgedrückt, dass Suffixe hinten an ein Wort angehängt werden – Telugu hat überhaupt keine Präfixe und keine Infixe. Ein einziges gesprochenes Wort kann deshalb tragen, wofür das Deutsche einen ganzen Nebensatz braucht, und entsprechend lang auf der Seite ankommen. Dazu mischt das alltägliche städtische Telugu ständig Englisch bei, eine Gewohnheit, die weithin Tenglish genannt wird: Man sagt „chala thanks" statt dhanyavadamulu, und in Büros in Hyderabad, Visakhapatnam oder Vijayawada kann die Sprache mitten im Satz wechseln und sofort wieder zurückwechseln. Unsere Engine transkribiert diese englischen Wörter als Englisch innerhalb des Telugu-Textes, statt sie in Telugu-Schreibung zu pressen.
Laden Sie Ihre Audio- oder Videodatei hoch, und die Engine schreibt das gesprochene Telugu als sauberen, durchsuchbaren Text mit Zeichensetzung nieder – bereit zum Einfügen in ein Dokument, eine Untertiteldatei oder ein Übersetzungstool. Alles läuft im Browser, ohne Installation, und die ersten Minuten sind kostenlos, ganz ohne Konto.
Wofür Telugu transkribiert wird
Nachrichten, Interviews und Podcasts
Verwandeln Sie aufgezeichnete Telugu-Interviews und -Episoden in wenigen Minuten in zitierfähigen, durchsuchbaren Text, statt sie von Hand abzutippen.
Studierende und Vorlesungen
Wandeln Sie Telugu-Vorlesungen und Forschungsinterviews in Notizen um, die Sie durchsuchen, markieren und zitieren können.
Creator und Untertitel
Erstellen Sie Telugu-Untertitel, Shownotes und Beschreibungen direkt aus dem Audio Ihres Videos oder Podcasts.
So sieht ein Telugu-Transkript wirklich aus
Dies ist eine echte 45-Sekunden-Aufnahme eines menschlichen Sprechers, durch unsere KI-Engine geschickt – genau so, wie Sie Ihre eigene Datei verarbeiten würden. Nichts wurde nachträglich korrigiert. Drücken Sie auf Play und lesen Sie mit.
KI-Engine, 25 Sekunden Verarbeitung
- 00:00కడివుండెనూ, ఇది అంతయు చూచినూ ఇసారే అతడు ఇంటికి పోదలంపనట్టు కనిపించుచున్నది, స్నేహతుల వంటకూడా అతడు కొన్ననాళ్ళు నుండీ అంత విరివిగా తిరుగుచుండటలేదు.
- 00:11చక్రపాణి బస్స ఇనీసి బేటలోన ఏకమిద్దటిల్లు.
- 00:14చక్రపాణి మేడమీద ఏదీయో చింతించుచు అటు ఇటు తిరుగుచుండెనూ.
- 00:19కొంతసేపటికి అతడు తలెత్తి చూచెనూ.
- 00:22ఎదుటుండ మేడమీదను ఉన్న సుందరవిగ్రహము అతనిక కనబడెనూ.
- 00:26చక్రపాణి వికసిత వదనుడైయెనూ. మేడమీదను ఉన్న సుందరే కనక వచ్చి చక్రపాణి తో సంభాషించెనూ.
- 00:32"పాణీ!
- 00:33నీవీ మారేమీ ఇంకా నిద్రపోవుచున్నావూ పడవు తొరకలేదా? మీ ఊరినుండి చుకదురుకయ పడవు వచ్చింది.
- 00:40పోవేమీ!
Als Erstes lohnt sich der Blick auf die Schrift: Das Transkript kommt in Telugu-Schrift zurück und nicht als Telugu in lateinischen Buchstaben. Figurennamen überleben als lesbare Telugu-Wörter – చక్రపాణి für Chakrapani –, und die Konsonantenligaturen, die zwei Buchstaben zu einer einzigen Form stapeln, werden korrekt gebildet statt auseinandergerissen. Das Fragezeichen und das doppelte Anführungszeichen, das die direkte Rede eröffnet, setzt die Engine selbst.
Zwei ehrliche Anmerkungen. Telugu kommt gelegentlich romanisiert zurück statt in eigener Schrift – in diesem Ausschnitt ist das nicht passiert, aber es passiert oft genug, dass die Tipps weiter unten empfehlen, vor der Verwendung einen Blick auf den Anfang des Transkripts zu werfen. Und der Sprecher verwendet das ältere, förmliche literarische Telugu, in dem der Roman geschrieben ist; das Transkript folgt diesem Register, statt es in moderne umgangssprachliche Schreibungen umzuschreiben.
Das hier ist eine schnelle, zügig gelesene Dialogszene und damit schwerer als eine klar artikulierte Vorlesung oder ein Diktat. Eine ruhige Aufnahme, in der immer nur eine Person spricht, kommt merklich sauberer heraus. Der Ausschnitt endet schlicht dort, wo die 45 Sekunden zu Ende sind.
Aufnahme: „Visha Vahini" von Ramanuja Rao Somaraju, ein Telugu-Roman, der im frühen 20. Jahrhundert spielt, gelesen von Swapna für LibriVox (2015). Public Domain Mark 1.0. Ausschnitt aus Kapitel 1, 1:00 bis 1:45.
Telugu-Varietäten und förmliche gegenüber alltäglicher Sprache
Telugu variiert merklich von Region zu Region. Die Sprachwissenschaft gruppiert es üblicherweise in eine nördliche Varietät, die in der Region Telangana gesprochen wird, eine zentrale oder Küstenvarietät in den Küstendistrikten Andhras, eine südliche in Rayalaseema und eine östliche in Nordandhra. Die Schriftnorm ist weitgehend aus den Küstendistrikten hervorgegangen, weshalb die Küstensprache dem geschriebenen Telugu tendenziell am nächsten steht – das ist eine Tatsache über die Geschichte der Schriftnorm und kein Urteil über irgendeine Sprechweise.
Für die Transkription ist der Wortschatz der praktisch wichtigste Unterschied. Das Telangana-Telugu, und besonders die Sprache Hyderabads, trägt eine erhebliche Schicht persischer, arabischer und urduischer Lehnwörter, die ab dem 14. Jahrhundert unter dem Sultanat von Delhi und der späteren Dekkan-Herrschaft aufgenommen wurden. Alltagswörter für Haushaltsgegenstände, Essen und Verwaltung können vom Pendant an der Küste abweichen, und entlehnte Wörter sind statistisch die wahrscheinlichste Stelle, an der ein automatisches System ausrutscht. Ist Ihre Aufnahme stark Telangana-geprägt, prüfen Sie beim Korrekturlesen zuerst diese Wörter; Grammatik und Satzbau kommen einwandfrei durch.
Das Register zählt mindestens so viel wie die Region. Telugu kennt seit Langem eine große Kluft zwischen einem förmlichen literarischen Schriftstil und der Art, wie Menschen tatsächlich sprechen; im Lauf des 20. Jahrhunderts hat – nach einer langen Kampagne von Reformern wie Gidugu Venkata Ramamurthy – die moderne gesprochene Norm die ältere literarische Form in Druck, Unterricht und Rundfunk verdrängt. Beides ist weiterhin zu hören: Eine Nachrichtensendung oder eine förmliche Rede verwendet vollständige, sorgfältig ausgesprochene Verbendungen, während ein Interview, ein Vlog oder ein Telefonat sie stark verkürzt. Unsere Engine folgt dem Register der Aufnahme, statt das eine in das andere zu überführen – deshalb bleiben die literarischen Formen im Beispiel oben so erhalten, wie sie gelesen wurden.
Wie immer ist der größte Einzelfaktor die Aufnahmequalität. Ausgeprägter Dialekt, schnell und über Hintergrundgeräuschen gesprochen, ist für jedes automatische System eine Herausforderung – in Telugu wie in jeder anderen Sprache –, und keine Engine transkribiert das so zuverlässig wie ein sauberes Signal.
Tipps für eine präzise Telugu-Transkription
- Nehmen Sie mit einem guten Mikrofon und möglichst wenig Hintergrundgeräuschen auf – die Audioqualität ist der wichtigste Einzelfaktor für das Ergebnis.
- Stellen Sie die Sprache fest auf Telugu statt auf automatische Erkennung. Das verhindert, dass eine Aufnahme für Kannada oder Tamil gehalten wird, die sich die Region und einen Teil des Wortschatzes teilen, und es verhindert, dass eine englischlastige Passage die ganze Datei ins Englische kippen lässt.
- Werfen Sie einen Blick auf die ersten Zeilen, bevor Sie das Transkript verwenden. Telugu kommt gelegentlich romanisiert in lateinischen Buchstaben zurück statt in Telugu-Schrift, und ganz oben fällt es viel schneller auf als mitten im Text.
- Prüfen Sie beim Korrekturlesen zuerst Namen und Orte. Personennamen, Dorfnamen sowie Film- und Markennamen sind die unvorhersehbarsten Wörter in jeder Telugu-Aufnahme, und derselbe Name kann in zwei verschiedenen Schreibungen zurückkommen.
- Am besten spricht immer nur eine Person; starkes Durcheinanderreden senkt die Genauigkeit. Aktivieren Sie bei Interviews die Sprechererkennung (kostenlose Funktion für registrierte Nutzer), damit gekennzeichnet wird, wer was gesagt hat.
- Sehen Sie sich alle Zahlen ein zweites Mal an. Telugu hat neben den 0 bis 9, die die moderne Schrift normalerweise verwendet, eigene Ziffern von ౦ bis ౯ – gesprochene Zahlenangaben lohnen also einen Abgleich mit dem Ton.