Initializing, please wait a moment

Text zu Sprache Schritt für Schritt

Text zu Sprache erzeugt Audio in drei Schritten: Seite öffnen, Stimmmodell laden, Sprache erzeugen. Diese Anleitung zeigt, was jeder Schritt verlangt.

Kurze Antwort. Öffne Text zu Sprache, lade das Stimmmodell, füge den Text ein, wähle eine der zehn Stimmen und erzeuge die Aufnahme. Alles läuft im Browser - nichts wird hochgeladen.

Schritt 1 - Werkzeug öffnen und Modell laden

Öffne die Seite und klicke auf die Schaltfläche, die das neuronale Stimmmodell lädt. Die vier Modelldateien sind zusammen etwa 380 MB groß und werden nur einmal geladen, mit sichtbarer Prozentanzeige. Danach liegen sie im Cache dieses Browsers: der nächste Besuch startet in Sekunden, und die Erzeugung funktioniert auch ohne Netz.

Schritt 2 - Text bereitstellen

Tippe oder füge den Text ein, oder lade eine Datei im Format .srt, .vtt, .sbv oder .txt - gelesen wird sie im Tab selbst. Wähle die Stimme (M1 bis M5, F1 bis F5), lasse die Sprache auf automatischer Erkennung oder wähle eine der 31 Sprachen, und stelle Geschwindigkeit und Qualitätsschritte ein.

Schritt 3 - erzeugen und herunterladen

Klicke auf erzeugen: die Seite nennt Segment und Verfeinerungsschritt und zeigt danach den Player. Die Schaltfläche zum Herunterladen liefert eine MP3-Datei mit 128 kbit/s oder eine WAV-Datei mit 44,1 kHz, hier auf der Seite kodiert. Bei einer Untertiteldatei setzt die Zeitleisten-Option jede Zeile auf ihren eigenen Zeitcode, sodass das exportierte Audio zum Original passt.

Zahlen, die zählen

Verfügbare Stimmen10 (M1-M5, F1-F5)
Sprachen des Modells31
Einmaliger Modell-Downloadetwa 380 MB
Audioqualität44,1 kHz, mono
Geschwindigkeit0,8x bis 1,5x
Qualitätsschritte4, 8 oder 16
Textgrenze pro Durchlauf20.000 Zeichen

Häufige Fragen

Kann ich das Audio als MP3 speichern?

Ja, in allen unterstützten Sprachen. Nach der Erzeugung liefert die Schaltfläche eine MP3- oder WAV-Datei, die auf der Seite selbst kodiert wird - ohne Upload.

Warum lädt der erste Durchlauf 380 MB?

Weil die Stimme das Modell ist. Die Dateien werden einmal geladen und im Browser-Cache behalten; danach startet das Werkzeug schnell und arbeitet offline. Bei begrenzter Verbindung bleibt die schnelle Gerätestimme einen Klick entfernt.

← Zurück zu den Hilfswerkzeugen

Why trust these tools

  • Ten-plus years of web tooling. The freetoolonline editorial team has shipped browser-based utilities since 2015. The goal has never changed: get you to a working output fast, without an install.
  • No install, no sign-up. Open a tool and get a working output in seconds - nothing to download and no account to create. Tools that need heavy processing run it on our service, so even a low-powered machine gets the job done.
  • Analytics stops at the page view. We measure which pages get visited, not what you type or upload inside a tool. There is nothing to sign in to and no profile is attached to your input.
  • Open-source core components. The processing engines underneath (libheif, libde265, pdf-lib, terser, clean-css, ffmpeg.wasm, and others) are public and audit-able. We link to each one in its tool page's footer.
  • Free, with or without ads. All tools are fully functional without sign-up. The Disable Ads button in the header is always available if you need a distraction-free run.

Related tools:

  • Text to Speech - Text to Speech with 10 neural voices running in your browser: read text or an SRT transcript aloud
  • Speech to Text - Dictate live with your mic, or transcribe a saved recording on your own device with Whisper AI -