Whisper large-v3 kommt mit sauberem Audio nah an einen menschlichen Transkribierer heran; mit schlechtem Audio macht es Fehler wie jeder andere. Die sechs Regeln unten zählen mehr als jede Einstellung.
Jetzt transkribieren, gratis →Eine Stimme zur Zeit: wenn sich zwei Personen überlappen, transkribiert keine Engine gut. Nicht zu stark komprimiertes Audio: ein originales m4a oder wav ist besser als ein mehrfach neu kodiertes mp3 mit 32 kbps. Normale Lautstärke: wenn du voll aufdrehen musst, um etwas zu hören, hört die Engine genauso schlecht wie du.
Die Datei in andere Formate umwandeln, das Audio mit aggressiven Filtern „säubern“, die auch die Stimme entfernen, dieselbe Datei mehrfach hochladen. Kommt der Text trotzdem schlecht heraus, liegt es fast immer an der Aufnahme: höre zehn Sekunden an und frage dich, ob ein Fremder die Wörter verstehen würde.
Mit sauberem Audio in einer der 8 unterstützten Sprachen muss meist weniger als eines von zwanzig Wörtern korrigiert werden; bei Lärm oder überlappenden Stimmen deutlich mehr.
Nur minimal und nur in den ersten Sekunden: wenn du die Sprache kennst, ist die Auswahl sicherer.
Ja: Text kopieren und Namen und Zahlen korrigieren; die Zeitstempel führen dich zu den Stellen in der Audiodatei.