Whisper large-v3 przy czystym dźwięku zbliża się do ludzkiego transkrybenta; przy słabym dźwięku myli się jak każdy. Sześć poniższych zasad znaczy więcej niż jakiekolwiek ustawienie.
Transkrybuj teraz, za darmo →Jeden głos naraz: gdy dwie osoby mówią jednocześnie, żaden silnik nie transkrybuje dobrze. Dźwięk nie za mocno skompresowany: oryginalny m4a lub wav jest lepszy niż mp3 32 kbps kilkakrotnie przekodowany. Normalna głośność: jeśli musisz podkręcić dźwięk na maksimum, żeby coś usłyszeć, silnik słyszy równie źle.
Konwertowanie pliku na inne formaty, „czyszczenie” dźwięku agresywnymi filtrami, które usuwają też głos, przesyłanie tego samego pliku kilka razy. Jeśli tekst i tak wychodzi źle, problemem prawie zawsze jest nagranie: odsłuchaj dziesięć sekund i zapytaj siebie, czy obca osoba zrozumiałaby słowa.
Przy czystym dźwięku w jednym z 8 obsługiwanych języków zwykle poprawia się mniej niż jedno słowo na dwadzieścia; przy hałasie lub nakładających się głosach znacznie więcej.
Nieznacznie i tylko w pierwszych sekundach: jeśli znasz język, jego wybranie jest bezpieczniejsze.
Tak: skopiuj tekst i popraw nazwy oraz liczby, korzystając ze znaczników czasu, by odnaleźć miejsca w nagraniu.