Whisper large-v3 komt met schone audio dicht bij een menselijke transcribent; met slechte audio maakt het fouten zoals iedereen. De zes regels hieronder tellen zwaarder dan welke instelling ook.
Nu transcriberen, gratis →Eén stem tegelijk: als twee mensen door elkaar praten, transcribeert geen enkele engine goed. Audio die niet te sterk gecomprimeerd is: een originele m4a of wav is beter dan een meermaals opnieuw gecodeerde mp3 van 32 kbps. Normaal volume: als jij het volume vol open moet zetten om iets te horen, hoort de engine het net zo slecht.
Het bestand omzetten naar andere formaten, de audio "schoonmaken" met agressieve filters die ook de stem weghalen, hetzelfde bestand meerdere keren uploaden. Komt de tekst toch slecht uit, dan ligt het bijna altijd aan de opname: luister tien seconden terug en vraag je af of een vreemde de woorden zou verstaan.
Met schone audio in een van de 8 ondersteunde talen hoef je meestal minder dan één op de twintig woorden te corrigeren; met lawaai of door elkaar pratende stemmen veel meer.
Nauwelijks en alleen in de eerste seconden: ken je de taal, dan is kiezen veiliger.
Ja: kopieer de tekst en corrigeer namen en cijfers; de tijdcodes brengen je naar de plekken in de audio.