Talegenkendelse og modeller
Whisper
En åben talegenkendelsesmodel fra OpenAI, som kan køres på egen maskine.
Whisper er en talegenkendelsesmodel, som OpenAI udgav åbent i 2022. Den blev trænet på meget store mængder lyd på mange sprog, og den kan hentes og køres på egen maskine uden at spørge nogen om lov.
Det sidste er grunden til, at den betyder så meget.
Hvorfor den ændrede feltet
Før Whisper var brugbar talegenkendelse i praksis en skytjeneste, du købte adgang til. Efter Whisper kunne hvem som helst køre en god model lokalt, uden omkostning per minut og uden at lyden forlod maskinen.
Det åbnede transskription for alt, der ikke kan uploades: patientsamtaler, klientmøder, forskningsdata, personalesager.
Model, ikke tjeneste
Whisper er en model, altså en fil med vægte. Den har ingen brugerflade, den håndterer ikke filer for dig, og den skelner ikke talere. Det gør programmellet omkring den. Når to værktøjer begge »bruger Whisper«, kan de alligevel give ret forskellige resultater, afhængigt af hvilken version og størrelse de kører, og hvad de gør før og efter.
Mindre sprog
Whisper er trænet bredt og internationalt, og hvert mindre sprog er ét blandt mange. Den håndterer nordisk standardtale godt, men rammer svagere på bredere dialekt end modeller, der er videretrænet på ét enkelt sprog. NB-Whisper er netop sådan en model for norsk.