Talegjenkjenning og modeller

Whisper

En åpen talegjenkjenningsmodell fra OpenAI, som kan kjøres på egen maskin.

Engelsk: Whisper

Whisper er en talegjenkjenningsmodell som OpenAI slapp åpent i 2022. Den ble trent på svært store mengder lyd på mange språk, og den kan lastes ned og kjøres på egen maskin uten å be noen om lov.

Det siste er grunnen til at den betyr så mye.

Hvorfor den endret feltet

Før Whisper var brukbar talegjenkjenning i praksis en skytjeneste du kjøpte tilgang til. Etter Whisper kunne hvem som helst kjøre en god modell lokalt, uten kostnad per minutt og uten at lyden forlot maskinen.

Det åpnet transkribering for alt som ikke kan lastes opp: pasientsamtaler, klientmøter, forskningsdata, personalsaker.

Modell, ikke tjeneste

Whisper er en modell, altså en fil med vekter. Den har ikke et brukergrensesnitt, den håndterer ikke filer for deg, og den skiller ikke talere. Det gjør programvaren rundt den. Når to verktøy begge «bruker Whisper», kan de likevel gi ganske ulikt resultat, avhengig av hvilken versjon og størrelse de kjører, og hva de gjør før og etter.

Norsk

Whisper er trent bredt og internasjonalt, og norsk er ett av mange språk. Den håndterer østnorsk normaltale godt, men treffer svakere på bredere dialekt enn modeller som er videretrent spesifikt på norsk. Det er nettopp det NB-Whisper er.

Se også

NB-Whisper, lokal transkribering, hallusinasjon, og artikkelen Whisper lokal transkribering.

Norsk tale, skrevet ut

Sayable transkriberer norsk med dialekt, skiller talerne og lager referatutkast. Gratis å komme i gang.