Talegenkendelse og modeller

Whisper

En åben talegenkendelsesmodel fra OpenAI, som kan køres på egen maskine.

Engelsk: Whisper

Whisper er en talegenkendelsesmodel, som OpenAI udgav åbent i 2022. Den blev trænet på meget store mængder lyd på mange sprog, og den kan hentes og køres på egen maskine uden at spørge nogen om lov.

Det sidste er grunden til, at den betyder så meget.

Hvorfor den ændrede feltet

Før Whisper var brugbar talegenkendelse i praksis en skytjeneste, du købte adgang til. Efter Whisper kunne hvem som helst køre en god model lokalt, uden omkostning per minut og uden at lyden forlod maskinen.

Det åbnede transskription for alt, der ikke kan uploades: patientsamtaler, klientmøder, forskningsdata, personalesager.

Model, ikke tjeneste

Whisper er en model, altså en fil med vægte. Den har ingen brugerflade, den håndterer ikke filer for dig, og den skelner ikke talere. Det gør programmellet omkring den. Når to værktøjer begge »bruger Whisper«, kan de alligevel give ret forskellige resultater, afhængigt af hvilken version og størrelse de kører, og hvad de gør før og efter.

Mindre sprog

Whisper er trænet bredt og internationalt, og hvert mindre sprog er ét blandt mange. Den håndterer nordisk standardtale godt, men rammer svagere på bredere dialekt end modeller, der er videretrænet på ét enkelt sprog. NB-Whisper er netop sådan en model for norsk.

Se også

NB-Whisper, lokal transskription, hallucination.

Tale, skrevet ud

Sayable transskriberer tale med dialekt, skelner talerne og laver et udkast til referat. Gratis at komme i gang.