Taligenkänning och modeller
NB-Whisper
Norska Nationalbibliotekets vidaretränade version av Whisper, anpassad till norskt tal och norsk dialekt.
NB-Whisper är en familj taligenkänningsmodeller från norska Nationalbiblioteket, byggd genom att vidareträna Whisper på stora mängder norskt tal.
Utgångspunkten är problemet att internationella modeller har hört lite norska. Norska är ett litet språk, och en modell som tränas på allt den kommer över får många tusen gånger mer engelska. Resultatet är att norskan fungerar, men blir en biprodukt. Samma sak gäller svenskan.
Vad vidareträningen gör
Modellen får höra mycket norskt tal med facittext, från en samling som täcker dialektbredden. Efter det känner den igen mönster den tidigare fick gissa sig till.
Effekten är störst just där språket är som svårast. På tydligt standardtal i bra ljud är skillnaden mot en allmän modell liten. På bred dialekt är den inte subtil.
Vad den inte löser
- Egennamn. Efternamn och ortnamn är fortfarande den största felkällan.
- Nynorsk. Uttalet bestämmer inte skriftspråket, och modellerna skriver som regel bokmål oavsett vad som sägs.
- Kodväxling. Tal med engelska fackord inflikade är fortfarande krävande. Se kodväxling.
- Flera talare i samma rum. Det är ett diariseringsproblem, inte ett modellproblem.
Öppet tillgänglig
Modellerna är publicerade öppet och kan köras lokalt, på samma sätt som Whisper. Det är skälet till att flera nordiska verktyg bygger på dem.