Sammenligning
Beste transkribering på norsk: slik måler du det
Hva som avgjør om et transkriberingsverktøy er godt på norsk, hvorfor dialekt er den harde testen, hvordan du måler ordfeilrate selv, og testen du kan kjøre på en halvtime.
«Best på norsk» er ikke det samme som «støtter norsk». Nesten alle verktøy oppgir norsk i en språkliste. Langt færre er faktisk trent på norsk tale, og forskjellen viser seg først når noen fra Bergen begynner å snakke.
Denne siden handler om hvordan du måler det. For en gjennomgang av selve verktøyene, se beste transkriberingsprogram.
Hvorfor norsk er vanskelig
Tre ting gjør norsk hardere enn engelsk for en talemodell:
Dialektbredden. Avstanden mellom tromsødialekt, bergensk og østnorsk normaltale er større enn variasjonen innenfor de fleste andre europeiske språk av samme størrelse. En modell som har hørt lite norsk, har som regel hørt Oslo.
To skriftspråk. Uttalen bestemmer ikke om det skal stå «ikke» eller «ikkje». Modellen må velge, og velger nesten alltid bokmål.
Lite treningsdata. En internasjonal modell trent på alt den kommer over, har fått mange tusen ganger mer engelsk enn norsk. Norsk blir et biprodukt.
Løsningen har vært å ta en god internasjonal modell og videretrene den på store mengder norsk tale, slik Nasjonalbiblioteket gjorde med NB-Whisper. Resultatet er modeller som har hørt dialekten før.
De fire testene som skiller
1. Dialekt
Den harde testen. Ta fem minutter med den bredeste dialekten du har i organisasjonen din. Er verktøyet trent bredt og internasjonalt, vil du se det umiddelbart: setninger som kollapser til noe som ligner, men ikke er, det som ble sagt.
2. Egennavn
Norske etternavn og stedsnavn er der alle systemer taper. «Kjærstad», «Kjerstad», «Kjærstadt» høres identiske ut. Tell feilene på navn separat fra resten, for det er den kategorien du må rette manuelt uansett.
3. Kodeveksling
Norske arbeidsmøter går på norsk med engelske fagord innimellom. Verktøy som låser ett språk for hele opptaket, tvinger de engelske ordene inn i norsk skrivemåte. Feilene havner nettopp i ordene som bar innholdet.
4. Flere talere i samme rom
Fem personer rundt én mikrofon er den vanligste virkelige situasjonen, og den vanskeligste. Sjekk om verktøyet skiller talerne i det hele tatt, og hvor godt det gjør det med felles mikrofon.
Ordfeilrate: tallet bak påstandene
Ordfeilrate, forkortet WER, er standardmålet. Den regner sammen ord som er feil, ord som mangler, og ord som er lagt til, delt på antall ord i fasiten.
| WER | Betyr | Praktisk konsekvens |
|---|---|---|
| Under 5 % | 19 av 20 ord riktig | Lett retting, mest navn |
| 5 til 10 % | 9 av 10 riktig | Brukbart, noe retting |
| 10 til 20 % | 4 av 5 riktig | Tungt, men raskere enn å skrive selv |
| Over 20 % | Hvert femte ord feil | Vurder å skrive selv |
Vær kritisk til tall i markedsføring. «98 % nøyaktighet» sier ingenting uten å oppgi hvilket materiale det er målt på. Nesten alle systemer treffer over 95 % på én person som leser tydelig fra manus i et lydtett rom. Ingen møter ser slik ut.
Testen du kan kjøre på en halvtime
- Finn fem minutter reell lyd fra ditt eget arbeid, ikke en demofil
- Sørg for at den inneholder dialekt, hvis du har det rundt deg
- Sørg for at den inneholder minst to talere
- Skriv ut de fem minuttene manuelt som fasit, det tar 20 til 30 minutter
- Kjør den gjennom to eller tre kandidater
- Tell feil i tre bøtter: vanlige ord, egennavn, fagord
- Sjekk om talerskillet er riktig
Fasiten er den eneste delen som koster tid, og du skriver den én gang. Uten den sammenligner du inntrykk i stedet for resultater.
Det som ikke handler om modellen
To ting påvirker sluttresultatet like mye som modellvalget:
Lyden. En mikrofon nær den som snakker slår enhver modellforbedring. Går du fra én telefon midt på bordet til én i hver ende, flytter du mer enn du gjør ved å bytte verktøy.
Hva du får utover ordene. Et ordrett transkript fra et times møte er rundt 8000 ord. Jobben din er sjelden ferdig der. Verktøy som også trekker ut beslutninger og oppgaver, sparer deg det som egentlig var arbeidet.
Sayable
Sayable bygger på norsktilpassede modeller, skiller talerne, og håndterer møter der det veksles mellom norsk og engelsk. Du får transkriptet og et referatutkast med beslutninger og oppgaver som egne lister.
Kjør testen over på ditt eget materiale. Det er den eneste sammenligningen som betyr noe. Sayable Lokal gjør hele jobben på din egen maskin, uten at lyden forlater datamaskinen.
Videre lesning
- Beste transkriberingsprogram
- Tale til tekst på norsk
- AI tale til tekst: hvordan det virker
- Whisper lokal transkribering
- Transkribering-app: hva du bør se etter
- Ordfeilrate (WER)
- Kodeveksling
Kort oppsummert
Se etter modeller som er videretrent på norsk tale, ikke bare språkstøtte i en liste. Test på dialekt, egennavn, kodeveksling og flere talere i samme rom. Skriv fem minutter fasit selv og tell feilene. Og husk at mikrofonplassering flytter like mye som verktøyvalget.
Ofte stilte spørsmål
De verktøyene som bygger på modeller videretrent spesifikt på norsk tale, i NB-Whisper-familien og tilsvarende, treffer merkbart bedre på dialekt enn de generelle internasjonale modellene. Forskjellen er størst nettopp der norsk er vanskeligst.
Ta fem minutter lyd med den bredeste dialekten du har tilgang til, kjør den gjennom kandidatene, og tell feilene mot fasit. Fem minutter holder til å skille verktøyene, og forskjellen er sjelden subtil.
Ordfeilrate, eller WER, er andelen ord som er feil, satt inn eller manglende, delt på antall ord i fasiten. Fem prosent WER betyr at 19 av 20 ord er riktige. Under 10 prosent regnes som brukbart for norsk tale i god lyd.
De skriver som regel bokmål uansett hva som blir sagt, siden uttalen ikke bestemmer skriftspråket. Noen verktøy lar deg velge målform. Trenger du nynorsk, sjekk dette spesifikt, for det er ikke standard.
Det er den nest hardeste testen etter dialekt. Verktøy som låser seg til ett språk presser de engelske ordene inn i norsk skrivemåte, og det rammer akkurat fagordene som bar innholdet. Test dette hvis møtene dine ser slik ut.