Talegjenkjenning og modeller
ASR
Automatic speech recognition, det engelske fagbegrepet for automatisk talegjenkjenning.
ASR står for automatic speech recognition. Det er fagbegrepet for talegjenkjenning, og det du møter i teknisk dokumentasjon, forskningsartikler og API-navn.
Du ser også STT, speech-to-text, som betyr det samme. ASR brukes mest i forskningssammenheng, STT mest i produktsammenheng.
Hvorfor du møter forkortelsen
Feltet er engelskspråklig. Skal du lese om hvor god en modell er på norsk, finne et API, eller sammenligne to leverandører teknisk, er ASR ordet du søker på. Norske «talegjenkjenning» gir langt færre og mindre presise treff.
Det ASR ikke omfatter
- Taleridentifikasjon, altså hvem som snakker. Det heter speaker recognition eller diarisering når det handler om å dele opptaket etter taler.
- Talesyntese, altså å lage tale fra tekst. Det er TTS, text-to-speech, og går motsatt vei.
- Språkforståelse. ASR skriver ned ordene. Hva de betyr, håndteres av en språkmodell etterpå.