Taligenkänning och modeller
ASR
Automatic speech recognition, det engelska fackbegreppet för automatisk taligenkänning.
ASR står för automatic speech recognition. Det är fackbegreppet för taligenkänning, och det du möter i teknisk dokumentation, forskningsartiklar och API-namn.
Du ser också STT, speech-to-text, som betyder samma sak. ASR används mest i forskningssammanhang, STT mest i produktsammanhang.
Varför du möter förkortningen
Fältet är engelskspråkigt. Ska du läsa om hur bra en modell är på svenska, hitta ett API eller jämföra två leverantörer tekniskt, är ASR ordet du söker på. Svenska ”taligenkänning” ger betydligt färre och mindre träffsäkra resultat.
Det ASR inte omfattar
- Talaridentifiering, alltså vem som talar. Det heter speaker recognition, eller diarisering när det handlar om att dela upp inspelningen efter talare.
- Talsyntes, alltså att skapa tal från text. Det är TTS, text-to-speech, och går åt motsatt håll.
- Språkförståelse. ASR skriver ner orden. Vad de betyder hanteras av en språkmodell efteråt.