Taligenkänning och modeller

ASR

Automatic speech recognition, det engelska fackbegreppet för automatisk taligenkänning.

Engelska: automatic speech recognition ·Kallas även: automatisk taligenkänning, speech-to-text, STT

ASR står för automatic speech recognition. Det är fackbegreppet för taligenkänning, och det du möter i teknisk dokumentation, forskningsartiklar och API-namn.

Du ser också STT, speech-to-text, som betyder samma sak. ASR används mest i forskningssammanhang, STT mest i produktsammanhang.

Varför du möter förkortningen

Fältet är engelskspråkigt. Ska du läsa om hur bra en modell är på svenska, hitta ett API eller jämföra två leverantörer tekniskt, är ASR ordet du söker på. Svenska ”taligenkänning” ger betydligt färre och mindre träffsäkra resultat.

Det ASR inte omfattar

  • Talaridentifiering, alltså vem som talar. Det heter speaker recognition, eller diarisering när det handlar om att dela upp inspelningen efter talare.
  • Talsyntes, alltså att skapa tal från text. Det är TTS, text-to-speech, och går åt motsatt håll.
  • Språkförståelse. ASR skriver ner orden. Vad de betyder hanteras av en språkmodell efteråt.

Se även

Taligenkänning, ordfelsfrekvens, Whisper.

Tal, utskrivet

Sayable transkriberar tal med dialekt, skiljer talarna åt och gör ett utkast till protokoll. Gratis att komma igång.