Talegenkendelse og modeller

ASR

Automatic speech recognition, det engelske fagbegreb for automatisk talegenkendelse.

Engelsk: automatic speech recognition ·Også kaldet: automatisk talegenkendelse, speech-to-text, STT

ASR står for automatic speech recognition. Det er fagbegrebet for talegenkendelse, og det, du møder i teknisk dokumentation, forskningsartikler og API-navne.

Du ser også STT, speech-to-text, som betyder det samme. ASR bruges mest i forskningssammenhæng, STT mest i produktsammenhæng.

Hvorfor du møder forkortelsen

Feltet er engelsksproget. Skal du læse om, hvor god en model er på dansk, finde et API eller sammenligne to leverandører teknisk, er ASR det ord, du søger på. Danske »talegenkendelse« giver langt færre og mindre præcise resultater.

Det, ASR ikke omfatter

  • Taleridentifikation, altså hvem der taler. Det hedder speaker recognition eller diarisering, når det handler om at dele optagelsen efter taler.
  • Talesyntese, altså at lave tale ud fra tekst. Det er TTS, text-to-speech, og går den modsatte vej.
  • Sprogforståelse. ASR skriver ordene ned. Hvad de betyder, håndteres af en sprogmodel bagefter.

Se også

Talegenkendelse, ordfejlrate, Whisper.

Tale, skrevet ud

Sayable transskriberer tale med dialekt, skelner talerne og laver et udkast til referat. Gratis at komme i gang.