Talegjenkjenning og modeller
Talegjenkjenning
Teknologien som gjør talelyd om til skrevet tekst.
Talegjenkjenning er teknologien som tar imot lyd av tale og gir tilbake tekst. Den ligger under alt fra diktering på telefonen til transkribering av flere timer møteopptak.
Ordet brukes om to litt forskjellige ting, og det er verdt å holde dem fra hverandre:
Talegjenkjenning som teknologi. Modellen som omsetter lyd til bokstaver. Dette er den vanlige betydningen, og det engelske automatic speech recognition eller ASR dekker det samme.
Talegjenkjenning som identifikasjon. Å kjenne igjen hvem som snakker, ikke hva som blir sagt. Dette kalles på norsk helst taleridentifikasjon, og på engelsk speaker recognition. Blandingen skjer ofte, og den er meningsbærende: det ene skriver ned ord, det andre gjenkjenner en person.
Ikke det samme som språkforståelse
Et talegjenkjenningssystem skriver ned det som ble sagt. Det forstår ikke hva det betyr, og det vet ikke at «ja, det går sikkert fint» kan bety det motsatte. Tolkningen skjer i et senere ledd, i en språkmodell eller i hodet til den som leser.
Skillet forklarer også hvorfor systemene bommer på egennavn og fagord, men treffer på vanlige setninger: de er trent på hvilke lydmønstre og ordrekker som er sannsynlige, ikke på hva som gir mening i din organisasjon.
Se også
ASR, taleridentifikasjon, ordfeilrate og artikkelen AI tale til tekst: hvordan det virker.