Talegenkendelse og modeller

Talegenkendelse

Teknologien, der gør talelyd til skreven tekst.

Engelsk: speech recognition ·Også kaldet: ASR, automatisk talegenkendelse

Talegenkendelse er teknologien, der tager imod lyd af tale og giver tekst tilbage. Den ligger under alt fra diktering på telefonen til transskription af flere timers mødeoptagelse.

Ordet bruges om to lidt forskellige ting, og de er værd at holde adskilt:

Talegenkendelse som teknologi. Modellen, der omsætter lyd til bogstaver. Det er den almindelige betydning, og det engelske automatic speech recognition eller ASR dækker det samme.

Talegenkendelse som identifikation. At genkende hvem der taler, ikke hvad der bliver sagt. Det hedder på dansk helst taleridentifikation, og på engelsk speaker recognition. Sammenblandingen sker ofte, og den betyder noget: det ene skriver ord ned, det andet genkender en person.

Ikke det samme som sprogforståelse

Et talegenkendelsessystem skriver ned, hvad der blev sagt. Det forstår ikke, hvad det betyder, og det ved ikke, at »ja, det går nok fint« kan betyde det modsatte. Fortolkningen sker i et senere led, i en sprogmodel eller i hovedet på den, der læser.

Skellet forklarer også, hvorfor systemerne rammer forkert på egennavne og fagord, men rammer rigtigt på almindelige sætninger: de er trænet på, hvilke lydmønstre og ordrækker der er sandsynlige, ikke på hvad der giver mening i din organisation.

Se også

ASR, taleridentifikation, ordfejlrate.

Tale, skrevet ud

Sayable transskriberer tale med dialekt, skelner talerne og laver et udkast til referat. Gratis at komme i gang.