Taligenkänning och modeller

Taligenkänning

Tekniken som gör talljud till skriven text.

Engelska: speech recognition ·Kallas även: ASR, automatisk taligenkänning

Taligenkänning är tekniken som tar emot ljud av tal och ger tillbaka text. Den ligger under allt från diktering på telefonen till transkribering av flera timmars mötesinspelning.

Ordet används om två lite olika saker, och de är värda att hålla isär:

Taligenkänning som teknik. Modellen som omvandlar ljud till bokstäver. Det här är den vanliga betydelsen, och engelskans automatic speech recognition eller ASR täcker samma sak.

Taligenkänning som identifiering. Att känna igen vem som talar, inte vad som sägs. Det kallas på svenska hellre talaridentifiering, och på engelska speaker recognition. Sammanblandningen sker ofta, och den är betydelsebärande: det ena skriver ner ord, det andra känner igen en person.

Inte samma sak som språkförståelse

Ett taligenkänningssystem skriver ner det som sades. Det förstår inte vad det betyder, och det vet inte att ”ja, det går nog bra” kan betyda motsatsen. Tolkningen sker i ett senare led, i en språkmodell eller i huvudet på den som läser.

Skillnaden förklarar också varför systemen missar egennamn och fackord men träffar rätt på vanliga meningar: de är tränade på vilka ljudmönster och ordföljder som är sannolika, inte på vad som är begripligt i just din organisation.

Se även

ASR, talaridentifiering, ordfelsfrekvens.

Tal, utskrivet

Sayable transkriberar tal med dialekt, skiljer talarna åt och gör ett utkast till protokoll. Gratis att komma igång.