Taligenkänning och modeller

Röstaktivitetsdetektering (VAD)

Tekniken som avgör var i en ljudinspelning det faktiskt talas, och var det är tyst.

Engelska: voice activity detection ·Kallas även: VAD, talaktivitetsdetektering

Röstaktivitetsdetektering, på engelska voice activity detection och förkortat VAD, är tekniken som avgör var i ett ljudspår det talas och var det är tyst.

Den är ett förberedande steg, inte ett resultat i sig. Men den påverkar mycket av det du märker.

Vad den används till

Att klippa bort tystnad. En mötesinspelning på två timmar kan innehålla tjugo minuter utan tal. VAD låter systemet hoppa över dem, vilket gör transkriberingen snabbare och billigare.

Att dela upp långa inspelningar. Modeller behandlar ljud i bitar. VAD hittar naturliga klipppunkter i pauser i stället för mitt i ett ord.

Att avsluta diktering. När du dikterar och systemet stannar av sig självt efter några sekunders tystnad är det VAD som har bestämt att du var klar.

Att styra inspelning. Inspelningsfunktioner som bara spelar in när någon talar bygger på samma sak.

Varför pauser försvinner

En sidoeffekt värd att känna till: om tystnaden klipps bort försvinner också informationen om hur långa pauserna var. För ett mötesprotokoll spelar det ingen roll. För samtalsanalys i forskning, där pauslängd är data, är det en förlust. Behöver du pauserna måste du be om verbatim transkribering med pausmarkering, och kontrollera att verktyget faktiskt behåller dem.

VAD har också svårt med jämnt bakgrundsbrus, som ventilation, eftersom gränsen mellan tal och brus blir mindre tydlig.

Se även

Diarisering, tidsstämpel, verbatim.

Tal, utskrivet

Sayable transkriberar tal med dialekt, skiljer talarna åt och gör ett utkast till protokoll. Gratis att komma igång.