Taligenkänning och modeller

Språkmodell

En modell som förutsäger sannolika ordföljder, och som används både i transkribering och för att göra sammanfattningar.

Engelska: language model ·Kallas även: LLM, stor språkmodell

En språkmodell är en modell som tränats på stora mängder text, och som förutsäger vilka ord som sannolikt följer på varandra.

I transkribering spelar den två roller.

1. Den avgör tveksamma fall

Ljudet ensamt är ofta tvetydigt. ”Vi tar det på beredningsmötet” och ”vi tar det på beredningen, mötet” låter identiska. Modellen väljer den ordföljd som är mest sannolik i sammanhanget.

Det är också förklaringen till ett mönster många känner igen: systemet träffar bra på vanliga meningar och missar egennamn. Vanliga ordföljder har modellen sett miljontals gånger. Ditt efternamn har den aldrig sett.

2. Den gör sammanfattningen

Ett transkript från ett timslångt möte är runt 8000 ord. Att göra om det till ett protokoll med beslut och uppgifter är en uppgift för en språkmodell, inte för taligenkänningen. Det är två helt olika led i kedjan, även om de ofta säljs som en produkt.

Stora språkmodeller

LLM, large language model, används om de stora modellerna av typen GPT och Claude. De är språkmodeller i samma mening, bara mycket större och mer allmänna. I transkriberingssammanhang används de nästan alltid i led 2, till sammanfattning och strukturering, inte till själva taligenkänningen.

Se även

Taligenkänning, hallucination, finjustering.

Tal, utskrivet

Sayable transkriberar tal med dialekt, skiljer talarna åt och gör ett utkast till protokoll. Gratis att komma igång.