Talegjenkjenning og modeller

Språkmodell

En modell som forutsier sannsynlige ordrekker, og som brukes både i transkribering og til å lage sammendrag.

Engelsk: language model ·Også kalt: LLM, stor språkmodell

En språkmodell er en modell som er trent på store mengder tekst, og som forutsier hvilke ord som sannsynligvis følger etter hverandre.

I transkribering spiller den to roller.

1. Den avgjør tvilstilfeller

Lyden alene er ofte tvetydig. «Vi tar det i drøftelsesmøtet» og «vi tar det i drøftelses møtet» høres identiske ut. Modellen velger den ordrekken som er mest sannsynlig i sammenhengen.

Dette er også forklaringen på et mønster mange kjenner igjen: systemet treffer godt på vanlige setninger og bommer på egennavn. Vanlige ordrekker har modellen sett millioner av ganger. Etternavnet ditt har den aldri sett.

2. Den lager sammendraget

Et transkript fra et times møte er rundt 8000 ord. Å gjøre det om til et referat med beslutninger og oppgaver, er en oppgave for en språkmodell, ikke for talegjenkjenningen. Det er to helt forskjellige ledd i kjeden, selv om de ofte selges som ett produkt.

Store språkmodeller

LLM, large language model, brukes om de store modellene av typen GPT og Claude. De er språkmodeller i samme forstand, bare mye større og mer allmenne. I transkriberingssammenheng brukes de nesten alltid i ledd 2, til sammendrag og strukturering, ikke til selve talegjenkjenningen.

Se også

Talegjenkjenning, hallusinasjon, finjustering.

Norsk tale, skrevet ut

Sayable transkriberer norsk med dialekt, skiller talerne og lager referatutkast. Gratis å komme i gang.