Ordliste
Modeller og verktøy

Multimodal

engelsk: multimodal

En modell som håndterer mer enn tekst, som bilder, lyd og video. Du kan for eksempel laste opp et bilde og stille spørsmål om det.

De første språkmodellene kunne bare lese og skrive tekst. Moderne modeller er multimodale: de kan se på bilder, lytte til lyd og i økende grad forstå video. Det åpner praktiske muligheter, som å fotografere en håndskrevet lapp og få den som tekst, eller laste opp et skjermbilde av en feilmelding og få hjelp.

Multimodal går begge veier: mange verktøy kan også lage bilder og tale, ikke bare tolke dem.

Lignende begreper

Vil du lære å bruke dette i praksis? Se kursene for bedrift eller privat.

Få praktiske KI-oppskrifter på e-post

Korte, konkrete oppskrifter du kan bruke samme dag. Ingen spam, meld deg av når du vil.

Les hvordan vi behandler opplysningene dine.