Multimodal
engelsk: multimodal
En modell som håndterer mer enn tekst, som bilder, lyd og video. Du kan for eksempel laste opp et bilde og stille spørsmål om det.
De første språkmodellene kunne bare lese og skrive tekst. Moderne modeller er multimodale: de kan se på bilder, lytte til lyd og i økende grad forstå video. Det åpner praktiske muligheter, som å fotografere en håndskrevet lapp og få den som tekst, eller laste opp et skjermbilde av en feilmelding og få hjelp.
Multimodal går begge veier: mange verktøy kan også lage bilder og tale, ikke bare tolke dem.
Lignende begreper
KI-verktøy som lager bilder fra en tekstbeskrivelse. Kjente tjenester er blant annet Midjourney, DALL-E og bildefunksjonene i ChatGPT og Gemini.
KI som gjør opptak av tale om til tekst. Praktisk for møtereferater, intervjuer og notater.
KI-modellen bak verktøy som ChatGPT og Claude. Trent på enorme tekstmengder til å forstå og produsere språk.
Vil du lære å bruke dette i praksis? Se kursene for bedrift eller privat.
