AI-ordbok

Multimodal

En multimodal modell forstår flere typer innhold samtidig: tekst, bilder, lyd og video.

Hva betyr multimodal?

De første språkmodellene kunne bare lese og skrive tekst. En multimodal modell tar imot flere formater i samme samtale. Du kan vise den et bilde og stille spørsmål om det, spille av et lydopptak og få tekst tilbake, eller be den lage et bilde ut fra en beskrivelse.

Det åpner for oppgaver der informasjonen ikke finnes som ryddig tekst. Skjemaer som er skannet, kvitteringer som er fotografert, befaringer som er filmet og møter som bare finnes som opptak blir plutselig noe et system kan lese og jobbe videre med.

Eksempel fra hverdagen

En rørlegger fotograferer et gammelt anlegg på befaring og ber assistenten beskrive det som står der: fabrikat, dimensjoner og synlige feil. Bildet blir til tekst som kan limes rett inn i tilbudet, uten at noen sitter og taster av notater i etterkant.

Hvorfor det betyr noe for en mindre bedrift

Mye av informasjonen i en mindre bedrift finnes ikke som ren tekst. Den ligger i bilder fra byggeplassen, i skannede fraktbrev og i lydopptak fra møter. Multimodale modeller gjør denne informasjonen tilgjengelig for automatisering uten manuell inntasting, og det er ofte der de største tidstyvene bor.

Relaterte begreper