Opdateringer·6. oktober kl. 19:36
Google lancerer EmbeddingGemma 2: Åben AI-model til tekst, billeder, lyd og video
AI-genereret og kontrolleret ud fra de angivne kilder herunder.
Google har udgivet EmbeddingGemma 2, en åben model der kan forstå tekst, billeder, lyd og video og køre lokalt på en telefon. Den fulde version bruger omkring 567 MB RAM på en Pixel 11 Pro.
Google har lanceret EmbeddingGemma 2, en åben AI-model der kan omsætte tekst, billeder, lyd og video til tal, som en computer kan sammenligne. Modellen er lille nok til at køre direkte på en telefon eller en almindelig computer, uden at data sendes til nettet.
Hvad er en embedding?
En embedding er en slags talmæssigt fingeraftryk af et stykke indhold. Ligner to ting hinanden i betydning, får de lignende fingeraftryk. Det bruges til søgning, der forstår meningen frem for kun ordene. Det bruges også til RAG, hvor en AI slår relevante dokumenter op, før den svarer.
Med EmbeddingGemma 2 bliver tekst, billeder, lyd og video lagt i det samme rum. Man kan altså i princippet søge i billeder eller lydklip med almindelig tekst.
Lille og modulopbygget
Modellen er bygget på Googles Gemma 4-arkitektur. Den findes i flere størrelser, og man henter kun det, man har brug for:
- 270 millioner parametre til tekst og kode - 170 millioner ekstra til billeder - 300 millioner ekstra til lyd - op til 740 millioner parametre med alle dele
Parametre er de indstillinger, en model har lært under træning. Jo færre, desto mindre og hurtigere er modellen typisk.
På en Google Pixel 11 Pro bruger tekstversionen ifølge de kilder, jeg har set, cirka 191 MB aktiv RAM. Den fulde multimodale version bruger omkring 567 MB, når den er komprimeret (kvantiseret). Det er lidt i forhold til mange andre AI-modeller.
Længere kontekst end forgængeren
Kontekstvinduet er på 8.000 tokens, fire gange så meget som i den første EmbeddingGemma. Det svarer ifølge omtalen til op mod 5,5 minutters lyd, 29 billeder eller 58 videobilleder ad gangen.
Hvad betyder det for dig?
Fordi modellen er åben, kan udviklere og virksomheder hente den gratis og bruge den i egne apps. Den kan fx hjælpe med at søge i private billeder, optagelser og dokumenter på telefonen uden at sende dem til en server. Det er godt for både privatliv og hastighed.
Modellen kan hentes på Hugging Face og Kaggle og virker med blandt andet MediaPipe, LiteRT, Ollama, LM Studio og llama.cpp.
Kilder
Mere om emnet
Få ugens AI-nyheder i indbakken
Vælg selv niveau, emner og længde. Én mail om ugen, afmeld når som helst.
Tilmeld dig Promptly Nyhedsbrev


