Przedstawiamy Gemma 4: Przełomowa multimodalna inteligencja na urządzeniach
Gemma 4 31B osiąga wynik 1452 punktów w rankingu LMArena, dorównując potężnym modelom konkurencji przy niemal trzydziestokrotnie mniejszej liczbie parametrów. Nowa rodzina multimodalnych modeli od Google DeepMind, udostępniona 2 kwietnia 2026 roku na licencji Apache 2, redefiniuje pojęcie wydajności on-device. Dzięki architekturze Mixture-of-Experts (MoE) w wariancie 26B, system aktywuje zaledwie 4 miliardy parametrów, oferując jednocześnie pełne wsparcie dla analizy obrazu, wideo oraz dźwięku przy oknie kontekstowym sięgającym 256 tysięcy tokenów. Kluczową innowacją jest zastosowanie Per-Layer Embeddings (PLE) oraz współdzielonej pamięci KV Cache, co drastycznie redukuje zapotrzebowanie na zasoby przy zachowaniu wysokiej precyzji. Dla użytkowników i twórców oznacza to przełom w projektowaniu lokalnych agentów AI – mniejsze warianty (2.3B oraz 4.5B) bez trudu radzą sobie z przetwarzaniem audio i obrazów o zmiennych proporcjach bezpośrednio na laptopach czy smartfonach. Pełna integracja z ekosystemem Hugging Face, bibliotekami llama.cpp, MLX oraz WebGPU sprawia, że zaawansowana inteligencja multimodalna przestaje wymagać kosztownej infrastruktury chmurowej. Gemma 4 staje się tym samym fundamentem dla nowej generacji responsywnych, prywatnych aplikacji, które rozumieją świat wizualny i dźwiękowy w czasie rzeczywistym, działając w całości w środowisku lokalnym użytkownika.
Cztery rozmiary, nieskończone możliwości
Google zdecydowało się na dywersyfikację oferty, wprowadzając cztery warianty modelu, z których każdy odpowiada na inne potrzeby rynkowe. Kluczowym wyróżnikiem jest podział na modele gęste (dense) oraz te oparte na architekturze **Mixture-of-Experts (MoE)**. Wszystkie wersje są dostępne zarówno w wariancie bazowym, jak i zoptymalizowanym pod instrukcje (IT).- Gemma 4 E2B: Model o efektywnej liczbie 2.3B parametrów (5.1B z embeddingami), oferujący okno kontekstowe 128k. Wspiera tekst, obraz oraz audio.
- Gemma 4 E4B: Wersja 4.5B parametrów (8B z embeddingami), również z oknem 128k i pełnym wsparciem multimodalnym (w tym audio).
- Gemma 4 31B: Potężny model gęsty z oknem kontekstowym 256k, przeznaczony do najbardziej wymagających zadań analitycznych.
- Gemma 4 26B A4B: Architektura MoE, gdzie z całkowitej liczby 26B parametrów aktywnych jest jedynie 4B. Oferuje okno 256k i wydajność porównywalną z największymi jednostkami gęstymi.