Rozmiar pliku z modelem ma się do zużycia pamięci mniej więcej tak, jak lista zakupów do wielkości kuchni. Możesz upchnąć w lodówce składniki na obiad dla dwunastu osób, ale jeśli Twój blat jest wielkości deski do krojenia, i tak nie ugotujesz. Dlatego scenariusz „plik waży 17 GB, karta ma 32 GB, więc wejdzie z zapasem” kończy się komunikatem CUDA out of memory częściej, niż ktokolwiek się przyznaje.
Ten tekst jest listą modeli, które w 2026 roku faktycznie zmieszczą się na jednej karcie — razem z liczbami, których nie zobaczysz na pierwszym ekranie karty modelu. Bez „to zależy od Twoich potrzeb” na końcu.
Jeśli nie chce Ci się czytać całości
Weź Qwen3.8-27B. To dziś najlepszy model ogólny na 32 GB i w dziewięciu przypadkach na dziesięć na nim się skończy. Gemma 4 31B jest lepsza w obrazie, ale mieszka na karcie kątem. Ministral 3 14B bierzesz wtedy, gdy zamiast jednego dużego modelu potrzebujesz trzech usług naraz. Reszta artykułu to uzasadnienie i liczby.
Skąd znikają gigabajty, których nie widać w pliku?
32 GB VRAM to obecnie najciekawszy próg w lokalnym AI. Karta w tej klasie uruchomi model 27–31B, porządny model wizyjny albo wyspecjalizowany model rozumujący — bez wysyłania promptów, umów i skanów do cudzego API. Problem w tym, że wagi modelu to tylko część rachunku.
Reszta rozchodzi się na cztery pozycje. Największa z nich to KV cache, czyli bufor kontekstu, który rośnie liniowo z długością rozmowy. Do tego dochodzą bufory obliczeniowe CUDA, sam kontekst i — w modelach multimodalnych — osobny projektor obrazu, w części backendów wczytywany z oddzielnego pliku.
Typowy przebieg wypadków wygląda tak: wrzucasz czterdziestostronicową umowę, model odpowiada na pierwsze pytanie, na drugie też, a przy trzecim — gdy kontekst urósł z 8 do 20 tysięcy tokenów — proces umiera w połowie generowania. Wagi się nie zmieniły. Urósł bufor.
Dlatego wszystkie liczby poniżej zakładają jeden, powtarzalny scenariusz: jedna karta z 32 GB, pełny offload bez ani jednej warstwy na CPU, batch size 1, kwantyzacja w okolicach Q4_K_M lub Q4_0 QAT, kontekst roboczy około 8K tokenów i świeży backend — llama.cpp, vLLM, SGLang albo runtime producenta.
Pięć modeli, które naprawdę wejdą na jedną kartę
| Model | Parametry | Do czego | Kwantyzacja | VRAM przy ~8K |
|---|---|---|---|---|
| Qwen3.8-27B | 27B LM | obraz / chat / rozumowanie | Q4_K_M | ok. 21–24 GB |
| Gemma 4 31B | 30,7B | obraz / rozumowanie | Q4_0 QAT | ok. 26–30 GB |
| Qwen3.6-27B | 27B LM | chat / kodowanie | Q4_K_M | ok. 20–23 GB |
| Ministral 3 14B Instruct | 13,5B + 0,4B vision | chat, RAG, automatyzacje | Q4_K_M | ok. 11–14 GB |
| Ministral 3 14B Reasoning | 13,5B + 0,4B vision | matematyka, STEM, kod | Q4_K_L / Q4_K_M | ok. 11–14 GB |
Uwaga metodologiczna — skąd te liczby
Zakresy VRAM to wartości planistyczne wyprowadzone z rozmiarów oficjalnych kwantyzacji i typowego narzutu wykonawczego, a nie wyniki naszych benchmarków na Twoim sprzęcie. Obejmują wagi, bufory i około 8K kontekstu. Traktuj je jako punkt wyjścia do planowania, nie jako obietnicę.
Qwen3.8-27B — jeśli masz miejsce tylko na jeden model, weź ten
Gęsty model multimodalny z 27 miliardami parametrów językowych: tekst, obrazy, wideo, tryb rozumowania i natywne okno 262 144 tokenów. Producent celuje nim w kodowanie, research i długie zadania agentowe — i akurat w tym przypadku marketing pokrywa się z rzeczywistością.
Standardowy Q4_K_M waży 16,8 GB. Doliczając projektor obrazu i narzut wykonawczy, rezerwuj minimum 21 GB. Na karcie 32 GB zostaje realny margines na kontekst, a nie teoretyczny.
Jedno zastrzeżenie, które powtarzam każdemu klientowi: obsługa 262K to nie to samo, co możliwość użycia 262K. Do naprawdę długiego kontekstu potrzebujesz skwantyzowanego KV cache, niższego kwantu wag albo po prostu innej karty. Deklarowane okno kontekstowe jest jak deklarowany zasięg samochodu elektrycznego — istnieje, tylko nie zimą i nie na autostradzie.
Gemma 4 31B — świetna, ale mieszka na karcie kątem
Model Google DeepMind, 30,7 mld parametrów, kontekst 256K, hybrydowa uwaga i naprawdę mocny profil w zadaniach wizyjnych oraz rozumowaniu. Wagi w Q4_0 to około 17,5 GB — wobec 69,9 GB dla pełnego BF16.
I tu robi się nieprzyjemnie. Nieskompresowany KV cache potrafi zabrać kilka kolejnych gigabajtów już przy 8K kontekstu, przez co realne zapotrzebowanie ląduje w okolicach 26–30 GB. Na karcie 32 GB to nie jest komfortowe wdrożenie, tylko ciasne. Zaczynaj od Q4_0 QAT, 4–8K kontekstu i batch size 1, a kontekst podnoś dopiero wtedy, gdy zobaczysz wolne miejsce w nvidia-smi.
Bierz ją wtedy, gdy analiza obrazu jest sednem Twojej aplikacji, a nie miłym dodatkiem. W każdym innym przypadku Qwen3.8 da Ci 90% tej jakości przy znacznie spokojniejszym śnie.
Qwen3.6-27B — dla tych, którzy nie lubią niespodzianek
Poprzednik Qwen3.8: te same 27B, ta sama multimodalność, ten sam kwant 16,8 GB plus 0,86 GB projektora obrazu. Jest odrobinę słabszy, ale ma lepiej wydeptane ścieżki wdrożeniowe — więcej sprawdzonych kwantyzacji, więcej gotowych konfiguracji, mniej niespodzianek przy aktualizacji backendu.
Rozsądny wybór, jeśli budujesz coś, co ma działać w produkcji przez rok, a nie coś, czym chcesz się pochwalić na konferencji.
Ministral 3 14B — mały, szybki, zostawia miejsce na resztę stacku
Tu zmienia się cała logika wdrożenia. Ministral w Q4_K_M waży 8,2–8,7 GB, a wariant Reasoning w Q4_K_L około 8,74 GB. Na karcie 32 GB to oznacza, że model przestaje być jedynym lokatorem.
Możesz obok niego postawić model embeddingowy, reranker i jeszcze zostawić miejsce na porządny kontekst — czyli kompletny lokalny RAG na jednym GPU, zamiast jednego wielkiego modelu, który zjada całą pamięć i każe czekać. Mistral podaje, że nawet pełny checkpoint BF16 mieści się w 32 GB, co przy tej klasie modeli jest rzadkością.
Rodzina ma dwa warianty i wybór między nimi jest prosty. Instruct to koń roboczy do czatu, JSON-a, function callingu i automatyzacji w n8n czy Make — wszędzie tam, gdzie opóźnienie boli bardziej niż ostatni punkt procentowy w benchmarku. Reasoning jest dostrojony do matematyki, STEM-u i zadań wieloetapowych; nie wygra jakością z Qwen3.8, ale ma najlepszy w tej stawce stosunek rozumowania do zajętej pamięci.
Nie udawajmy: to nie są modele o najwyższej jakości w zestawieniu. Są za to modelami, które pozwalają obsłużyć kilku użytkowników naraz bez kolejki.
MoE: dlaczego 35B nagle mieści się w 32 GB i gdzie jest haczyk
Architektura Mixture of Experts aktywuje przy każdym tokenie tylko część ekspertów. Model ma 35 miliardów parametrów na papierze, ale przy generowaniu jednego słowa pracują trzy. Opisywałem ten mechanizm szerzej przy okazji analizy RTX 5090 — w skrócie to firma z recepcjonistką, która przekazuje sprawę dwóm właściwym specjalistom, zamiast zwoływać naradę całego działu.
Efekt: wyraźnie więcej tokenów na sekundę. Haczyk: to nie zmniejsza zapotrzebowania na pamięć ani o gigabajt. Recepcjonistka musi mieć wszystkich specjalistów w budynku, nawet jeśli w danej chwili pracuje dwóch.
Google mówi to zresztą wprost w dokumentacji Gemmy: mimo aktywacji około 4B parametrów wszystkie 26B muszą siedzieć w pamięci, żeby routing był szybki. Warto to zacytować każdemu, kto liczy VRAM według parametrów aktywnych.
| Model MoE | Parametry (całk. / aktywne) | Do czego | Kwant | VRAM przy ~8K |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | 35B / 3B | chat, obraz, rozumowanie | Q4_K_M | ok. 24–28 GB |
| Gemma 4 26B-A4B | 25,2B / 3,8B | obraz, rozumowanie | Q4_K_M / Q4_0 QAT | ok. 21–25 GB |
| GLM-4.7-Flash | ok. 30B / 3B | chat, kod, agenci | Q4_K_M | ok. 22–25 GB |
| Qwen3-VL-30B-A3B | 30B / ok. 3B | OCR, GUI, wideo | Q4_K_M | ok. 23–27 GB |
| Nemotron-3-Nano-30B-A3B | 30B / 3,5B | długie zadania agentowe | Q4_0 / Q4_K | ok. 22–26 GB |
Z tej piątki dwie pozycje wyróżniają się na tyle, że warto poświęcić im więcej niż wiersz w tabeli.
GLM-4.7-Flash to tekstowy MoE bez obsługi obrazu, za to szybki: 64 ekspertów routowanych, czterech aktywnych na token, Q4_K_M w okolicach 18,3 GB. Jeśli budujesz agenta, który czyta kod i wywołuje narzędzia, a nie ogląda zdjęć, płacenie pamięcią za nieużywany moduł wizyjny nie ma sensu. To najlepszy wybór na czystą przepustowość.
Qwen3-VL-30B-A3B jest jego przeciwieństwem — wyspecjalizowany w obrazie: OCR w 32 językach, długie wideo, analiza interfejsów desktopowych i mobilnych, rozumowanie przestrzenne. Plik Q4_K_M waży 18,6 GB, ale przy planowaniu dolicz koszt tokenów wizualnych, bo obrazy potrafią zjeść kontekst szybciej, niż się spodziewasz. Jeśli Twój przypadek użycia to skany faktur i zrzuty ekranu, ten model bije modele ogólne.
Pozostała trójka to solidne konie robocze. Qwen3.6-35B-A3B (Q4_K_M, ~20 GB) jest najbardziej wszechstronny i stanowi rozsądną alternatywę dla Qwen3.8-27B, jeśli zależy Ci na niższym koszcie obliczeń. Gemma 4 26B-A4B (~17 GB) to lżejsza siostra Gemmy 31B, która nie mieszka już kątem. Nemotron-3-Nano (~18,2 GB) łączy warstwy Mamba-2, klasyczną uwagę i MoE, i sprawdza się w długich workflow agentowych — z tym samym zastrzeżeniem co zawsze: deklarowany kontekst rzędu setek tysięcy tokenów nie przekłada się na kontekst praktyczny.
Co wybrać do konkretnego zadania
- Prywatny czat i RAG: Ministral 3 14B Instruct, jeśli liczy się szybkość i miejsce na embeddingi. Qwen3.6-27B, jeśli ważniejsza jest jakość odpowiedzi. Jeśli budujesz pod to bazę wiedzy, zobacz, jak uporządkować ją w Obsidianie.
- Dokumenty, PDF-y, wykresy: Qwen3.8-27B. Do wąsko rozumianego OCR i analizy interfejsów — Qwen3-VL-30B-A3B.
- Matematyka, STEM, kod: Qwen3.8-27B albo Gemma 4 31B. Ministral 3 14B Reasoning wtedy, gdy potrzebujesz przepustowości lub kilku usług na jednym GPU.
- Agenci i wysoka przepustowość: GLM-4.7-Flash, jeśli obraz jest zbędny. Qwen3.6-35B-A3B, jeśli potrzebny.
Sześć rzeczy, które robię przed pierwszym promptem
Między „model działa” a „model działa na karcie” jest przepaść, którą widać dopiero w logach. Ta lista bierze się z wdrożeń, w których pierwsze uruchomienie wyglądało poprawnie, a wydajność mówiła coś innego:
- Pobierz kompletny checkpoint i właściwy tokenizer, a dla modeli wizyjnych także zgodny projektor obrazu. Niedopasowany projektor nie wywala błędu — po prostu psuje jakość opisu obrazu, co odkryjesz tydzień później.
- W llama.cpp wymuś pełny offload wszystkich warstw:
-ngl 99. - Przeczytaj log startowy i sprawdź, czy liczba warstw na CPU wynosi zero. To jedyny dowód, jaki masz.
- Zacznij od 4K lub 8K kontekstu i batch size 1. Kontekst podnosisz dopiero wtedy, gdy widzisz wolną pamięć.
- Zostaw 2–4 GB rezerwy. Bufory potrafią chwilowo skoczyć, a OOM w połowie generowania odpowiedzi wygląda przy kliencie fatalnie.
- Gdy zabraknie pamięci, najpierw tnij kontekst albo kwantyzuj KV cache. Obniżanie precyzji wag zostaw na koniec — psuje jakość bardziej niż krótszy kontekst.
I rzecz z pozoru oczywista, o którą i tak pytają klienci na każdym spotkaniu: lokalne uruchomienie nie wymaga API producenta ani połączenia z chmurą. Endpoint zgodny z OpenAI API wystawisz sobie sam przez llama.cpp, vLLM czy SGLang i nie wychodzi on poza Twoją sieć.
Czego nie przeczytasz na karcie modelu
- Maksymalny kontekst to wartość marketingowa. 256K albo 1M wymaga wielokrotnie więcej pamięci niż 32 GB.
- MoE oszczędza obliczenia, nie pojemność. Wszystkie wagi ekspertów i tak muszą wejść do VRAM-u.
- Obraz kosztuje podwójnie. Zdjęcie albo klatka wideo zamieniają się w tokeny wizualne, za które płacisz w KV cache.
- Q4 to nie jeden standard. Q4_0, Q4_K_M, QAT Q4 i W4A16 różnią się rozmiarem, jakością i wsparciem sprzętowym — a nazwy sugerują, że są wymienne.
- Działający model to nie to samo co model na GPU. Jeśli generowanie jest podejrzanie wolne, prawie zawsze winna jest warstwa, która została na procesorze.
Najczęstsze pytania
Jaki lokalny model AI jest najlepszy na kartę z 32 GB VRAM?
Qwen3.8-27B w Q4_K_M. Łączy czat, obsługę obrazu i tryb rozumowania, zajmuje 21–24 GB przy 8K kontekstu i zostawia zapas na KV cache. Jeśli sednem aplikacji jest analiza obrazu — Gemma 4 31B. Jeśli liczy się szybkość i miejsce na dodatkowe usługi — Ministral 3 14B.
Czy rozmiar pliku GGUF to całe zużycie VRAM?
Nie. Do wag dochodzi KV cache rosnący z długością kontekstu, bufory obliczeniowe CUDA, a w modelach multimodalnych osobny projektor obrazu. Przy długim kontekście sam bufor potrafi przekroczyć rozmiar wag, dlatego zostaw 2–4 GB rezerwy.
Czy model MoE zajmuje mniej VRAM niż model dense?
Nie. MoE aktywuje tylko część ekspertów na token, co podnosi liczbę tokenów na sekundę, ale do szybkiego wnioskowania wszystkie wagi muszą być załadowane do pamięci. MoE oszczędza FLOPS, nie pojemność.
Czy na 32 GB VRAM wykorzystam pełne okno kontekstu 256K?
W praktyce nie. Deklarowane 256K, a tym bardziej 1M tokenów, wymaga znacznie więcej pamięci niż 32 GB. Żeby zbliżyć się do długiego kontekstu na jednej karcie, trzeba skwantyzować KV cache, obniżyć kwantyzację wag albo zaakceptować częściowy offload na CPU.
Jak sprawdzić, czy model działa w całości na GPU?
Przeczytaj log startowy backendu. W llama.cpp wymuszasz pełny offload przez -ngl 99, a potem sprawdzasz, czy liczba warstw na CPU wynosi zero. To, że model odpowiada, niczego nie dowodzi — wolno działający model to najczęściej model częściowo na procesorze.
Podsumowanie
Dla jednej karty z 32 GB VRAM wybierz Qwen3.8-27B w Q4. Łączy czat, obraz i rozumowanie, a przy 8K kontekstu zostawia margines, dzięki któremu nie modlisz się przy każdym dłuższym dokumencie. Gemma 4 31B jest dla tych, którzy chcą wycisnąć z karty maksimum jakości wizyjnej i godzą się na pracę bez zapasu. Ministral 3 14B wygrywa wszędzie tam, gdzie zamiast jednego dużego modelu potrzebujesz trzech usług naraz.
W 2026 roku 32 GB VRAM to nie konfiguracja eksperymentalna, tylko platforma produkcyjna pod prywatne modele językowe i wizyjne. Pod jednym warunkiem: że kwantyzację i KV cache traktujesz jak budżet, a nie jak szczegół techniczny.
Jeśli zastanawiasz się, na jakim sprzęcie to postawić, zajrzyj do analizy RTX 5090 i alternatyw dla 32 GB. A jeśli chcesz wpiąć taki model w realne procesy firmowe, opisałem to w tekście o budowaniu pętli agentowych — sprzęt i model to dopiero dwie trzecie układanki.
Chcesz uruchomić prywatny model AI w swojej firmie?
W Otoro dobieramy model do sprzętu i procesu, konfigurujemy pełny offload na GPU, budujemy lokalne bazy wiedzy RAG i automatyzacje — bez wysyłania poufnych danych na zewnątrz.
Skonsultuj wdrożenie lokalnego AI →Źródła — oficjalne karty modeli i kwantyzacje (EN):
- Qwen3.8-27B — oficjalna karta modelu (Hugging Face)
- Qwen3.6-27B oraz Qwen3.6-35B-A3B — karty modeli (Hugging Face)
- Google DeepMind: Gemma 4 Model Card (31B oraz 26B-A4B)
- Google: Gemma 4 — przegląd i wymagania pamięci (Q4_0 vs BF16)
- Mistral AI: Ministral 3 14B Instruct oraz wariant Reasoning
- Z.ai: GLM-4.7-Flash — architektura MoE i karta modelu
- Qwen3-VL-30B-A3B-Instruct — OCR, GUI i długie wideo
- NVIDIA Nemotron-3-Nano-30B-A3B — hybryda Mamba-2 / attention / MoE