Darmowe AI po polsku na komputerze: Bielik, Gemma i sprzęt

Lokalne AI na komputerze to model, który pobierasz raz i uruchamiasz u siebie: bez konta, bez abonamentu i bez wysyłania czegokolwiek do chmury. Najczęściej chodzi o duży model językowy (LLM, z angielskiego large language model), czyli taki, z którym rozmawiasz jak z ChatGPT. Lokalnie działają jednak także inne rodziny modeli: Whisper zamienia mowę na tekst, modele dyfuzyjne pokroju SDXL czy Fluksa generują obrazy, a Stable Audio dźwięk i muzykę. Wszystkie łączy to samo: plik na Twoim dysku i obliczenia na Twoim sprzęcie. Po polsku wypadają dziś naprawdę dobrze, bo mamy własny model Bielik, obok wielojęzycznej Gemmy od Google.

W tym poradniku pokazuję, jak wykorzystać darmowe AI na własnym sprzęcie: od czego zacząć, żeby uruchomić je w kwadrans, które modele lokalne pobrać na początek i jak czytać ich nazwy, żeby nie ściągnąć czegoś, co się nie zmieści. Na koniec odpowiadam na najczęstsze pytanie: jaki sprzęt jest do tego potrzebny i kiedy naprawdę potrzebujesz dedykowanej karty graficznej.

Lokalne modele AI przetestowałem na biznesowym ultrabooku MSI Prestige 14 AI+, który otrzymałem do testów od producenta. To maszyna bez dedykowanej karty graficznej, więc od razu zobaczysz, gdzie leży granica takiego sprzętu.

Testowany sprzęt: MSI Prestige 14 AI+, ultrabook bez dedykowanej karty graficznej
Testowany sprzęt: MSI Prestige 14 AI+, ultrabook bez dedykowanej karty graficznej

Artykuł sponsorowany przez firmę MSI, jednak wybór modeli i wszystkie testy szybkości przeprowadziłem osobiście.

Cały proces, od instalacji przez test Bielika po generowanie obrazów, pokazuję w filmie powyżej.

Do czego przydaje się lokalne AI

Zanim przejdziemy do sprzętu i parametrów, najważniejsze pytanie: co Ty z tego realnie będziesz miał. Oto zadania, które sam wykonuję u siebie, bez wysyłania czegokolwiek na zewnątrz:

  • streszczenie dwudziestostronicowej umowy do pięciu punktów
  • wyciągnięcie kwot i terminów z folderu faktur w formacie PDF
  • przepisanie godzinnego nagrania rozmowy na tekst
  • napisanie maila po polsku, który brzmi jak napisany przez człowieka
  • zadawanie pytań do własnej dokumentacji firmowej
  • wygenerowanie grafiki na potrzeby wpisu
  • stworzenie muzyki i dźwięków tła do własnego projektu

Wszystko to dzieje się na dysku, w oknie zwykłego programu, bez konta i bez licznika zużycia. Żaden model chmurowy nie jest do tego potrzebny.

Trzy powody, dla których warto

Prywatność danych. Umowy, transkrypcje rozmów z klientami, dokumentacja firmowa. Prywatność jest tu najmocniejszym argumentem: lokalny model przetwarza je u Ciebie i nie musisz wysyłać niczego na zewnątrz. Chmura zawsze wymaga przesłania treści na cudzy serwer, a jeżeli pracujesz na danych klientów, to nie kwestia przewrażliwienia, tylko RODO.

Brak opłat za korzystanie. Model wystarczy pobrać raz i pracuje w nieskończoność. Przy zadaniach masowych, jak przepuszczenie dwustu transkrypcji przez streszczenie, różnica w rachunku wobec modelu chmurowego robi się odczuwalna.

Praca offline. Pociąg, samolot, hotelowe Wi-Fi, które ledwo zipie. Lokalny model leży na dysku i nie interesuje go zasięg.

I trzy powody, dla których możesz odpuścić

Uczciwie, bo inaczej pierwsze zetknięcie kończy się rozczarowaniem.

Musisz mieć mocny sprzęt. To bariera, o którą rozbija się najwięcej osób. Potrzebny jest komputer stacjonarny albo laptop, ale nie dowolny: albo wysokiej klasy ultrabook z najnowszym procesorem, albo maszyna z dedykowaną kartą graficzną. Na przeciętnym laptopie sprzed kilku lat model lokalny po prostu nie ruszy i piszę o tym szerzej w dalszej części.

Zużycie prądu. Jeżeli planujesz trzymać model uruchomiony przez całą dobę, na przykład jako asystenta podpiętego do własnych narzędzi, wliczaj to w koszty. Komputer z kartą graficzną pod obciążeniem potrafi pobierać kilkaset watów i przy pracy ciągłej zobaczysz to na rachunku.

Niższa jakość niż w chmurze. Najlepszy lokalny model, jaki uruchomisz u siebie, jest słabszy od najlepszego modelu chmurowego. To się nie zmieniło i szybko nie zmieni. Lokalnie wygrywasz prywatnością, kosztem i dostępnością, nie surową inteligencją.

Tekst, dźwięk, obrazy i wideo: co uruchomisz u siebie

Pięć obszarów, z bardzo różnym progiem wejścia. Przy każdym piszę wprost, na jakim sprzęcie to realnie ruszy.

Pięć obszarów, w których lokalne AI daje radę: dokumenty, transkrypcja, obrazy, muzyka i wideo
Pięć obszarów, w których lokalne AI daje radę: dokumenty, transkrypcja, obrazy, muzyka i wideo

Praca z tekstem i dokumentami

Najdojrzalszy obszar i najmniej wymagający. Streszczanie, przepisywanie, poprawa stylu, wyciąganie danych z dokumentów. Najbardziej praktyczne z zastosowań to rozmowa z własnymi danymi: wskazujesz folder z dokumentami PDF, a model odpowiada na pytania na ich podstawie.

Wystarczy do tego niewielki model, więc ruszy praktycznie na każdym w miarę nowym komputerze. To jest ten obszar, w którym lokalne AI najszybciej zaczyna oszczędzać czas.

Transkrypcja mowy

Modele z rodziny Whisper zamieniają nagranie na tekst z dokładnością, która jeszcze niedawno wymagała płatnej usługi. U mnie to zastosowanie lokalnego AI, po które sięgam najczęściej.

Program Vibe robi to w całości na komputerze: wskazujesz plik, wybierasz język polski i po chwili masz tekst z podziałem na znaczniki czasu, gotowy do wyeksportowania jako napisy albo zwykły dokument. Liczy się na procesorze, w tle, więc w tym czasie możesz normalnie pracować.

Generowanie obrazów

Tu robi się poważnie. Model SDXL potrzebuje od sześciu do ośmiu gigabajtów pamięci, a nowszy Flux w wersji podstawowej od dziesięciu do dwunastu.

Prosty obraz na szybkim modelu powstaje w kilkadziesiąt sekund, ale przy pełnym SDXL albo Fluksie liczy się to już w minutach. To pierwszy obszar, w którym dedykowana karta graficzna zamienia ćwiczenie z cierpliwości w zwykłą pracę.

Generowanie dźwięku i muzyki

Najmniej znany obszar, a robi wrażenie. Do własnej gry generuję muzykę i pętle ambientu lokalnie, modelem Stable Audio 3 w wersji Medium. Cztery warianty jednego motywu, dzień, zmierzch, noc i świt, powstają u mnie na dysku i nigdy nie były w żadnej usłudze chmurowej.

Sam model potrzebuje około sześciu gigabajtów pamięci karty graficznej, u mnie chodzi na karcie z dwunastoma i samo wczytanie zajmuje kilkadziesiąt sekund. Bez dedykowanej karty jest to raczej ciekawostka niż narzędzie do pracy.

Generowanie wideo

Najcięższy przypadek z całej listy i jedyny, przy którym trzeba powiedzieć wprost: na laptopie tego nie zrobisz, niezależnie od tego, jak nowy masz procesor.

Modele wideo z otwartymi wagami, takie jak Wan czy LTX, potrzebują kilkunastu gigabajtów pamięci samej karty graficznej, a kilkusekundowy klip powstaje minutami nawet na mocnym komputerze stacjonarnym. To obszar zarezerwowany dla maszyn z naprawdę wydajną kartą, a przy dłuższych materiałach i tak wygodniej sięgnąć po usługę w chmurze.

Zasada jest prosta: im dalej od czystego tekstu, tym mocniejszego sprzętu potrzebujesz.

Od czego zacząć: program Jan

Do uruchomienia modelu na własnym komputerze nie potrzebujesz terminala ani znajomości programowania. Wystarczy jeden program z normalnym oknem, w którym piszesz tak samo jak w ChatGPT, tylko że wszystko dzieje się na Twoim dysku.

Jan, czyli program, od którego najłatwiej zacząć pracę z modelem lokalnie
Jan, czyli program, od którego najłatwiej zacząć pracę z modelem lokalnie

Najprościej zacząć od Jana. To darmowa aplikacja o otwartym kodzie, na Windowsa, macOS i Linuksa. Trzy rzeczy sprawiają, że jest dobrym pierwszym wyborem:

  • ma wbudowaną wyszukiwarkę modeli. Nie szukasz plików po internecie, tylko wpisujesz nazwę w oknie programu i klikasz pobierz
  • sam podpowiada, co uruchomisz. Sprawdza, ile masz pamięci, i przy każdym wariancie modelu pokazuje rozmiar pliku oraz to, czy wejdzie na Twój sprzęt
  • nie zamyka Cię w jednym programie. Pod spodem pracuje silnik llama.cpp, ten sam, na którym opierają się LM Studio i GPT4All, więc pobrane modele zadziałają także tam

Start zajmuje kwadrans i wygląda tak:

  • pobierz Jana ze strony jan.ai i zainstaluj jak każdy inny program
  • przy pierwszym uruchomieniu pobierz model, który program sam proponuje. Na tym etapie nie kombinuj z wyborem, chodzi o to, żeby zobaczyć, jak to działa u Ciebie
  • zadaj pierwsze pytanie i sprawdź, czy tempo odpowiedzi Ci odpowiada
  • dopiero potem pobierz model dobrany pod swoje zadania, o czym za chwilę

Tyle wystarczy, żeby zacząć. Cała reszta tego tekstu to dobieranie modelu i sprzętu do tego, co faktycznie chcesz robić.

Bardziej zaawansowani sięgają po Ollamę. Pozwala ona uruchomić modele w tle i udostępnić je innym programom, na przykład narzędziu do notatek czy własnej automatyzacji. To już zastosowanie zaawansowane: daje większą kontrolę, ale konfiguracja wymaga pracy w terminalu.

Lokalne modele AI, od których warto zacząć

Nie ma sensu zaczynać od przeglądania setek nazw. Na start wystarczą dwa modele, jeden do polskiego i jeden do wszystkiego innego. Oba zainstalujesz w kilka minut i oba będą działać lokalnie, bez konta i bez sieci.

Bielik, polski model językowy od zespołu SpeakLeash, otwarty na testowanym laptopie
Bielik, polski model językowy od zespołu SpeakLeash, otwarty na testowanym laptopie

Gemma 4, uniwersalny model na co dzień

Model od Google, wielojęzyczny, dostępny w kilku rozmiarach. Wariant E4B waży około pięciu gigabajtów w kwantyzacji Q4, obsługuje ponad 140 języków i ma 128 tysięcy tokenów kontekstu, więc nadaje się na laptopa bez kompromisów. Wariant 12B jest wyraźnie mądrzejszy i to on jest moim codziennym wyborem, jeżeli tylko sprzęt pozwala.

Pełna nazwa do wyszukiwarki modeli: `unsloth/gemma-4-12b-it-GGUF`

Bielik v3, czyli polskie AI, które rozumie polski

Bielik to polski model językowy od zespołu SpeakLeash i dla polskiego użytkownika zmienia najwięcej. Najnowsza rodzina, oznaczona jako v3, dostępna jest w kilku rozmiarach, od 1,5 miliarda parametrów do 11 miliardów.

Na laptopa najlepszy jest wariant 11B w kwantyzacji Q4. Waży nieco ponad sześć gigabajtów, obsługuje 32 języki europejskie i został wytrenowany na ponad dwudziestu milionach instrukcji. Najważniejsze jest jednak to, czego nie widać w liczbach: Bielik był optymalizowany pod język polski, łącznie z własnym tokenizerem, więc nie tłumaczy w głowie z angielskiego. Przy pismach, mailach do klienta czy redakcji tekstu różnica wobec modeli wielojęzycznych jest wyraźna, zwłaszcza w odmianie.

Pełna nazwa do wyszukiwarki modeli: `speakleash/Bielik-11B-v3.0-Instruct-GGUF`, wariant Q4_K_M

Wpisz tę nazwę w wyszukiwarkę modeli w Janie, wybierz wariant Q4_K_M i po kilku minutach rozmawiasz z modelem po polsku. Co dokładnie znaczą te wszystkie skróty w nazwie pliku, wyjaśniam w następnej części.

Pozostałe modele, gdy te dwa przestaną wystarczać

  • Gemma 4 E2B, około dwóch gigabajtów. Najmniejszy sensowny lokalny model AI, wchodzi praktycznie wszędzie
  • gpt-oss 20B, około czternastu gigabajtów. Model OpenAI z otwartymi wagami, mocny w rozumowaniu
  • Qwen3 Coder 30B, około dziewiętnastu gigabajtów. Do kodu, wymaga już poważnej pamięci
  • Qwen3.6 35B-A3B, około dwudziestu trzech gigabajtów. Dziś najczęściej polecany model dla tych, którzy mają czym go uruchomić

Przy tym ostatnim warto się zatrzymać, bo dobrze pokazuje, w którą stronę to wszystko idzie. Mimo 35 miliardów parametrów przy każdym słowie pracuje tylko około trzech miliardów, więc odpowiada z prędkością małego modelu, a wie tyle, co duży. Do tego 256 tysięcy tokenów kontekstu, czyli spokojnie kilkaset stron naraz. Potrzebuje jednak około 23 gigabajtów pamięci, więc na ultrabooku go nie uruchomisz.

Wszystkie powyższe to modele typu LLM, czyli duże modele językowe pracujące na tekście, wytrenowane do przewidywania kolejnych słów. Osobną kategorią jest Whisper w wersji large-v3, który nie służy do rozmowy, tylko zamienia mowę na tekst.

Jak czytać nazwy modeli i nie pobrać za dużego

Nazwy modeli wyglądają jak kod z tablicy rejestracyjnej i to jest moment, w którym najwięcej osób odbija się od tematu. Groźne przestają być, kiedy raz rozbierzesz jedną z nich na części. W zapisie gemma-4-12b-it-Q4_K_M masz po kolei: rodzinę modelu, jej wersję, liczbę parametrów, tryb rozmowy i poziom kompresji.

Nazwa modelu rozłożona na części
Nazwa modelu rozłożona na części

Do tego Jan przy każdym wariancie pokazuje rozmiar pliku w gigabajtach, więc jednym spojrzeniem sprawdzisz, czy model zmieści się w pamięci Twojego komputera. Warto jednak wiedzieć, skąd te liczby się biorą, a do tego wystarczą trzy pojęcia.

Wielkość modelu. Zapis 11B oznacza jedenaście miliardów parametrów. Im większa liczba, tym model mądrzejszy i tym więcej pamięci zajmuje. To właśnie ta liczba decyduje, czy uruchomisz model u siebie.

Kwantyzacja. To kompresja modelu. Oznaczenie Q4 jest dziś standardem: model chudnie mniej więcej czterokrotnie, a jakość spada na tyle nieznacznie, że w normalnej pracy tego nie zauważysz. Bez kwantyzacji lokalne AI w ogóle nie miałoby sensu na sprzęcie domowym.

Pamięć. Model musi zmieścić się w pamięci w całości. Na karcie graficznej to VRAM, czyli pamięć własna karty. W laptopie bez dedykowanej karty układ graficzny nie ma swojej pamięci i dzieli się nią z systemem.

Praktyczna reguła, która wystarcza w dziewięciu przypadkach na dziesięć: model w Q4 waży w gigabajtach mniej więcej połowę liczby swoich miliardów parametrów. Model 14B to około dziewięciu gigabajtów. Ta reguła wystarczy, żeby ocenić, czy model lokalny w ogóle wejdzie na Twój sprzęt.

Do tego jedna miara wyniku: tokeny na sekundę. Token to mniej więcej pół polskiego słowa. Poniżej 10 tokenów na sekundę praca robi się męcząca. Kilkanaście to mniej więcej tempo czytania i przy tej wartości korzysta się z modelu normalnie. Powyżej 30 odpowiedź pojawia się szybciej, niż zdążysz ją przeczytać.

Jaki model uruchomiłem na MSI Prestige 14 AI+

Sprzęt: MSI Prestige 14 AI+ D3MG. Intel Core Ultra X7 358H, grafika Intel Arc B390 z dwunastoma rdzeniami Xe3, NPU o wydajności 50 TOPS, 32 GB pamięci LPDDR5X, ekran 14 cali OLED. Biznesowy ultrabook, sprzęt kupowany przede wszystkim do pracy i z myślą o mobilności.

Testowany sprzęt: Core Ultra X7 i grafika Intel Arc, bez dedykowanej karty graficznej
Testowany sprzęt: Core Ultra X7 i grafika Intel Arc, bez dedykowanej karty graficznej

Wszystko, co opisuję niżej, robiłem w aplikacji Jan, na modelach w kwantyzacji Q4, bez podkręcania czegokolwiek w ustawieniach. Jan liczył na backendzie Vulkan, czyli tym, który program sam wskazuje dla grafiki Intela.

Ten laptop nie ma dedykowanej karty graficznej. Ma zintegrowaną Arc B390, która nie dysponuje własną pamięcią: korzysta ze współdzielonej pamięci LPDDR5X, tej samej, z której korzysta procesor. Dlatego mówię tu o RAM, bo te 32 GB to jedyna pula pamięci w tym komputerze i to ona wyznacza sufit modeli. Model nie był przy tym dzielony między grafikę a procesor: mieścił się w całości i liczył go Arc B390. Rozpisuję to dokładniej w dalszej części, przy okazji doboru sprzętu.

Dlaczego to w ogóle działa. O prędkości decyduje przepustowość pamięci, a ta w Panther Lake jest wysoka jak na cienki laptop. Procesor obsługuje LPDDR5X do 9600 MT/s, co daje maksymalnie około 153 GB/s, a w praktyce, przy kościach montowanych w laptopach tej klasy, mówimy o okolicach 130-150 GB/s. Dla porównania: dwukanałowy DDR4-3200 w typowym desktopie to około 51 GB/s, DDR5-5600 około 90 GB/s, a karta pokroju RTX 4060 ma 272 GB/s. Ultrabook jest więc wyraźnie bliżej desktopowego RAM niż karty graficznej, ale dwa razy szybszy od starszych konstrukcji.

Co to znaczy w praktyce. Gemma 4 12B w kwantyzacji Q4, czyli plik 6-7 GB, daje na tym laptopie 12-14 tokenów na sekundę. Tekst pojawia się więc nieco szybciej, niż zdążysz go przeczytać. Krótka odpowiedź na kilka zdań to kilkanaście sekund, pełna strona tekstu to około minuty. Modele w chmurze są kilka razy szybsze i nie ma co tego ukrywać.

Stąd biorą się te 85 sekund na podsumowanie dwóch faktur w filmie: model musi najpierw przeczytać oba pliki, a dopiero potem zaczyna pisać tabelę. To są realne czasy z tej maszyny, bez przyspieszonego montażu. Jeżeli masz komputer z RTX-em, Twoje będą krótsze.

Bielik 11B, czyli plik nieco ponad sześć gigabajtów, zachowywał się podobnie. Oba modele mieszczą się tu w pamięci w całości i w tym tkwi cały sekret: dopóki model się mieści, cienki laptop radzi sobie bez problemu.

Osobno sprawdziłem generowanie obrazów. Jeden obraz w rozdzielczości 1080 na 1080 pikseli, na szybkim modelu z rodziny turbo, powstał w około czterdzieści sekund. Przy pełnym SDXL albo Fluksie w wersji podstawowej mówimy już o minutach na obraz, i to jest pierwszy moment, w którym dedykowana karta graficzna naprawdę zmienia komfort pracy.

Ważne zastrzeżenie

Jeżeli masz laptopa ze starszą grafiką zintegrowaną i wolniejszą pamięcią, lokalne AI będzie działać znacznie wolniej niż na nagraniu. Arc B390 to obecnie najmocniejsza zintegrowana grafika Intela, więc nie jest punktem odniesienia dla sprzętu sprzed kilku lat. Tam realnie zejdź do modeli 4B i 8B.

Powyższe liczby dają Ci kierunek, ale ostateczną odpowiedź da tylko Twoja maszyna. Najprostsza metoda: zainstaluj Jana i przetestuj konkretny model u siebie. Program przy każdym modelu pokazuje, czy zmieści się na Twoim sprzęcie, ostrzeżeniem o wolnym działaniu albo czerwonym krzyżykiem, a pod odpowiedzią podaje realną liczbę tokenów na sekundę. Zacznij od modelu 8B, sprawdź prędkość, a potem próbuj wyżej. Zajmie to kwadrans i będzie warte więcej niż każda tabelka, bo Jan liczy możliwości Twojej konkretnej maszyny, a nie średnią z internetu.

Jakiego sprzętu potrzebujesz do AI?

Jak działa lokalny model i dlaczego wszystko rozbija się o pamięć

Model to jeden duży plik na dysku. Żeby z niego skorzystać, program musi wczytać go w całości do pamięci, a potem przy każdym słowie odpowiedzi przeliczyć całą jego zawartość. Dlatego, żeby przetwarzać tekst szybko, liczy się nie tyle surowa moc obliczeniowa, ile ilość pamięci i szybkość, z jaką procesor albo karta graficzna potrafi ją czytać.

Droga modelu od pliku na dysku do odpowiedzi na ekranie
Droga modelu od pliku na dysku do odpowiedzi na ekranie

Wynika z tego prosta zasada: jeżeli model mieści się w pamięci, działa szybko. Jeżeli się nie mieści, część ląduje w wolniejszej pamięci systemowej i prędkość spada kilkukrotnie.

Dlaczego zintegrowana grafika zwykle nie wystarcza i dlaczego ten laptop jest wyjątkiem

Zacznę od rzeczy, którą trzeba powiedzieć wprost: zintegrowana grafika przez lata była dla lokalnego AI ślepą uliczką. Jeżeli masz laptopa sprzed kilku lat z układem graficznym wbudowanym w procesor, modele językowe będą na nim działać na tyle wolno, że szybciej wykonasz zadanie ręcznie. To się nie zmieniło i nie warto na tym tracić czasu.

Testowany Prestige jest wyjątkiem z dwóch konkretnych powodów. Pierwszym jest procesor Intel Core Ultra X7 358H, czyli najnowsza generacja układów Intela do laptopów. Drugim, ważniejszym, jest grafika Intel Arc B390: najmocniejszy obecnie zintegrowany układ graficzny Intela, zbudowany na dwunastu rdzeniach Xe3. To nie jest grafika dodana po to, żeby obraz się wyświetlił, tylko układ, który realnie liczy.

Do tego dochodzi 32 GB pamięci LPDDR5X, którą procesor dzieli z grafiką. W praktyce oznacza to, że mniejsze modele nie tylko się tu mieszczą, ale działają na tyle sprawnie, że da się ich używać do realnej pracy: streszczania dokumentów, transkrypcji, porządkowania notatek, pomocy przy pisaniu.

RAM czy VRAM: co naprawdę decyduje

W filmie pokazuję, jak sprawdzić w Janie, czy model zadziała na Twojej maszynie. Poniżej rozwijam temat dla tych, którzy chcą rozumieć, co się dzieje pod spodem, bo w materiale dla początkujących nie było na to miejsca.

Model dzieli się na warstwy: co nie zmieści się w pamięci karty, ląduje w RAM i liczy się wolniej
Model dzieli się na warstwy: co nie zmieści się w pamięci karty, ląduje w RAM i liczy się wolniej

RAM jest ważny, bo decyduje, czy model w ogóle się załaduje. Jeżeli jednak masz dedykowaną kartę graficzną, to najpierw liczy się VRAM, czyli pamięć własna karty.

Działa to tak: model dzieli się na warstwy. Tyle warstw, ile zmieści się w VRAM, ląduje na karcie, a reszta zostaje w zwykłym RAM i liczy je procesor. Każda odpowiedź przechodzi przez wszystkie warstwy, więc tempo dyktuje ta wolniejsza część. Karta nadal pomaga, ale nawet ćwierć modelu poza VRAM potrafi spowolnić pracę kilkukrotnie. Skala zależy od silnika: Jan pracuje pod spodem na llama.cpp, gdzie taki podział warstw kosztuje sporo. Nie zobaczysz przy tym żadnego błędu, model po prostu zacznie działać znacznie wolniej. Do tego kontekst rozmowy również zajmuje VRAM i rośnie w trakcie, więc przy długiej rozmowie miejsca ubywa.

Ile to waży, na przykładzie Gemmy z filmu. Gemma 4 12B to dwanaście miliardów parametrów. Kwantyzacja decyduje, ile bitów przypada na jeden parametr, i to ona ustala rozmiar pliku:

  • Q4 to około 6-7 GB, czyli wariant, który pobieram w filmie
  • Q5 to około 8 GB
  • Q8 to około 12,5 GB
  • bez kwantyzacji to około 24 GB

Do tego dolicz 1-2 GB na kontekst. Ta sama Gemma zmieści się więc na karcie z 8 GB pamięci w wariancie Q4, ale w Q8 już nie. Jeżeli masz kartę z 8 GB VRAM, bierz Q4.

W skrócie, licząc pamięcią karty graficznej:

  • 8 GB VRAM to modele do 8B oraz 12B w kwantyzacji Q4
  • 12-16 GB VRAM to modele 12-14B, w praktyce najlepszy kompromis
  • 24 GB VRAM to modele 27B w Q4, choć przy długim kontekście robi się ciasno

Pamięć współdzielona, czyli trzeci wariant

Powyższy podział na RAM i VRAM zakłada, że masz dedykowaną kartę graficzną z własną pamięcią. Coraz częściej spotkasz jednak trzeci układ: pamięć współdzieloną, nazywaną też zunifikowaną (po angielsku unified memory). Tak działają nowe procesory Intela i AMD do laptopów oraz układy Apple z serii M.

W takiej konstrukcji jest jedna pula pamięci, a procesor i grafika sięgają do niej razem. Nie ma więc kopiowania modelu z RAM do VRAM ani dzielenia go na dwie części, a sufit wyznacza po prostu ilość pamięci w komputerze. To dlatego ultrabook z 32 GB potrafi wczytać model, który nie zmieści się na karcie z 8 GB.

Cena tego rozwiązania jest jedna: przepustowość. Pamięć w laptopie jest wolniejsza od pamięci wlutowanej w kartę graficzną, więc model się zmieści i policzy, ale wolniej. To kompromis, nie darmowy obiad.

Do czego służy NPU i czy naprawdę pomaga?

Prestige ma NPU piątej generacji o wydajności 50 TOPS i naklejkę Copilot+. Marketing tego nie mówi, więc powiem ja: popularne programy do lokalnych modeli językowych, w tym Jan i Ollama, nie liczą na NPU. Liczą na procesor i na układ graficzny.

CPU, grafika i NPU w jednym układzie. Model językowy korzysta z dwóch pierwszych
CPU, grafika i NPU w jednym układzie. Model językowy korzysta z dwóch pierwszych

NPU robi co innego i robi to dobrze: rozmycie tła i korekcja wzroku na kamerze, napisy na żywo, transkrypcja, część efektów w programach kreatywnych. Jego przewagą nie jest szybkość, tylko pobór prądu. Zadanie, które na procesorze zjada baterię, na NPU idzie w tle niemal za darmo.

Odpowiedź brzmi więc: pomaga, ale nie tam, gdzie większość osób się tego spodziewa. O szybkości modelu językowego decyduje przede wszystkim przepustowość pamięci, a nie liczba TOPS w układzie NPU. Jeżeli ktoś kupuje laptopa z NPU, licząc na to, że dzięki temu uruchomi większy model, kupuje z błędnego powodu.

Kiedy potrzebna jest dedykowana karta graficzna i na co patrzeć przy jej wyborze

Nie ma sensu udawać, że ultrabook zastąpi komputer z dedykowaną kartą graficzną, jeżeli lokalny model ma pracować codziennie. Karta ma własną, znacznie szybszą pamięć i wielokrotnie więcej jednostek obliczeniowych, więc większe modele będą na niej działać wyraźnie szybciej.

Dlatego jeżeli AI ma być Twoim głównym narzędziem pracy i zależy Ci na większych modelach, celuj w komputer z dedykowaną kartą wyposażoną w co najmniej szesnaście gigabajtów własnej pamięci. Taki sprzęt pozwoli komfortowo uruchamiać modele średniej wielkości. Prestige jest natomiast bardzo dobrym wyborem dla kogoś, kto pracuje w trasie i chce mieć dobrą wydajność do pracy oraz okazjonalnie uruchomić lokalne AI do mniejszych zadań.

Przy wyborze karty obowiązuje jedna zasada, ważniejsza od wszystkich benchmarków: liczy się ilość pamięci, nie wydajność w grach. GPU o trzydzieści procent szybsze w grach, ale z ośmioma gigabajtami zamiast szesnastu, będzie do modeli AI po prostu gorsze. Model albo się mieści, albo nie. To nie jest płynne pogorszenie, to jest ściana. Sprzęt dobieraj więc pod model, który chcesz uruchomić, a nie pod wyniki w grach.

Poza pamięcią samej karty liczy się jeszcze pamięć RAM w komputerze: przy szesnastu gigabajtach większe modele zaczynają działać z zadyszką, przy 32 GB robi się swobodnie. 32 GB to dziś dobra ilość na start i przy modelach do kilkunastu miliardów parametrów w zupełności wystarczy. Jeżeli celujesz wyżej, w modele 30B i większe, planuj 64 GB, zwłaszcza przy pamięci współdzielonej, gdzie z tej samej puli korzysta również grafika.

Na koniec jedno uściślenie, bo bywa to przekręcane. Grafika Arc B390 w laptopie korzysta z architektury Xe3, czyli z rozwinięcia Xe2, na której Intel zbudował dedykowane karty Arc serii B. To bliska rodzina, ale nie ten sam układ: karty do komputerów wciąż opierają się na Xe2, a dedykowanych kart na Xe3 nie ma jeszcze w sprzedaży. Dla lokalnego AI i tak ważniejsze jest co innego niż nazwa architektury: ile pamięci ma Twój sprzęt i jak szybka ona jest.

Podsumowanie: jak zacząć pracę z lokalnym AI

Jeżeli chcesz sprawdzić, czy lokalne AI jest dla Ciebie, i masz najnowszego ultrabooka pokroju testowanego MSI Prestige 14 AI+, śmiało spróbuj. Mniejsze modele ruszą i zrobią to na baterii, offline i bez wysyłania czegokolwiek na zewnątrz.

Jeżeli masz starszego laptopa ze zintegrowaną grafiką, odpuść sobie. Nie uruchomisz na nim żadnego sensownego modelu i skończy się to wyłącznie straconym wieczorem. Komputer stacjonarny z dedykowaną kartą wyposażoną w minimum 12 GB VRAM da Ci już zdecydowanie większy komfort pracy, a lokalny model AI przestanie być kompromisem. A jeżeli marzą Ci się największe dostępne modele, to szykuj się na wydatek naprawdę poważny.

Dobra wiadomość jest taka, że ta dziedzina zmienia się bardzo szybko. Modele są z miesiąca na miesiąc lepiej optymalizowane i potrafią coraz więcej przy tych samych wymaganiach, a rzeczy, które jeszcze niedawno wymagały serwerowni, dziś uruchamiam na laptopie w pociągu. Pełne wejście lokalnego AI do codziennej pracy jest dopiero przed nami, ale kierunek jest przesądzony. Warto sprawdzić już teraz, jak to działa u Ciebie.

Narzędzia i modele z filmu

Programy

  • Jan, czat i praca na dokumentach
  • Vibe, transkrypcja offline
  • ComfyUI, generowanie obrazów

Modele na start

Pełną nazwę wklej w wyszukiwarkę modeli w Janie.

  • Polski tekst i pisma: `speakleash/Bielik-11B-v3.0-Instruct-GGUF`, wariant Q4_K_M
  • Codzienne zadania: `unsloth/gemma-4-12b-it-GGUF`
  • Transkrypcja: Whisper large-v3, w aplikacji Vibe

Sprzęt

Testowany laptop: MSI Prestige 14 AI+, Intel Core Ultra X7 358H, Intel Arc B390, 32 GB RAM, 1 TB SSD, ekran OLED.

Cała seria: MSI Prestige w sklepie producenta

Źródła

Dane techniczne w tekście pochodzą z oficjalnych kart modeli i materiałów producentów:

Obserwacje na temat szybkości pochodzą z mojej własnej pracy na sprzęcie opisanym w tekście.

Materiał powstał we współpracy z firmą MSI. Sprzęt do testów udostępnił producent. Wyniki pomiarów i wnioski są moje własne.

Podobne wpisy

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *