Modele lokalnie
9 cze 2026 · RS Management
W skrócie
- Sprzęt do lokalnych modeli układa się w cztery wyraźne progi.
- O opłacalności rzadko rozstrzyga prąd. Rozstrzyga amortyzacja sprzętu i czas osoby, która musi go utrzymać, a te pozycje wypadają z rachunku najczęściej.
- Wzrost cen pamięci w 2026 przesunął granicę na korzyść API, więc kalkulacje sprzed roku wymagają przeliczenia od nowa.
Pytanie o lokalne uruchamianie modeli wraca w niemal każdej rozmowie o wdrożeniu AI, zwykle w formie „czy da się to trzymać u nas”. Da się, i to prościej niż jeszcze dwa lata temu. Warto natomiast wiedzieć, na jakim progu sprzętowym kończą się rzeczy proste, a zaczynają kosztowne.
Cztery progi sprzętowe
| Próg | Pamięć | Co się mieści | Do czego wystarcza |
|---|---|---|---|
| Laptop lub komputer bez karty | 16-32 GB pamięci | modele skwantyzowane 4-14 mld parametrów | klasyfikacja, przepisywanie tekstu, prosta ekstrakcja |
| Komputer z kartą graficzną | 24-32 GB pamięci karty | modele 30B lekko skompresowane, 70B mocno | asystent kodu, streszczanie, wyszukiwanie po bazie wiedzy |
| Stacja z kartą profesjonalną | 96 GB z korekcją błędów | te same modele, ale w pracy ciągłej | praca całodobowa bez szukania przyczyny rozjeżdżających się wyników |
| Pamięć wspólna procesora i karty | 128-512 GB | modele wymagające kilku kart naraz | eksperymenty z największymi modelami otwartymi |
Zwykły laptop albo komputer, 16 do 32 GB pamięci. Bez dedykowanej karty graficznej mieszczą się tu modele skwantyzowane z pierwszego wiersza tabeli. Działają, generują kilka do kilkunastu tokenów na sekundę na procesorze i nadają się do klasyfikacji, przepisywania tekstu, prostej ekstrakcji danych z dokumentów. OpenAI podaje, że gpt-oss-20b uruchamia się w 16 GB pamięci, co dobrze wyznacza górną granicę tego progu. Do rozmowy z człowiekiem w czasie rzeczywistym takie tempo bywa za wolne, do przetwarzania wsadowego w nocy wystarcza w zupełności.
Komputer z kartą graficzną 24 do 32 GB. Mocna karta konsumencka daje 32 GB własnej pamięci i jest to pierwszy próg, na którym modele klasy 30B mieszczą się przy lekkiej kompresji, a modele 70B przy mocnej. Tu zaczyna się użyteczna praca: asystent kodu, streszczanie długich dokumentów, obsługa wyszukiwania po firmowej bazie wiedzy.
Stacja robocza z kartą profesjonalną. Karta profesjonalna daje trzykrotnie więcej pamięci od konsumenckiej i dokłada mechanizm, który sam wykrywa i poprawia przekłamania w pamięci. Różnica nie sprowadza się do samej pojemności: ta korekcja i wsparcie producenta zaczynają mieć znaczenie, gdy maszyna ma pracować całą dobę i nikt nie planuje szukać przyczyny wyników, które raz na jakiś czas wychodzą inaczej.
Maszyny z dużą pamięcią zunifikowaną. Mac Studio z układem M3 Ultra, wprowadzony w marcu 2025, oferował do 512 GB pamięci współdzielonej przez procesor i układ graficzny, więc mieścił modele wymagające na kartach graficznych kilku sztuk sprzętu. NVIDIA DGX Spark realizuje ten sam pomysł na sprzęcie NVIDII, ze 128 GB pamięci koherentnej w obudowie wielkości książki.
Czym to uruchamiać
Warstwa oprogramowania jest dziś prostsza od sprzętu. Większość ekosystemu wyrosła na llama.cpp i bibliotece ggml, z formatem plików GGUF, w którym publikuje się skompresowane modele. Ollama sprowadza uruchomienie modelu do jednej komendy i wystawia API (interfejs programistyczny) zgodne z OpenAI, dzięki czemu podmiana dostawcy w istniejącej aplikacji ogranicza się do zmiany adresu. LM Studio daje podobne możliwości w interfejsie graficznym, z wbudowaną przeglądarką modeli, i sprawdza się u osób, które nie pracują w terminalu. Do obsługi wielu użytkowników naraz właściwym narzędziem jest vLLM, znacznie lepiej wykorzystujący kartę przy równoległych zapytaniach. Drobna uwaga licencyjna, która bywa istotna w korporacji: llama.cpp, Ollama i vLLM są otwarte, LM Studio pozostaje oprogramowaniem zamkniętym.
Ile pamięci zajmie model
Reguła kciuka wystarczająca do planowania opiera się na jednym przeliczeniu: model w pełnej dokładności zajmuje około dwóch bajtów na parametr, a kompresja dzieli tę wartość, kosztem niewielkiego spadku jakości.
| Wariant | Bajty na parametr | Model 30 mld parametrów |
|---|---|---|
| pełna dokładność | ok. 2 | ok. 60 GB |
| ośmiobitowy | ok. 1 | ok. 30 GB |
| czterobitowy | ok. 0,5 | ok. 15 GB |
Do wyniku z tabeli dochodzi jeszcze pamięć podręczna kontekstu, która rośnie razem z długością promptu. Stąd bierze się typowa pomyłka w planowaniu: model mieści się w karcie na papierze, a przestaje się mieścić po wczytaniu kilkudziesięciu tysięcy tokenów kontekstu.
Drugie zaskoczenie dotyczy maszyn z pamięcią zunifikowaną. Pamięci mają dużo, ale przetworzenie długiego promptu przed pierwszym tokenem odpowiedzi trwa na nich zauważalnie dłużej niż na dedykowanej karcie. Przy krótkich zapytaniach różnicy nie widać, przy analizie stustronicowej umowy widać ją aż nadto.
Prąd, ciepło i serwis
Mocna karta graficzna pobiera pod pełnym obciążeniem ok. 575 W, wersja profesjonalna 600 W, a cały komputer potrzebuje zasilacza rzędu 1000 W, czyli mniej więcej tyle co czajnik elektryczny.
Maszyna pracująca osiem godzin dziennie przez dwadzieścia dni w miesiącu zużyje ok. 110 kWh. Przy unijnej średniej dla firm, 18,37 euro za 100 kWh, daje to jakieś 20 euro miesięcznie.1 Prąd rzadko rozstrzyga o wyniku rachunku.
Większy ciężar mają pozostałe konsekwencje. Sześćset watów oddane do niewielkiego pokoju działa jak grzejnik, który latem podnosi temperaturę o kilka stopni i wymusza chłodzenie. Wentylatory pod obciążeniem są słyszalne przez cały dzień. Ktoś musi aktualizować sterowniki, pilnować wersji modeli i reagować, gdy usługa przestaje odpowiadać w piątek po południu. W mniejszej firmie tym kimś zwykle zostaje osoba mająca już komplet innych obowiązków, i to jest koszt, którego nie widać w cenniku sprzętu.
Gdzie leży granica wobec API
Trzy sytuacje, w których lokalne uruchomienie broni się bez naciągania argumentów:
- Dane, które z powodów umownych lub regulacyjnych nie mogą opuścić własnej infrastruktury, przy czym deklaracja dostawcy o regionie przetwarzania i braku retencji często wystarcza i warto to sprawdzić przed zakupem sprzętu.
- Wysoki i stały wolumen zadań prostych: klasyfikacja, ekstrakcja pól z dokumentów, generowanie osadzeń. Koszt jednostkowy przy stałym obciążeniu wychodzi lokalnie wyraźnie niżej.
- Praca bez łącza albo w sieci odciętej od internetu.
W pozostałych przypadkach rachunek zwykle wypada na korzyść API. Przyjmijmy stację roboczą za 25 000 do 40 000 zł amortyzowaną przez trzy lata: wychodzi od 700 do 1 100 zł miesięcznie, zanim ktokolwiek jej użyje, plus prąd, plus czas administracyjny. Jeżeli zespół wydaje dziś na API mniej niż około tysiąca złotych miesięcznie, zakup sprzętu nie zwróci się na samym koszcie, a dodatkowo trzeba pogodzić się z różnicą w jakości. Najlepsze modele o otwartych wagach są dobre, natomiast w zadaniach wymagających długiego wnioskowania wciąż ustępują czołowym modelom dostępnym przez API.
Rok 2026 przesunął ten rachunek
Kalkulację warto zrobić na cenach aktualnych, bo mocno się przesunęły. Ceny pamięci DRAM (pamięć operacyjna) wzrosły w pierwszym kwartale 2026 roku o ok. 90% wobec końca 20252, ponieważ producenci przekierowali produkcję do centrów danych obsługujących AI. Skutki widać dokładnie w konfiguracjach opisanych powyżej. Skutki widać w cennikach maszyn z dużą pamięcią zunifikowaną: warianty o największej pojemności drożeją albo znikają z oferty, a konfiguracja wyceniona rok temu dziś kosztuje inaczej. Przed decyzją zakupową trzeba sprawdzić aktualny cennik producenta, nie notatkę z poprzedniego kwartału. Rachunek, który w 2025 roku wychodził na korzyść własnego sprzętu, w 2026 często wygląda odwrotnie, więc opieranie się na zapamiętanych cenach prowadzi do złych decyzji.
Praktyczne podejście
Zaczynamy zawsze od najtańszego progu. Ollama albo LM Studio na sprzęcie, który firma już posiada, jeden konkretny proces, dwa tygodnie pomiarów jakości i czasu odpowiedzi. Taki eksperyment kosztuje kilka godzin pracy i rozstrzyga więcej niż tygodnie dyskusji o specyfikacji. Dopiero gdy wiadomo, że model danej klasy faktycznie wykonuje zadanie i że wolumen uzasadnia dedykowaną maszynę, sensowna staje się rozmowa o karcie za kilkanaście tysięcy złotych.
Powyższy materiał opisuje praktyczne rozeznanie w kwestiach sprzętowych i kosztowych.
Footnotes
-
Eurostat, ceny energii elektrycznej dla odbiorców innych niż gospodarstwa domowe, druga połowa 2025: https://ec.europa.eu/eurostat/web/products-eurostat-news/w/ddn-20260508-2. ↩
-
Counterpoint Research, wzrost cen pamięci do 90% wobec czwartego kwartału 2025: https://counterpointresearch.com/en/insights/Memory-Prices-Surge-Up-to-90-From-Q4-2025. ↩
RS Management to praktyka doradcza prowadzona przez jedną osobę. Kto za nią stoi i z jakim doświadczeniem: O mnie.
Treści na blogu mają charakter informacyjny i edukacyjny. Nie stanowią porady prawnej, podatkowej ani indywidualnego doradztwa biznesowego. Zakres naszych usług opisuje regulamin.
Ten temat prowadzimy w pakiecie Akcelerator AI: 4 h indywidualnej konsultacji + wsparcie między sesjami.
Zobacz pakiet: Akcelerator AI