Akademia · Lokalne modele

LM Studio: modele LLM bez chmury, na Twoim sprzęcie.

Darmowa aplikacja desktop do uruchamiania zaawansowanych modeli językowych lokalnie: pełna prywatność, zgodność z RODO, API zgodne z OpenAI na localhost. Poniżej instalacja, korzyści dla firm oraz modele, które warto znać.

Ostatnia aktualizacja:

Laptop z aplikacją lokalnego modelu AI, obok mała wieża z GPU
100% lokalnieczaty i dokumenty zostają na komputerze
OpenAI APIlocalhost:1234 dla istniejących narzędzi
1000+ modelipre-konfigurowanych do pobrania

Aplikacja desktop do lokalnych LLM-ów na prywatnym komputerze.

LM Studio to darmowa aplikacja na macOS, Windows i Linux, która umożliwia uruchamianie zaawansowanych modeli językowych AI bezpośrednio na Twoim komputerze. Instalator waży około 570 MB na macOS i 620 MB na Windows (AppImage na Linuksa to blisko 1 GB), a pobierasz go z lmstudio.ai/download.

  • Prywatność first: wiadomości, historia czatów i dokumenty nie opuszczają komputera, a do sieci trafiają tylko zanonimizowane dane techniczne (sprawdzanie aktualizacji, wyszukiwanie modeli). Obliczenia idą lokalnie, po pobraniu modelu internet nie jest potrzebny, zgodność z RODO.
  • Kluczowe możliwości: ponad 1000 pre-konfigurowanych modeli, Model Context Protocol (MCP), API zgodne z OpenAI, kontrola wielu GPU i zarządzanie pamięcią VRAM.
  • Dla developerów: REST API oraz SDK TypeScript/Python, wbudowany RAG dla dokumentów, długie okna kontekstu. Biblioteki lmstudio-js i lmstudio-python na licencji MIT.
  • Korzyści biznesowe: brak vendor lock-in, pełna kontrola i customizacja, działa na sprzęcie konsumenckim (16 GB RAM oraz 4 GB+ VRAM). Od lipca 2025 aplikacja jest darmowa także w pracy: licencja obejmuje użytek osobisty i wewnętrzny w firmie, bez osobnej umowy komercyjnej.

Nowości 2026: wersja 0.4 z demonem llmster do pracy bez GUI, równoległymi zapytaniami do jednego modelu (continuous batching) i tokenami API, dalej OAuth dla serwerów MCP, tensor parallelism (rozkładanie modelu na wiele GPU), aplikacja mobilna Locally na iPhone'a i iPada oraz endpoint zgodny z API Anthropic, przez który modele z LM Studio podłączysz do Claude Code.

W skrócie: LM Studio demokratyzuje dostęp do LLM i sprawdza się w branżach z wymogami prywatności: dane nie opuszczają komputera, a istniejące narzędzia podłączasz przez zgodne API.

Pobierz, zainstaluj, wybierz model.

Przejdź na lmstudio.ai/download i pobierz wersję dla swojego systemu (macOS, Windows lub Linux). Strona główna lmstudio.ai od lipca 2026 promuje Bionic, osobną aplikację tej samej firmy: agenta, który korzysta z lokalnych modeli, a w płatnych planach także z modeli w chmurze. Klasyczne LM Studio, o którym jest ten materiał, pobierzesz z tej samej strony pobierania.

  • Aktualna wersja: linia 0.4.x (stabilne 0.4.25 z 19 września 2026).
  • Rozmiar instalatora: około 570 MB (macOS), 620 MB (Windows), blisko 1 GB (AppImage na Linuksa).
  • Wymagania rekomendowane: 16 GB RAM oraz 4 GB+ VRAM.
  • Po instalacji: wybierz model z wbudowanej biblioteki, pobierz go i uruchom lokalnie.
  • API: wbudowany serwer udostępnia endpoint zgodny z OpenAI. Jak go ustawić dla całego zespołu, pokazujemy w sekcji 05.

Linia GLM-5: aktualni mistrzowie kodowania.

Stan obecny: linia GLM-5 (open-weight od Zhipu AI, dziś pod marką Z.ai) to wiodące modele do kodowania z kontekstem do 1M tokenów. Najnowszy jest GLM-5.3 z sierpnia 2026: MoE 753B parametrów, 40B aktywnych, ten sam model bazowy co GLM-5.2, tylko mocniej dotrenowany. Wyszedł jednak na własnej licencji GLM-5.3 zamiast MIT. Jej dodatkowy warunek (przegląd bezpieczeństwa u Z.ai) dotyczy tylko firm sprzedających dostęp do modeli jako usługę z przychodem powyżej 10 mld USD rocznie, więc typowego wdrożenia nie blokuje, ale dział prawny powinien o nim wiedzieć. Na MIT zostały GLM-5.2 i GLM-5.3-Flash (320B, 18B aktywnych, pierwszy natywnie multimodalny model serii). Starsze GLM 4.6 i 4.7 wciąż działają, ale przy nowym wdrożeniu nie ma powodu po nie sięgać.

Kompatybilność: w katalogu LM Studio GLM-5.2 i GLM-5.3 są dostępne jako modele chmurowe w Bionic. Lokalnie 753B parametrów to i tak sprzęt serwerowy, a kwantyzacje GGUF od społeczności leżą na Hugging Face. Obsługa GLM-5.3-Flash trafiła do głównej gałęzi llama.cpp dopiero 30 września 2026. Alternatywy: vLLM, SGLang lub API z docs.z.ai. Model ma też natywną integrację w Claude Code.

MiniMax M2 i M3: mistrzowie zadań agentowych.

Stan obecny linii to dwa punkty odniesienia. MiniMax M2: architektura MoE (230B parametrów total, 10B aktywnych), licencja MIT z jednym dopiskiem (oznaczenie „MiniMax M2" dopiero w produktach powyżej 100 mln aktywnych użytkowników miesięcznie lub 30 mln USD przychodu rocznie), czołówka rankingu Artificial Analysis, a koszt rzędu $0.30/$1.20 za milion tokenów to ułamek ceny modeli komercyjnych. Linia M2 doszła do wersji M2.7 (kwiecień 2026), a samo M2 MiniMax ma już w cenniku jako model legacy. Najnowszy w rodzinie jest MiniMax M3 — osobny krok, nie kolejny punkt linii M2.

MiniMax M3: MoE ~428B / ~23B aktywnych, mechanizm rzadkiej uwagi MSA, kontekst do 1M tokenów i natywna multimodalność (tekst, obraz, wideo). Cennik API po stałym 50-procentowym rabacie to $0.30/$1.20 za milion tokenów, dopóki wejście nie przekracza 512k tokenów, a powyżej $0.60/$2.40. Wagi są otwarte na licencji minimax-community.

Status LM Studio: M2 ma natywne wsparcie od wersji 0.3.31 (MLX na Macu, GGUF na PC, łącznie z parsowaniem wywołań narzędzi). Obsługa M3 razem z rzadką uwagą MSA weszła do głównej gałęzi llama.cpp 26 lipca 2026, a kwantyzacje GGUF są na Hugging Face. We własnym katalogu LM Studio M3 na razie nie ma, więc plik trzeba zaimportować ręcznie (lms import) i sprawdzić, czy zainstalowany silnik llama.cpp go uruchomi. Producent jako ścieżki wdrożenia wskazuje vLLM i SGLang.

Jeden komputer z GPU, cały zespół z dostępem do modelu.

Wbudowany serwer LM Studio zachowuje się jak API OpenAI: narzędzia, które już macie (SDK OpenAI, edytory i agenty z obsługą własnego endpointu), podłączacie, zmieniając wyłącznie adres bazowy na http://localhost:1234/v1. Domyślnie serwer nie sprawdza klucza API, więc przejdzie dowolny ciąg znaków. Od wersji 0.4.0 da się to zmienić: przełącznik Require Authentication w ustawieniach serwera włącza wymóg tokenu, a tokeny API z wybranymi uprawnieniami tworzycie w tym samym miejscu.

  • Start serwera — zakładka Developer → Start Server, albo z terminala: lms server start (narzędzie lms instaluje się razem z aplikacją).
  • Serwer bez GUI: na maszynie bez pulpitu instalujecie sam demon llmster (curl -fsSL https://lmstudio.ai/install.sh | bash, na Windows irm https://lmstudio.ai/install.ps1 | iex), uruchamiacie go przez lms daemon up, a na Linuksie możecie podpiąć go pod systemd.
  • Dostęp dla zespołu — włączcie „Serve on Local Network" (z terminala: lms server start --bind 0.0.0.0): serwer nasłuchuje wtedy na adresie IP komputera w sieci lokalnej, nie tylko na localhost. Jedna maszyna z mocnym GPU obsłuży kilka osób. Przy takim wystawieniu włączcie też uwierzytelnianie, bo tak zaleca sama dokumentacja LM Studio.
  • Endpointy: zgodne z OpenAI /v1/chat/completions, /v1/responses, /v1/completions, /v1/embeddings i /v1/models oraz zgodny z Anthropic /v1/messages. Ten ostatni pozwala podpiąć Claude Code pod lokalny model przez ANTHROPIC_BASE_URL=http://localhost:1234. Do tego ładowanie modelu na żądanie (JIT) przy pierwszym zapytaniu.

Trzy ustawienia, które przy ładowaniu modelu robią największą różnicę:

  • Długość kontekstu: od wersji 0.4.16 domyślnie 8k tokenów, czyli zwykle mniej niż maksimum modelu; podnoście ją świadomie, bo dłuższy kontekst zajmuje więcej pamięci.
  • GPU offload: suwak decyduje, ile warstw modelu trafia na kartę graficzną; gdy model nie mieści się w VRAM, część warstw zostaje na CPU kosztem szybkości.
  • Format modelu: GGUF (silnik llama.cpp) działa wszędzie, MLX jest szybszy na Macach z Apple Silicon; niższa kwantyzacja to mniejszy plik i mniejsze wymagania, ale też niższa precyzja.

LM Studio czy llama-server? LM Studio bierzcie, gdy model ma stać na komputerze z aplikacją i być pod ręką dla zespołu (albo na serwerze przez llmster, jeśli chcecie zostać przy jego katalogu modeli i API); czysty llama.cpp z pełną kontrolą nad flagami na stałej infrastrukturze to temat szkolenia llama-server.

Chcecie modele AI u siebie, bez wycieku danych?

Akademia to materiały. Wdrożenie lokalnego modelu na infrastrukturze firmy projektujemy i prowadzimy z Waszym zespołem. Audyt 90 minut wystarczy, żeby sprawdzić, czy ma to u Was sens.