Akademia · Lokalne modele
Darmowa aplikacja desktop do uruchamiania zaawansowanych modeli językowych lokalnie: pełna prywatność, zgodność z RODO, API zgodne z OpenAI na localhost. Poniżej instalacja, korzyści dla firm oraz modele, które warto znać.
Ostatnia aktualizacja:
LM Studio to darmowa aplikacja na macOS, Windows i Linux, która umożliwia uruchamianie zaawansowanych modeli językowych AI bezpośrednio na Twoim komputerze. Instalator waży około 570 MB na macOS i 620 MB na Windows (AppImage na Linuksa to blisko 1 GB), a pobierasz go z lmstudio.ai/download.
lmstudio-js i lmstudio-python na licencji MIT.Nowości 2026: wersja 0.4 z demonem llmster do pracy bez GUI, równoległymi zapytaniami do jednego modelu (continuous batching) i tokenami API, dalej OAuth dla serwerów MCP, tensor parallelism (rozkładanie modelu na wiele GPU), aplikacja mobilna Locally na iPhone'a i iPada oraz endpoint zgodny z API Anthropic, przez który modele z LM Studio podłączysz do Claude Code.
W skrócie: LM Studio demokratyzuje dostęp do LLM i sprawdza się w branżach z wymogami prywatności: dane nie opuszczają komputera, a istniejące narzędzia podłączasz przez zgodne API.
Przejdź na lmstudio.ai/download i pobierz wersję dla swojego systemu (macOS, Windows lub Linux). Strona główna lmstudio.ai od lipca 2026 promuje Bionic, osobną aplikację tej samej firmy: agenta, który korzysta z lokalnych modeli, a w płatnych planach także z modeli w chmurze. Klasyczne LM Studio, o którym jest ten materiał, pobierzesz z tej samej strony pobierania.
Stan obecny: linia GLM-5 (open-weight od Zhipu AI, dziś pod marką Z.ai) to wiodące modele do kodowania z kontekstem do 1M tokenów. Najnowszy jest GLM-5.3 z sierpnia 2026: MoE 753B parametrów, 40B aktywnych, ten sam model bazowy co GLM-5.2, tylko mocniej dotrenowany. Wyszedł jednak na własnej licencji GLM-5.3 zamiast MIT. Jej dodatkowy warunek (przegląd bezpieczeństwa u Z.ai) dotyczy tylko firm sprzedających dostęp do modeli jako usługę z przychodem powyżej 10 mld USD rocznie, więc typowego wdrożenia nie blokuje, ale dział prawny powinien o nim wiedzieć. Na MIT zostały GLM-5.2 i GLM-5.3-Flash (320B, 18B aktywnych, pierwszy natywnie multimodalny model serii). Starsze GLM 4.6 i 4.7 wciąż działają, ale przy nowym wdrożeniu nie ma powodu po nie sięgać.
Kompatybilność: w katalogu LM Studio GLM-5.2 i GLM-5.3 są dostępne jako modele chmurowe w Bionic. Lokalnie 753B parametrów to i tak sprzęt serwerowy, a kwantyzacje GGUF od społeczności leżą na Hugging Face. Obsługa GLM-5.3-Flash trafiła do głównej gałęzi llama.cpp dopiero 30 września 2026. Alternatywy: vLLM, SGLang lub API z docs.z.ai. Model ma też natywną integrację w Claude Code.
Stan obecny linii to dwa punkty odniesienia. MiniMax M2: architektura MoE (230B parametrów total, 10B aktywnych), licencja MIT z jednym dopiskiem (oznaczenie „MiniMax M2" dopiero w produktach powyżej 100 mln aktywnych użytkowników miesięcznie lub 30 mln USD przychodu rocznie), czołówka rankingu Artificial Analysis, a koszt rzędu $0.30/$1.20 za milion tokenów to ułamek ceny modeli komercyjnych. Linia M2 doszła do wersji M2.7 (kwiecień 2026), a samo M2 MiniMax ma już w cenniku jako model legacy. Najnowszy w rodzinie jest MiniMax M3 — osobny krok, nie kolejny punkt linii M2.
MiniMax M3: MoE ~428B / ~23B aktywnych, mechanizm rzadkiej uwagi MSA, kontekst do 1M tokenów i natywna multimodalność (tekst, obraz, wideo). Cennik API po stałym 50-procentowym rabacie to $0.30/$1.20 za milion tokenów, dopóki wejście nie przekracza 512k tokenów, a powyżej $0.60/$2.40. Wagi są otwarte na licencji minimax-community.
Status LM Studio: M2 ma natywne wsparcie od wersji 0.3.31 (MLX na Macu, GGUF na PC, łącznie z parsowaniem wywołań narzędzi). Obsługa M3 razem z rzadką uwagą MSA weszła do głównej gałęzi llama.cpp 26 lipca 2026, a kwantyzacje GGUF są na Hugging Face. We własnym katalogu LM Studio M3 na razie nie ma, więc plik trzeba zaimportować ręcznie (lms import) i sprawdzić, czy zainstalowany silnik llama.cpp go uruchomi. Producent jako ścieżki wdrożenia wskazuje vLLM i SGLang.
Wbudowany serwer LM Studio zachowuje się jak API OpenAI: narzędzia, które już macie (SDK OpenAI, edytory i agenty z obsługą własnego endpointu), podłączacie, zmieniając wyłącznie adres bazowy na http://localhost:1234/v1. Domyślnie serwer nie sprawdza klucza API, więc przejdzie dowolny ciąg znaków. Od wersji 0.4.0 da się to zmienić: przełącznik Require Authentication w ustawieniach serwera włącza wymóg tokenu, a tokeny API z wybranymi uprawnieniami tworzycie w tym samym miejscu.
lms server start (narzędzie lms instaluje się razem z aplikacją).llmster (curl -fsSL https://lmstudio.ai/install.sh | bash, na Windows irm https://lmstudio.ai/install.ps1 | iex), uruchamiacie go przez lms daemon up, a na Linuksie możecie podpiąć go pod systemd.lms server start --bind 0.0.0.0): serwer nasłuchuje wtedy na adresie IP komputera w sieci lokalnej, nie tylko na localhost. Jedna maszyna z mocnym GPU obsłuży kilka osób. Przy takim wystawieniu włączcie też uwierzytelnianie, bo tak zaleca sama dokumentacja LM Studio./v1/chat/completions, /v1/responses, /v1/completions, /v1/embeddings i /v1/models oraz zgodny z Anthropic /v1/messages. Ten ostatni pozwala podpiąć Claude Code pod lokalny model przez ANTHROPIC_BASE_URL=http://localhost:1234. Do tego ładowanie modelu na żądanie (JIT) przy pierwszym zapytaniu.Trzy ustawienia, które przy ładowaniu modelu robią największą różnicę:
LM Studio czy llama-server? LM Studio bierzcie, gdy model ma stać na komputerze z aplikacją i być pod ręką dla zespołu (albo na serwerze przez llmster, jeśli chcecie zostać przy jego katalogu modeli i API); czysty llama.cpp z pełną kontrolą nad flagami na stałej infrastrukturze to temat szkolenia llama-server.
Akademia to materiały. Wdrożenie lokalnego modelu na infrastrukturze firmy projektujemy i prowadzimy z Waszym zespołem. Audyt 90 minut wystarczy, żeby sprawdzić, czy ma to u Was sens.