Akademia · Lokalne modele

LM Studio — modele LLM bez chmury, na Twoim sprzęcie.

Darmowa aplikacja desktop do uruchamiania zaawansowanych modeli językowych lokalnie: pełna prywatność, zgodność z RODO, API zgodne z OpenAI na localhost. Poniżej instalacja, korzyści dla firm oraz modele, które warto znać.

Ostatnia aktualizacja:

Laptop z aplikacją lokalnego modelu AI, obok mała wieża z GPU
100% lokalniezero zbierania danych, działa offline
OpenAI APIlocalhost:1234 dla istniejących narzędzi
1000+ modelipre-konfigurowanych do pobrania

01 / Wprowadzenie · Czym jest

Aplikacja desktop do lokalnych LLM-ów na prywatnym komputerze.

LM Studio to darmowa aplikacja na macOS, Windows i Linux, która umożliwia uruchamianie zaawansowanych modeli językowych AI bezpośrednio na Twoim komputerze. Instalator waży około 400 MB i pobierasz go z lmstudio.ai.

  • Prywatność first — zero zbierania danych, wszystkie obliczenia lokalnie, brak wymogu internetu, zgodność z RODO.
  • Kluczowe możliwości — ponad 1000 pre-konfigurowanych modeli, Model Context Protocol (MCP), API zgodne z OpenAI, kontrola wielu GPU i zarządzanie pamięcią VRAM.
  • Dla developerów — REST API oraz SDK TypeScript/Python, wbudowany RAG dla dokumentów, długie okna kontekstu. Biblioteki lmstudio-js i lmstudio-python na licencji MIT.
  • Korzyści biznesowe — brak vendor lock-in, pełna kontrola i customizacja, działa na sprzęcie konsumenckim (16 GB RAM oraz 4 GB+ VRAM).

Nowości 2026: OAuth dla serwerów MCP, tensor parallelism (rozkładanie modelu na wiele GPU), aplikacja mobilna oraz natywne użycie modeli LM Studio w Claude Code.

W skrócie: LM Studio demokratyzuje dostęp do LLM i sprawdza się w branżach z wymogami prywatności — dane nie opuszczają komputera, a istniejące narzędzia podłączasz przez zgodne API.

02 / Instalacja · Szybki start

Pobierz, zainstaluj, wybierz model.

Przejdź na lmstudio.ai i pobierz wersję dla swojego systemu (macOS, Windows lub Linux).

  • Aktualna wersja: linia 0.4.x (stabilne 0.4.18 z 26 czerwca 2026).
  • Rozmiar instalatora: około 400 MB.
  • Wymagania rekomendowane: 16 GB RAM oraz 4 GB+ VRAM.
  • Po instalacji: wybierz model z wbudowanej biblioteki, pobierz go i uruchom lokalnie.
  • API: wbudowany serwer udostępnia endpoint zgodny z OpenAI — jak go ustawić dla całego zespołu, pokazujemy w sekcji 05.

03 / Model · GLM (kodowanie)

Linia GLM-5 — aktualni mistrzowie kodowania.

Stan obecny: linia GLM-5 (open-weight od Zhipu AI, m.in. GLM-5.2) to wiodące modele do kodowania — licencja MIT, kontekst do 1M tokenów. Starsze GLM 4.6 i 4.7 wciąż działają, ale przy nowym wdrożeniu nie ma powodu po nie sięgać.

Kompatybilność: modele GLM są obecnie szeroko wspierane w LM Studio. Alternatywy: vLLM, SGLang lub API z docs.z.ai. Model ma też natywną integrację w Claude Code.

04 / Model · MiniMax (agenty)

MiniMax M2 i M3 — mistrzowie zadań agentowych.

Stan obecny linii to dwa punkty odniesienia. MiniMax M2: architektura MoE — 230B parametrów total, 10B aktywnych — licencja MIT, czołówka rankingu Artificial Analysis, a koszt rzędu $0.30/$1.20 za milion tokenów to ułamek ceny modeli komercyjnych. Najnowszy w rodzinie jest MiniMax M3 — osobny krok, nie kolejny punkt linii M2.

MiniMax M3: MoE ~428B / ~22B aktywnych, mechanizm rzadkiej uwagi MSA, kontekst do 1M tokenów i natywna multimodalność (tekst, obraz, wideo). Cennik API to $0.60/$2.40 za milion tokenów, wagi są otwarte na licencji minimax-community.

Status LM Studio: M2 ma natywne wsparcie od wersji 0.3.31 (MLX na Macu, GGUF na PC, łącznie z parsowaniem wywołań narzędzi). Dla M3 obsługa w llama.cpp jest na razie wstępna (build z PR), więc na lokalne uruchomienie poza vLLM i SGLang trzeba poczekać na stabilny build. Dla starszych wersji LM Studio te dwa silniki pozostają alternatywą.

05 / Zespół · Serwer w praktyce

Jeden komputer z GPU, cały zespół z dostępem do modelu.

Wbudowany serwer LM Studio zachowuje się jak API OpenAI — narzędzia, które już macie (SDK OpenAI, edytory i agenty z obsługą własnego endpointu), podłączacie, zmieniając wyłącznie adres bazowy na http://localhost:1234/v1. Klucz API może być dowolnym ciągiem znaków, serwer go nie weryfikuje.

  • Start serwera — zakładka Developer → Start Server, albo z terminala: lms server start (narzędzie lms instaluje się razem z aplikacją).
  • Dostęp dla zespołu — włączcie „Serve on Local Network": serwer nasłuchuje wtedy na adresie IP komputera w sieci lokalnej, nie tylko na localhost. Jedna maszyna z mocnym GPU obsłuży kilka osób.
  • Endpointy/v1/chat/completions, /v1/completions, /v1/embeddings i /v1/models; do tego ładowanie modelu na żądanie (JIT) przy pierwszym zapytaniu.

Trzy ustawienia, które przy ładowaniu modelu robią największą różnicę:

  • Długość kontekstu — domyślna bywa niższa niż maksimum modelu; podnoście ją świadomie, bo dłuższy kontekst zajmuje więcej pamięci.
  • GPU offload — suwak decyduje, ile warstw modelu trafia na kartę graficzną; gdy model nie mieści się w VRAM, część warstw zostaje na CPU kosztem szybkości.
  • Format modelu — GGUF (silnik llama.cpp) działa wszędzie, MLX jest szybszy na Macach z Apple Silicon; niższa kwantyzacja to mniejszy plik i mniejsze wymagania, ale też niższa precyzja.

LM Studio czy llama-server? LM Studio bierzcie, gdy model ma stać na komputerze z aplikacją i być pod ręką dla zespołu; czysty serwer bez GUI na stałej infrastrukturze to temat szkolenia llama-server.

Wdrożenie u Was

Chcecie modele AI u siebie, bez wycieku danych?

Akademia to materiały. Wdrożenie lokalnego modelu na infrastrukturze firmy projektujemy i prowadzimy z Waszym zespołem. Audyt 90 minut wystarczy, żeby sprawdzić, czy ma to u Was sens.