Twój lokalny i prywatny model językowy

prywatny model językowy
Źródło zdjęcia: https://freepik.com/

Chcesz uruchomić AI lokalnie, bez wysyłania danych do chmury i z pełną kontrolą nad środowiskiem? Poniższy poradnik przeprowadzi Cię krok po kroku: od włączenia WSL2 w Windows, przez instalację Dockera, po uruchomienie Ollama w kontenerze, pobieranie modeli ai, po korzystanie z nich przez CLI oraz API. Na końcu otrzymasz podsumowanie zalet i ograniczeń, aby świadomie zdecydować, czy to rozwiązanie jest dla Ciebie.

Spis treści

Docelowo uzyskasz w pełni działające własne AI na komputerze, czyli lokalny model AI, który nie łączy się z Internetem i nie wysyła Twoich danych na zewnątrz.

Dlaczego warto uruchomić prywatny model językowy?

  • Dane nie opuszczają Twojego komputera. To szczególnie ważne dla dokumentów firmowych.
  • Szybszy czas odpowiedzi, ponieważ zapytania nie muszą docierać do chmury.
  • Płacisz za własny sprzęt, nie za tokeny lub subskrypcje.
  • Własny model językowy możesz wywoływać przez REST API, integrując go z własnymi skryptami i aplikacjami.
  • Możesz testować różne modele językowe.

Wymagania wstępne

  • Windows 10 21H2 lub nowszy / Windows 11.
  • Uprawnienia administratora (do włączenia WSL i instalacji).
  • ok. 20-40 GB wolnego miejsca.
  • (Opcjonalnie) karta NVIDIA z działającymi sterownikami + WSL CUDA dla przyspieszenia GPU.

Krok 1. Włączamy WSL2 w Windows

  1. Otwórz PowerShell jako Administrator i zainstaluj WSL (Windows Subsystem for Linux):

wsl --install

  1. Następnie zaktualizuj i włącz domyślnie wersję 2:

wsl --update

wsl --set-default-version 2

  1. Zrestartuj komputer jeśli Cię o to poprosi
  2. Jeśli restartowałeś komputer uruchom Powershell jeszcze raz (na tym etapie nie potrzebujesz uprawnień Administratora) i zainstaluj Ubuntu:
  • wsl --install Ubuntu-24.04 --name ubuntu
  1. Uruchom świeżo zainstalowany (sub)system:
  • wsl -d ubuntu

Krok 2. Instalujemy Docker

Posiłkując się oficjalną dokumentacją Dockera, uruchamiamy kolejno polecenia wewnątrz naszego Ubuntu:

https://docs.docker.com/engine/install/ubuntu
# Add Docker's official GPG key:sudo apt-get update
sudo apt-get install ca-certificates curl
sudo install -m 0755 -d /etc/apt/keyrings
sudo curl -fsSL https://download.docker.com/linux/ubuntu/gpg -o /etc/apt/keyrings/docker.asc
sudo chmod a+r /etc/apt/keyrings/docker.asc
# Add the repository to Apt sources:echo \
  "deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.asc] https://download.docker.com/linux/ubuntu \
  $(. /etc/os-release && echo "${UBUNTU_CODENAME:-$VERSION_CODENAME}") stable" | \
  sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
sudo apt-get update

Krok 3. Uruchamiamy Ollama w kontenerze Dockera

Ollama to lekki runtime i menedżer modeli ułatwiający pracę z modelami językowymi.

Jeśli chcesz używać tylko swojego CPU:

docker run -d --name ollama \

-p 11434:11434 \

-v ollama:/root/.ollama \

ollama/ollama

Jeśli posiadasz kartę graficzną NVIDIA i zainstalowałeś w Ubuntu poprawne sterowniki razem z CUDA:

docker run -d --gpus=all --name ollama \

-p 11434:11434 \

-v ollama:/root/.ollama \

ollama/ollama

Krok 4. Modele AI do pobrania – pobieramy i zarządzamy modelami

Przejdź na stronę https://ollama.com/library aby wybrać model językowy, który Cię interesuje. W tym miejscu możesz przeglądać dostępne opcje i dowiedzieć się w czym specjalizuje się dany model.

Przykłady:

Llama 3.1 (nowsza generacja, różne rozmiary):

docker exec -it ollama ollama pull llama3.1

Mistral (szybki i oszczędny):

docker exec -it ollama ollama pull mistral

Phi-3 (małe modele do podstawowych zadań):

docker exec -it ollama ollama pull phi3

Zarządzanie

Lista zainstalowanych modeli:

docker exec -it ollama ollama list

Usunięcie modelu:

docker exec -it ollama ollama rm <nazwa>

Krok 5. Uruchamianie i korzystanie z modeli

  1. Szybki start z CLI

Interaktywna sesja (podobne do rozmowy z chatem):

docker exec -it ollama ollama run llama3.1

Jednorazowa odpowiedź (bez sesji):

docker exec -it ollama ollama run llama3.1 "Kiedy ruszyła pierwsza misja kosmiczna?"

  1. REST API do integracji z aplikacjami

Ollama wystawia API na http://localhost:11434

curl http://localhost:11434/api/generate -d '{

"model": "llama3.1",

"prompt": "Kiedy ruszyła pierwsza misja kosmiczna?"

}'

Zamiast CURL możesz oczywiście użyć innych narzędzi, na przykład Python + biblioteka requests

Krok 6. Porady i dobre praktyki

  • Jeśli masz problem z wyborem modelu – zacznij od mniejszych (np. 3–8B parametrów). Jeśli jest za wolno lub jakość jest niewystarczająca – stopniowo zwiększaj.
  • Jeśli masz GPU NVIDIA, koniecznie skonfiguruj WSL CUDA. Różnica jest kolosalna.
  • Duże modele = duże wymagania RAM. Przy CPU-only mniejsze modele działają znacznie żwawiej.
  • Tokenizacja i temperatura: mniejsze temperature = bardziej deterministyczne odpowiedzi; większe num_ctx = dłuższy kontekst, ale działa wolniej i zużywa więcej RAM.
  • Ollama cache’uje wektory, więc kolejne zapytania o podobnym kontekście są szybsze.

Zalety i wady rozwiązania

Zalety

  • Dane pozostają lokalnie – to prywatny model językowy.
  • Dostęp do API: proste REST, łatwa integracja z dowolnym językiem programowania.
  • Pełny wybór modelu, wersji i parametrów inferencji.
  • Brak zależności od dostawcy – to Twoje własne AI.

Wady / ograniczenia

  • Brak dostępu do Internetu (domyślnie): model sam z siebie nie „googluje”. Możesz to obejść przez własne narzędzia (tzw. tool-use), ale to już dodatkowy kod.
  • Ograniczenia sprzętowe: słabszy CPU/GPU = wolniejsza generacja lub konieczność mniejszych modeli.
  • Modele AI do pobrania potrafią zajmować gigabajty miejsca na dysku.
  • Aktualizacje obrazów, modeli, sterowników są na Twojej głowie.
Najpopularniejsze wpisy

Oświetlenie tarasu – jak stworzyć klimat i funkcjonalną przestrzeń?

Czytaj więcej

Dlaczego odpada farba ze ściany?

Czytaj więcej

Czy da się odzyskać dane po ransomware i czy warto płacić okup?

Czytaj więcej

Jaki żagiel przeciwsłoneczny wybrać? Kompletny poradnik dopasowania i montażu

Czytaj więcej
Najnowsze wpisy

Oświetlenie tarasu – jak stworzyć klimat i funkcjonalną przestrzeń?

Czytaj więcej

Dlaczego odpada farba ze ściany?

Czytaj więcej

Czy da się odzyskać dane po ransomware i czy warto płacić okup?

Czytaj więcej

Jaki żagiel przeciwsłoneczny wybrać? Kompletny poradnik dopasowania i montażu

Czytaj więcej

Podobne wpisy