
Chcesz uruchomić AI lokalnie, bez wysyłania danych do chmury i z pełną kontrolą nad środowiskiem? Poniższy poradnik przeprowadzi Cię krok po kroku: od włączenia WSL2 w Windows, przez instalację Dockera, po uruchomienie Ollama w kontenerze, pobieranie modeli ai, po korzystanie z nich przez CLI oraz API. Na końcu otrzymasz podsumowanie zalet i ograniczeń, aby świadomie zdecydować, czy to rozwiązanie jest dla Ciebie.
Docelowo uzyskasz w pełni działające własne AI na komputerze, czyli lokalny model AI, który nie łączy się z Internetem i nie wysyła Twoich danych na zewnątrz.
Dlaczego warto uruchomić prywatny model językowy?
- Dane nie opuszczają Twojego komputera. To szczególnie ważne dla dokumentów firmowych.
- Szybszy czas odpowiedzi, ponieważ zapytania nie muszą docierać do chmury.
- Płacisz za własny sprzęt, nie za tokeny lub subskrypcje.
- Własny model językowy możesz wywoływać przez REST API, integrując go z własnymi skryptami i aplikacjami.
- Możesz testować różne modele językowe.
Wymagania wstępne
- Windows 10 21H2 lub nowszy / Windows 11.
- Uprawnienia administratora (do włączenia WSL i instalacji).
- ok. 20-40 GB wolnego miejsca.
- (Opcjonalnie) karta NVIDIA z działającymi sterownikami + WSL CUDA dla przyspieszenia GPU.
Krok 1. Włączamy WSL2 w Windows
- Otwórz PowerShell jako Administrator i zainstaluj WSL (Windows Subsystem for Linux):
wsl --install
- Następnie zaktualizuj i włącz domyślnie wersję 2:
wsl --update
wsl --set-default-version 2
- Zrestartuj komputer jeśli Cię o to poprosi
- Jeśli restartowałeś komputer uruchom Powershell jeszcze raz (na tym etapie nie potrzebujesz uprawnień Administratora) i zainstaluj Ubuntu:
wsl --install Ubuntu-24.04 --name ubuntu
- Uruchom świeżo zainstalowany (sub)system:
wsl -d ubuntu
Krok 2. Instalujemy Docker
Posiłkując się oficjalną dokumentacją Dockera, uruchamiamy kolejno polecenia wewnątrz naszego Ubuntu:
# Add Docker's official GPG key:sudo apt-get update
sudo apt-get install ca-certificates curl
sudo install -m 0755 -d /etc/apt/keyrings
sudo curl -fsSL https://download.docker.com/linux/ubuntu/gpg -o /etc/apt/keyrings/docker.asc
sudo chmod a+r /etc/apt/keyrings/docker.asc
# Add the repository to Apt sources:echo \
"deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.asc] https://download.docker.com/linux/ubuntu \
$(. /etc/os-release && echo "${UBUNTU_CODENAME:-$VERSION_CODENAME}") stable" | \
sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
sudo apt-get update
Krok 3. Uruchamiamy Ollama w kontenerze Dockera
Ollama to lekki runtime i menedżer modeli ułatwiający pracę z modelami językowymi.
Jeśli chcesz używać tylko swojego CPU:
docker run -d --name ollama \
-p 11434:11434 \
-v ollama:/root/.ollama \
ollama/ollama
Jeśli posiadasz kartę graficzną NVIDIA i zainstalowałeś w Ubuntu poprawne sterowniki razem z CUDA:
docker run -d --gpus=all --name ollama \
-p 11434:11434 \
-v ollama:/root/.ollama \
ollama/ollama
Krok 4. Modele AI do pobrania – pobieramy i zarządzamy modelami
Przejdź na stronę https://ollama.com/library aby wybrać model językowy, który Cię interesuje. W tym miejscu możesz przeglądać dostępne opcje i dowiedzieć się w czym specjalizuje się dany model.
Przykłady:
Llama 3.1 (nowsza generacja, różne rozmiary):
docker exec -it ollama ollama pull llama3.1
Mistral (szybki i oszczędny):
docker exec -it ollama ollama pull mistral
Phi-3 (małe modele do podstawowych zadań):
docker exec -it ollama ollama pull phi3
Zarządzanie
Lista zainstalowanych modeli:
docker exec -it ollama ollama list
Usunięcie modelu:
docker exec -it ollama ollama rm <nazwa>
Krok 5. Uruchamianie i korzystanie z modeli
- Szybki start z CLI
Interaktywna sesja (podobne do rozmowy z chatem):
docker exec -it ollama ollama run llama3.1
Jednorazowa odpowiedź (bez sesji):
docker exec -it ollama ollama run llama3.1 "Kiedy ruszyła pierwsza misja kosmiczna?"
- REST API do integracji z aplikacjami
Ollama wystawia API na http://localhost:11434
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "Kiedy ruszyła pierwsza misja kosmiczna?"
}'
Zamiast CURL możesz oczywiście użyć innych narzędzi, na przykład Python + biblioteka requests
Krok 6. Porady i dobre praktyki
- Jeśli masz problem z wyborem modelu – zacznij od mniejszych (np. 3–8B parametrów). Jeśli jest za wolno lub jakość jest niewystarczająca – stopniowo zwiększaj.
- Jeśli masz GPU NVIDIA, koniecznie skonfiguruj WSL CUDA. Różnica jest kolosalna.
- Duże modele = duże wymagania RAM. Przy CPU-only mniejsze modele działają znacznie żwawiej.
- Tokenizacja i temperatura: mniejsze
temperature= bardziej deterministyczne odpowiedzi; większenum_ctx= dłuższy kontekst, ale działa wolniej i zużywa więcej RAM. - Ollama cache’uje wektory, więc kolejne zapytania o podobnym kontekście są szybsze.
Zalety i wady rozwiązania
Zalety
- Dane pozostają lokalnie – to prywatny model językowy.
- Dostęp do API: proste REST, łatwa integracja z dowolnym językiem programowania.
- Pełny wybór modelu, wersji i parametrów inferencji.
- Brak zależności od dostawcy – to Twoje własne AI.
Wady / ograniczenia
- Brak dostępu do Internetu (domyślnie): model sam z siebie nie „googluje”. Możesz to obejść przez własne narzędzia (tzw. tool-use), ale to już dodatkowy kod.
- Ograniczenia sprzętowe: słabszy CPU/GPU = wolniejsza generacja lub konieczność mniejszych modeli.
- Modele AI do pobrania potrafią zajmować gigabajty miejsca na dysku.
- Aktualizacje obrazów, modeli, sterowników są na Twojej głowie.