#Homelab · 6 Min. Lesezeit · Tim Rinkel

Lokale KI mit Ollama — dein eigener ChatGPT-Klon ohne Cloud

So richtest du lokale KI-Modelle wie DeepSeek-R1 und Qwen 2.5 mit Ollama im Homelab ein – datenschutzkonform, kostenlos und ohne Cloud-Abhängigkeit.

Lokale KI mit Ollama — dein eigener ChatGPT-Klon ohne Cloud

Häufige Fragen rund um Ollama

Welches Modell soll ich als Erstes ausprobieren?

Für den Start: llama3.2:3b oder qwen2.5:7b. Beide laufen auf 8-16 GB RAM, antworten schnell und sind in Deutsch passabel. Für ernsthafteren Code-Einsatz: deepseek-coder-v2. Für längere Kontextfenster: llama3.1:8b-128k.

Brauche ich zwingend eine GPU?

Nein, aber sehr empfohlen. CPU-Inferenz funktioniert für 3B- und 7B-Modelle, ist aber spürbar langsamer (1-3 Tokens pro Sekunde). Mit einer Nvidia-RTX mit 8-12 GB VRAM erreichst du 30-60 Tokens pro Sekunde — das fühlt sich wie ChatGPT an.

Wie viel Speicherplatz brauchen die Modelle?

Faustregel: 1 GB pro Milliarde Parameter bei 4-Bit-Quantisierung. Ein 7B-Modell belegt rund 4-5 GB, ein 70B-Modell rund 40-45 GB. Plane mindestens 100 GB freien NVMe-Platz, wenn du mehrere Modelle parallel ausprobieren willst.

Kann ich mehrere Modelle parallel laden?

Ja, Ollama hält mehrere Modelle im Cache. Welches Modell aktuell im VRAM liegt, hängt von der letzten Benutzung ab — nicht benutzte Modelle werden automatisch ausgelagert. Für dauerhaft parallel: GPU mit ausreichend VRAM für alle Modelle gleichzeitig.

Open WebUI ohne Docker — geht das?

Ja, per pip install open-webui. Funktioniert grundsätzlich, aber Docker ist deutlich entspannter — Updates, Reverse-Proxy-Anbindung, Backups sind so einfacher zu handhaben. Zumindest im Produktiv-Setup empfehlen wir Docker.

Wie integriere ich Ollama in eigene Apps?

Ollama bietet eine OpenAI-kompatible API auf http://localhost:11434/v1/. Damit funktionieren die meisten LangChain-, LlamaIndex- und Direct-API-Bibliotheken ohne Umstellung — einfach Base-URL ändern, fertig.

Externe Quellen für die Vertiefung

Verwandte Tutorials auf Lapalutschi.de

TL;DR — die Kurzfassung

  • Ollama ist ein schlanker LLM-Server, der lokale Modelle wie Llama, DeepSeek oder Qwen ohne Cloud-Anbindung laufen lässt.
  • Hardware-Minimum: aktuelle CPU mit 16 GB RAM für 7B-Modelle, eine GPU mit 8-12 GB VRAM für deutlich mehr Speed.
  • Installation in 5 Minuten: One-Liner-Install per Skript, erstes Modell mit ollama run llama3 — Chat läuft direkt im Terminal.
  • Open WebUI als ChatGPT-ähnliche Oberfläche oben drauf — per Docker-Container in zwei Minuten dazu.
  • Privatsphäre + keine API-Kosten: Deine Daten verlassen den eigenen Rechner nicht, und für Token zahlst du keinen Cent.

Hinweis: Dieser Artikel enthält Affiliate-Links. Wenn du über diese Links einkaufst, erhalten wir eine kleine Provision – für dich entstehen keine Mehrkosten. Mehr erfahren

SENSATION im Homelab! Stell dir vor: DEIN eigenes ChatGPTvollständig offline, auf deiner Hardware, ohne Abo, und KEINE KI-Firma bekommt deine Daten! Klingt zu gut? Mit Ollama ist das 2026 REALITÄT!

In diesem Mega-Tutorial zeige ich dir, wie du DeepSeek-R1 und Qwen 2.5 auf deinem eigenen Server zum Laufen bringst – und was für Hardware du wirklich brauchst!

Was Ollama ist — und warum gerade jetzt

Die Zahlen sind der HAMMER: Im ersten Quartal 2026 verzeichnet Ollama 52 MILLIONEN monatliche Downloads! Das ist kein Nischen-Experiment mehr – das ist MAINSTREAM-Software für alle, die ihre KI selbst hosten wollen!

Der Grundgedanke: Ollama lädt Sprachmodelle, verwaltet sie lokal und stellt eine REST-API bereitkompatibel mit der OpenAI-API! Das heißt: Alle Tools, die für OpenAI gebaut wurden, funktionieren SOFORT mit deinem lokalen Modell!

Was du an Hardware wirklich brauchst

Die meist-gestellte Frage – hier die knallharte Antwort:

  • 8B-Modelle (DeepSeek-R1:8b, Qwen 2.5:8b): Mindestens 8 GB RAM, läuft sogar auf CPU!
  • 14B-Modelle: 16 GB RAM empfohlen!
  • 32B-Modelle (Qwen 2.5:32b): 16-20 GB RAM, GPU mit 16+ GB VRAM ideal!
  • 70B-Modelle: 40+ GB RAM, DEFINITIV GPU-Territory!

Für den Homelab-Einstieg reicht ein älterer Server oder ein leistungsstarker Mini-PC! Mit einer NVIDIA RTX 3080/4080 oder AMD RX 7900 XT erreichst du 300+ Tokens pro Sekundeschneller als du lesen kannst!

Auf reiner CPU? Langsamer, aber nutzbar für gelegentliche Anfragen!

Typischer Homelab-Setup 2026:

  • Proxmox-Server mit dedizierter GPU (GPU-Passthrough in VM)!
  • Oder direkt auf Ubuntu/Debian-Host!
  • 32-64 GB RAM für komfortablen Multi-Modell-Betrieb!

Empfohlene GPU für KI-Homelab

ASUS ROG Strix RTX 4060 Ti OC 16GB – 16 GB VRAM sind das Einstiegsmodell für lokale LLMs ab 14B! Qwen 2.5 14B und DeepSeek-R1 14B laufen damit mit 80-120 Tokens/Sekunde!

Preis kann variieren. Stand: Zuletzt abgerufen bei Veröffentlichung.

Empfohlenes RAM für KI-Homelab

Crucial Pro DDR5 32GB Kit 5600MHz32 GB sind das Minimum für komfortablen Multi-Modell-Betrieb! DDR5-5600 reduziert Ladezeiten bei großen Modellen spürbar!

Preis kann variieren. Stand: Zuletzt abgerufen bei Veröffentlichung.

Ollama installieren in unter 5 Minuten

Ein einziger Befehl auf Linux reicht!

curl -fsSL https://ollama.com/install.sh | sh

Der Installer richtet Ollama AUTOMATISCH als systemd-Service ein! Status prüfen:

systemctl status ollama

ZACK, läuft! Ollama lauscht standardmäßig auf Port 11434!

Um es netzwerkweit erreichbar zu machen:

sudo systemctl edit ollama

Diese Zeilen einfügen:

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"

Dann:

sudo systemctl restart ollama

FERTIG!

GPU-Beschleunigung mit CUDA und ROCm

Ollama erkennt automatisch, ob eine unterstützte GPU vorhanden ist! Der Unterschied ist ENORM:

  • CPU: 5-15 Tokens/Sekunde!
  • Moderne GPU: 80-300+ Tokens/SekundeFaktor 10-20x!

NVIDIA CUDA (empfohlen fürs Homelab!)

# NVIDIA-Treiber installieren (Ubuntu)
sudo ubuntu-drivers autoinstall
sudo reboot

# CUDA-Toolkit
sudo apt install nvidia-cuda-toolkit

# Prüfen
nvidia-smi

Läuft? Dann ziehst du dein erstes Modell!

Deine ersten Modelle laden und testen

# DeepSeek-R1 8B-Modell laden
ollama pull deepseek-r1:8b

# Qwen 2.5 laden
ollama pull qwen2.5:14b

# Chat starten
ollama run deepseek-r1:8b

BOOM! Du chattest mit deiner eigenen KIkomplett offline, 100 % privat!

Open WebUI — der webbasierte Chat als ChatGPT-Alternative

Du willst eine hübsche Web-Oberfläche wie ChatGPT? Open WebUI ist der Hammer!

docker run -d --network=host \
  -v open-webui:/app/backend/data \
  -e OLLAMA_BASE_URL=http://localhost:11434 \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

Dann auf http://localhost:8080 gehen – fertig ist dein privater ChatGPT-Klon!

Welche Modelle wirklich lohnen

Meine klaren Favoriten für 2026:

  • DeepSeek-R1:8bBeste Reasoning-Fähigkeit für die Größe, perfekt für Coding!
  • Qwen 2.5:14bAllrounder, exzellent in Deutsch, stark in Technik!
  • Llama 4:8bMultimodal (Bilder + Text), neuer Meta-Favorit!
  • Mistral Small 3.1Sehr flott, ideal für schnelle Aufgaben!

Bonus: Ollama in Home Assistant integrieren

Das absolute Killer-Feature fürs Smart Home! Dein Home Assistant bekommt KI-Power:

  • Sprachsteuerung komplett offline!
  • Lichter per Sprachbefehl mit natürlicher Sprache!
  • Keine Cloud, keine Amazon-Lauscher!

Im Home Assistant: Settings → Integrations → Ollamafertig!

Fazit — und welche Schritte als Nächstes lohnen

Keine Ausreden mehr: Ollama ist KINDERLEICHT, KOSTENLOS und komplett privat! Wer heute ChatGPT-Abos bezahlt, schüttet Geld aus dem Fenster!

Mein Tipp: Heute noch Ollama installieren, DeepSeek-R1:8b laden und chatten! Morgen kaufst du dir eine günstige RTX 4060 Ti 16GB – und bist technologisch unabhängig!

Auf Lapalutschi.de kommt bald der große Fine-Tuning-Guide – eigene Modelle trainieren mit Ollama und QLoRA! Bleib dran!

Kommentar hinterlassen

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert