06
← Alle Themen
Track 06

Lokale KI & Tools

Ollama · LM Studio · Open WebUI · Llama · Mistral · Phi

KI ohne Cloud – deine Gespräche, deine Daten, dein Gerät. Lokale Sprachmodelle laufen heute auf normalen Laptops, sind kostenlos und senden keine einzige Anfrage ins Internet. Wir zeigen, wie du in zehn Minuten startest.

Einsteiger Fortgeschritten
Einstieg

KI ohne Überwachung

ChatGPT, Gemini, Copilot – alle senden deine Anfragen an Server großer Konzerne in den USA. Was du fragst, wird gespeichert, analysiert und zum Training neuer Modelle verwendet. Die Nutzungsbedingungen von OpenAI erlauben ausdrücklich, Konversationen für Training zu nutzen, sofern du nicht aktiv widersprichst. Deine Gedanken, Fragen und Probleme werden zu Trainingsdaten eines kommerziellen Produkts.

„Ein KI-Modell auf deinem Laptop sieht niemand außer dir. Keine API-Keys, keine Datenschutzerklärung, keine monatlichen Kosten – und für viele Alltagsaufgaben genauso gut wie ChatGPT."

Die gute Nachricht: Seit 2023 sind leistungsfähige Open-Source-Modelle verfügbar, die auf normaler Hardware laufen. Llama von Meta, Mistral aus Frankreich, Phi von Microsoft – alle kostenlos, alle lokal ausführbar. Ein MacBook mit M-Chip oder ein PC mit 16 GB RAM reicht für viele Modelle vollständig aus. Mit Ollama oder LM Studio dauert die Installation weniger als zehn Minuten.

Lokale KI ist nicht nur Privatsphäre. Es ist digitale Souveränität: Du entscheidest, welches Modell du nutzt, wie es konfiguriert ist, und niemand kann es dir wegnehmen oder hinter einer Paywall verstecken.

Schritt für Schritt

In zehn Minuten zur eigenen KI

01
Ollama installieren

ollama.com aufrufen, herunterladen, installieren. Fertig. Ollama läuft im Hintergrund und verwaltet Modelle wie ein Paketmanager. Funktioniert auf macOS, Linux und Windows – kein Konto, keine Registrierung, keine Internetverbindung nach der Installation nötig.

Ollama
02
Erstes Modell laden

Im Terminal: ollama run llama3.2 – das Modell wird heruntergeladen (ca. 2 GB) und startet sofort. Du kannst direkt draufloschatten. Wer kein Terminal will: LM Studio bietet die gleiche Erfahrung mit grafischer Oberfläche.

Llama 3.2 · LM Studio
03
Oberfläche einrichten

Open WebUI gibt dir eine ChatGPT-ähnliche Oberfläche im Browser – mit Gesprächsverlauf, Datei-Upload und Modellwechsel auf Knopfdruck. Läuft als Docker-Container auf deinem Rechner, erreichbar unter localhost. Deine Chats bleiben lokal gespeichert.

Open WebUI · Docker
04
Für alle im Heimnetz

Ollama und Open WebUI auf dem Homeserver einrichten – dann steht die KI allen Geräten im Heimnetz zur Verfügung: Laptop, Handy, Tablet. Kein Cloud-Abo, kein Datenschutz-Kompromiss. Wer bereits einen Homelab-Server hat (Track 03), kann das sofort umsetzen.

Homeserver · Ollama · Open WebUI
Software & Modelle

Was wir empfehlen

Einstieg – Sofort loslegen
LM Studio
Einsteiger

Grafische Oberfläche für lokale KI-Modelle – herunterladen, installieren, chatten. Kein Terminal nötig. Integrierter Modell-Browser, Chat-Interface und lokaler API-Server. Ideal für den ersten Einstieg.

lmstudio.ai ↗
Ollama
Einsteiger

Der Standard für lokale KI-Modelle. Ein Befehl im Terminal – und Llama, Mistral oder Phi laufen lokal. Bietet eine REST-API, die andere Tools (Open WebUI, AnythingLLM) nutzen können. Für macOS, Linux und Windows.

ollama.com ↗
Oberflächen & Erweiterungen
Open WebUI
Fortgeschritten

ChatGPT-ähnliche Web-Oberfläche für Ollama. Self-hosted via Docker. Gesprächsverlauf, Datei-Upload, Modellwechsel, Benutzerkonten – alles lokal. Ideal auf dem Homeserver für alle Geräte im Netz.

openwebui.com ↗
AnythingLLM
Fortgeschritten

KI mit eigenem Wissen: Dokumente, PDFs, Webseiten hochladen – das Modell beantwortet Fragen auf Basis deiner Inhalte (RAG). Desktop-App oder self-hosted. Kein einziges Byte verlässt deinen Rechner.

anythingllm.com ↗
OpenClaw
Einsteiger

KI-Assistent der Bitköln-Community. Datenschutzfreundlich, lokal ausführbar, auf unsere Themen rund um digitale Souveränität zugeschnitten. Komm zum Meetup und probier ihn live aus.

Modelle – Was auf deinen Rechner passt
Llama 3.2 / 3.3
Einsteiger

Metas Open-Source-Flaggschiff. Das 8B-Modell läuft flüssig auf 16 GB RAM, das 3B-Modell sogar auf 8 GB. Sehr gute Allround-Qualität, stark in Deutsch, aktiv weiterentwickelt.

ollama.com/library/llama3.2 ↗
Mistral / Mixtral
Einsteiger

Europäisches Open-Source-Modell aus Paris. Effizient, schnell, mehrsprachig – besonders gut in Deutsch und Französisch. Mistral 7B läuft auf 8 GB RAM, ideal für schwächere Hardware.

ollama.com/library/mistral ↗
Phi-4 (Microsoft)
Einsteiger

Kleines Modell, große Leistung. Phi-4 mit 14B Parametern übertrifft in vielen Benchmarks deutlich größere Modelle. Läuft auf 16 GB RAM, gut geeignet für Programmieraufgaben und Analyse.

ollama.com/library/phi4 ↗
Qwen 2.5
Fortgeschritten

Alibabas Open-Source-Modell, stark mehrsprachig und sehr gut in Programmieraufgaben (Qwen-Coder-Variante). In vielen Benchmarks auf Augenhöhe mit deutlich größeren Modellen.

ollama.com/library/qwen2.5 ↗
Bitköln Community

OpenClaw – KI für digitale Souveränität

OpenClaw ist der KI-Assistent der Bitköln-Community. Kein kommerzielles Produkt, keine versteckten Interessen – ein gemeinsam gepflegtes Werkzeug, das auf unsere Themen zugeschnitten ist: Bitcoin, Privatsphäre, Homelab, digitale Selbstbestimmung. OpenClaw läuft lokal, sendet keine Daten, und kann von jedem aus der Community weiterentwickelt werden.

„OpenClaw beantwortet keine Fragen für dich – er hilft dir, die richtigen Fragen zu stellen. Und die Antworten bleiben bei dir."

Technisch ist OpenClaw ein speziell konfiguriertes lokales Sprachmodell mit einem System-Prompt, der auf unsere Community-Themen abgestimmt ist. Er kennt die Tools, die wir empfehlen, die Prinzipien, die uns leiten, und die Fragen, die Einsteiger typischerweise mitbringen. Komm zum Meetup – dort läuft OpenClaw live und du kannst ihn direkt ausprobieren.

Lokal & privat

OpenClaw läuft auf deinem Gerät oder dem Community-Server. Kein Konto, keine API, kein Tracking. Deine Fragen bleiben deine Fragen.

Community-Wissen

System-Prompt mit Bitköln-Kontext: Tools, Empfehlungen, Prinzipien. Auf unsere sieben Themen-Tracks zugeschnitten – kein generisches KI-Allgemeinwissen.

Open Source

Konfiguration, System-Prompt und Setup-Skripte liegen offen. Wer etwas verbessern will, ist herzlich eingeladen – Pull Requests willkommen.

Live im Meetup

Jeden dritten Mittwoch läuft OpenClaw auf dem Community-Rechner. Frag ihn zu Bitcoin-Wallets, Homelab-Setup oder Messenger-Auswahl – und schau, was rauskommt.

Hintergrund

Was steckt hinter den Modellen?

Sprachmodelle werden in Parametern gemessen: Ein 7B-Modell hat 7 Milliarden Parameter – grob gesagt, Zahlen, die das gelernte Weltwissen kodieren. Mehr Parameter bedeuten in der Regel bessere Qualität, aber auch mehr RAM-Bedarf. Für die meisten Alltagsaufgaben sind 7–14 Milliarden Parameter vollkommen ausreichend.

„Quantisierung macht große Modelle klein: Ein 14B-Modell in 4-Bit-Quantisierung braucht nur ~9 GB RAM – mit kaum spürbarem Qualitätsverlust."

Ollama lädt Modelle automatisch in optimierter Quantisierung herunter. Du musst nichts manuell konfigurieren. Das Modell-Format heißt GGUF und stammt von der Community rund um llama.cpp – dem Motor, der hinter Ollama und LM Studio steckt. Die Hardware-Nutzung ist dabei intelligent: Auf Apple-Silicon-Macs nutzt Ollama die GPU-Kerne des M-Chips vollständig aus. Auf NVIDIA-Karten wird CUDA genutzt. Ohne GPU läuft alles auf der CPU – langsamer, aber funktional.

8 GB RAM
Kleine Geräte · MacBook Air M1/M2

Llama 3.2 3B oder Mistral 7B in Q4-Quantisierung. Für einfache Aufgaben, Fragen, kurze Texte. Antwortet in Sekunden.

16 GB RAM
Standard · MacBook Pro · Guter PC

Llama 3.2 8B, Phi-4 14B, Mistral 7B in voller Qualität. Dieser Sweetspot deckt 95 % der Alltagsanwendungen vollständig ab.

32 GB+ RAM
Power · Mac Studio · RTX 4090

Llama 3.3 70B, Qwen 2.5 72B – Modelle auf GPT-4-Niveau, vollständig lokal. Für anspruchsvolle Analyse, langen Kontext, Coding.

Spezialisierte Modelle
Code · Medizin · Wissenschaft

Qwen-Coder für Programmierung, DeepSeek-R1 für Reasoning und Mathematik, Nomic-Embed für semantische Suche in eigenen Dokumenten (RAG).

Hardware

Was läuft auf welchem Gerät?

Einsteiger
Normaler Laptop
16 GB RAM · CPU-Inferenz
Modellgröße bis 8B
Geschwindigkeit mittel
GPU nicht nötig
Investition 0 € extra ✓
Geeignet für Ausprobieren

Jeder vorhandene Laptop reicht für den Start. Llama 3.2 3B oder Mistral 7B laufen auf fast jedem modernen Rechner.

Empfohlen
Apple M-Chip
MacBook Pro / Mac Mini · Unified Memory
Modellgröße bis 70B (M3 Ultra)
Geschwindigkeit sehr schnell ✓
Effizienz herausragend ✓
Lautstärke lautlos ✓
Geeignet für Dauerbetrieb

Unified Memory: GPU und CPU teilen sich denselben RAM. Ein M2 Pro mit 32 GB RAM übertrifft eine NVIDIA RTX 4080 bei lokaler KI – bei einem Bruchteil des Stromverbrauchs.

Fortgeschritten
PC mit NVIDIA GPU
RTX 4070+ · 12–24 GB VRAM
Modellgröße bis 70B (2× GPU)
Geschwindigkeit sehr schnell ✓
Flexibilität hoch ✓
Stromverbrauch hoch
Geeignet für Maximale Leistung

RTX 4070 Ti (12 GB VRAM) für 14B-Modelle, RTX 4090 (24 GB) für 34B-Modelle. Höchste Token-pro-Sekunde-Rate, aber entsprechender Stromverbrauch.

Vergangene Events

Slides & Mitschriften

📂
Noch keine vergangenen Events zu diesem Thema. Komm zum nächsten Meetup!
Lokale KI live ausprobieren?

Jeden dritten Mittwoch im Monat · PotPourri, Köln · Kostenlos

Zum nächsten Event →