Lokale KI & Tools
KI ohne Cloud – deine Gespräche, deine Daten, dein Gerät. Lokale Sprachmodelle laufen heute auf normalen Laptops, sind kostenlos und senden keine einzige Anfrage ins Internet. Wir zeigen, wie du in zehn Minuten startest.
KI ohne Überwachung
ChatGPT, Gemini, Copilot – alle senden deine Anfragen an Server großer Konzerne in den USA. Was du fragst, wird gespeichert, analysiert und zum Training neuer Modelle verwendet. Die Nutzungsbedingungen von OpenAI erlauben ausdrücklich, Konversationen für Training zu nutzen, sofern du nicht aktiv widersprichst. Deine Gedanken, Fragen und Probleme werden zu Trainingsdaten eines kommerziellen Produkts.
„Ein KI-Modell auf deinem Laptop sieht niemand außer dir. Keine API-Keys, keine Datenschutzerklärung, keine monatlichen Kosten – und für viele Alltagsaufgaben genauso gut wie ChatGPT."
Die gute Nachricht: Seit 2023 sind leistungsfähige Open-Source-Modelle verfügbar, die auf normaler Hardware laufen. Llama von Meta, Mistral aus Frankreich, Phi von Microsoft – alle kostenlos, alle lokal ausführbar. Ein MacBook mit M-Chip oder ein PC mit 16 GB RAM reicht für viele Modelle vollständig aus. Mit Ollama oder LM Studio dauert die Installation weniger als zehn Minuten.
Lokale KI ist nicht nur Privatsphäre. Es ist digitale Souveränität: Du entscheidest, welches Modell du nutzt, wie es konfiguriert ist, und niemand kann es dir wegnehmen oder hinter einer Paywall verstecken.
In zehn Minuten zur eigenen KI
ollama.com aufrufen, herunterladen, installieren. Fertig. Ollama läuft im Hintergrund und verwaltet Modelle wie ein Paketmanager. Funktioniert auf macOS, Linux und Windows – kein Konto, keine Registrierung, keine Internetverbindung nach der Installation nötig.
Ollama
Im Terminal: ollama run llama3.2 – das Modell
wird heruntergeladen (ca. 2 GB) und startet sofort. Du kannst
direkt draufloschatten. Wer kein Terminal will: LM Studio bietet
die gleiche Erfahrung mit grafischer Oberfläche.
Open WebUI gibt dir eine ChatGPT-ähnliche Oberfläche im Browser – mit Gesprächsverlauf, Datei-Upload und Modellwechsel auf Knopfdruck. Läuft als Docker-Container auf deinem Rechner, erreichbar unter localhost. Deine Chats bleiben lokal gespeichert.
Open WebUI · DockerOllama und Open WebUI auf dem Homeserver einrichten – dann steht die KI allen Geräten im Heimnetz zur Verfügung: Laptop, Handy, Tablet. Kein Cloud-Abo, kein Datenschutz-Kompromiss. Wer bereits einen Homelab-Server hat (Track 03), kann das sofort umsetzen.
Homeserver · Ollama · Open WebUIWas wir empfehlen
Grafische Oberfläche für lokale KI-Modelle – herunterladen, installieren, chatten. Kein Terminal nötig. Integrierter Modell-Browser, Chat-Interface und lokaler API-Server. Ideal für den ersten Einstieg.
lmstudio.ai ↗Der Standard für lokale KI-Modelle. Ein Befehl im Terminal – und Llama, Mistral oder Phi laufen lokal. Bietet eine REST-API, die andere Tools (Open WebUI, AnythingLLM) nutzen können. Für macOS, Linux und Windows.
ollama.com ↗ChatGPT-ähnliche Web-Oberfläche für Ollama. Self-hosted via Docker. Gesprächsverlauf, Datei-Upload, Modellwechsel, Benutzerkonten – alles lokal. Ideal auf dem Homeserver für alle Geräte im Netz.
openwebui.com ↗KI mit eigenem Wissen: Dokumente, PDFs, Webseiten hochladen – das Modell beantwortet Fragen auf Basis deiner Inhalte (RAG). Desktop-App oder self-hosted. Kein einziges Byte verlässt deinen Rechner.
anythingllm.com ↗KI-Assistent der Bitköln-Community. Datenschutzfreundlich, lokal ausführbar, auf unsere Themen rund um digitale Souveränität zugeschnitten. Komm zum Meetup und probier ihn live aus.
Metas Open-Source-Flaggschiff. Das 8B-Modell läuft flüssig auf 16 GB RAM, das 3B-Modell sogar auf 8 GB. Sehr gute Allround-Qualität, stark in Deutsch, aktiv weiterentwickelt.
ollama.com/library/llama3.2 ↗Europäisches Open-Source-Modell aus Paris. Effizient, schnell, mehrsprachig – besonders gut in Deutsch und Französisch. Mistral 7B läuft auf 8 GB RAM, ideal für schwächere Hardware.
ollama.com/library/mistral ↗Kleines Modell, große Leistung. Phi-4 mit 14B Parametern übertrifft in vielen Benchmarks deutlich größere Modelle. Läuft auf 16 GB RAM, gut geeignet für Programmieraufgaben und Analyse.
ollama.com/library/phi4 ↗Alibabas Open-Source-Modell, stark mehrsprachig und sehr gut in Programmieraufgaben (Qwen-Coder-Variante). In vielen Benchmarks auf Augenhöhe mit deutlich größeren Modellen.
ollama.com/library/qwen2.5 ↗OpenClaw – KI für digitale Souveränität
OpenClaw ist der KI-Assistent der Bitköln-Community. Kein kommerzielles Produkt, keine versteckten Interessen – ein gemeinsam gepflegtes Werkzeug, das auf unsere Themen zugeschnitten ist: Bitcoin, Privatsphäre, Homelab, digitale Selbstbestimmung. OpenClaw läuft lokal, sendet keine Daten, und kann von jedem aus der Community weiterentwickelt werden.
„OpenClaw beantwortet keine Fragen für dich – er hilft dir, die richtigen Fragen zu stellen. Und die Antworten bleiben bei dir."
Technisch ist OpenClaw ein speziell konfiguriertes lokales Sprachmodell mit einem System-Prompt, der auf unsere Community-Themen abgestimmt ist. Er kennt die Tools, die wir empfehlen, die Prinzipien, die uns leiten, und die Fragen, die Einsteiger typischerweise mitbringen. Komm zum Meetup – dort läuft OpenClaw live und du kannst ihn direkt ausprobieren.
OpenClaw läuft auf deinem Gerät oder dem Community-Server. Kein Konto, keine API, kein Tracking. Deine Fragen bleiben deine Fragen.
System-Prompt mit Bitköln-Kontext: Tools, Empfehlungen, Prinzipien. Auf unsere sieben Themen-Tracks zugeschnitten – kein generisches KI-Allgemeinwissen.
Konfiguration, System-Prompt und Setup-Skripte liegen offen. Wer etwas verbessern will, ist herzlich eingeladen – Pull Requests willkommen.
Jeden dritten Mittwoch läuft OpenClaw auf dem Community-Rechner. Frag ihn zu Bitcoin-Wallets, Homelab-Setup oder Messenger-Auswahl – und schau, was rauskommt.
Was steckt hinter den Modellen?
Sprachmodelle werden in Parametern gemessen: Ein 7B-Modell hat 7 Milliarden Parameter – grob gesagt, Zahlen, die das gelernte Weltwissen kodieren. Mehr Parameter bedeuten in der Regel bessere Qualität, aber auch mehr RAM-Bedarf. Für die meisten Alltagsaufgaben sind 7–14 Milliarden Parameter vollkommen ausreichend.
„Quantisierung macht große Modelle klein: Ein 14B-Modell in 4-Bit-Quantisierung braucht nur ~9 GB RAM – mit kaum spürbarem Qualitätsverlust."
Ollama lädt Modelle automatisch in optimierter Quantisierung herunter. Du musst nichts manuell konfigurieren. Das Modell-Format heißt GGUF und stammt von der Community rund um llama.cpp – dem Motor, der hinter Ollama und LM Studio steckt. Die Hardware-Nutzung ist dabei intelligent: Auf Apple-Silicon-Macs nutzt Ollama die GPU-Kerne des M-Chips vollständig aus. Auf NVIDIA-Karten wird CUDA genutzt. Ohne GPU läuft alles auf der CPU – langsamer, aber funktional.
Llama 3.2 3B oder Mistral 7B in Q4-Quantisierung. Für einfache Aufgaben, Fragen, kurze Texte. Antwortet in Sekunden.
Llama 3.2 8B, Phi-4 14B, Mistral 7B in voller Qualität. Dieser Sweetspot deckt 95 % der Alltagsanwendungen vollständig ab.
Llama 3.3 70B, Qwen 2.5 72B – Modelle auf GPT-4-Niveau, vollständig lokal. Für anspruchsvolle Analyse, langen Kontext, Coding.
Qwen-Coder für Programmierung, DeepSeek-R1 für Reasoning und Mathematik, Nomic-Embed für semantische Suche in eigenen Dokumenten (RAG).
Was läuft auf welchem Gerät?
Jeder vorhandene Laptop reicht für den Start. Llama 3.2 3B oder Mistral 7B laufen auf fast jedem modernen Rechner.
Unified Memory: GPU und CPU teilen sich denselben RAM. Ein M2 Pro mit 32 GB RAM übertrifft eine NVIDIA RTX 4080 bei lokaler KI – bei einem Bruchteil des Stromverbrauchs.
RTX 4070 Ti (12 GB VRAM) für 14B-Modelle, RTX 4090 (24 GB) für 34B-Modelle. Höchste Token-pro-Sekunde-Rate, aber entsprechender Stromverbrauch.