Ollama verständlich erklärt

Ollama ist ein Programm, mit dem sich moderne KI Modelle direkt auf dem eigenen Computer ausführen lassen. Es ermöglicht Gespräche, Textanalyse und viele weitere Aufgaben ohne eine externe Cloud. Nach der Installation läuft im Hintergrund ein lokaler Dienst. Eigene Daten bleiben dadurch auf dem Gerät.

Was ist Ollama

Ollama ist ein Programm, mit dem Du KI-Modelle direkt auf Deinem eigenen Computer nutzen kannst. Stell Dir vor: Du hast ChatGPT-ähnliche Fähigkeiten, aber alles läuft lokal bei Dir. Keine Cloud, keine Internetverbindung nötig, keine monatlichen Kosten.

Nach der Installation läuft im Hintergrund ein Dienst, der KI-Modelle bereitstellt. Du kannst dann:

  • Texte generieren und analysieren
  • Fragen stellen und Antworten bekommen
  • Code schreiben lassen
  • Dokumente zusammenfassen

Der große Vorteil: Alle Daten bleiben auf Deinem Gerät. Niemand sonst sieht, was Du mit der KI besprichst. Das ist besonders wichtig bei vertraulichen Informationen oder wenn Du einfach Wert auf Privatsphäre legst.

Ollama ausprobieren


Du kannst Ollama direkt hier ausprobieren. Ich habe eine Ollama-Instanz auf diesem Server installiert. Du stellst eine Frage, wählst ein Modell aus und siehst innerhalb weniger Sekunden die Antwort. Kein Download, keine Installation auf Deinem Rechner nötig.

Das gibt Dir ein Gefühl dafür, wie eine lokale KI reagiert. Die Antwortqualität hängt vom gewählten Modell ab. Kleinere Modelle sind schneller, größere liefern oft präzisere Antworten. Du kannst verschiedene Modelle miteinander vergleichen.

Alle Anfragen werden anonymisiert protokolliert. Es werden nur technische Daten gespeichert: Timestamp, gewähltes Modell, Performance-Metriken. Keine personenbezogenen Informationen, keine dauerhaften Chatverläufe. Die Demo ist auf 200 Zeichen Input und 1000 Zeichen Output begrenzt.

Verfügbare Modelle

  • Llama 3.2 3B: Kleines, schnelles Modell mit guter Allround-Performance
  • Gemma 3 4B: Instruction-tuned, präzise bei strukturierten Aufgaben
  • CodeLlama 7B: Spezialisiert auf Code-Generierung und technische Fragen
  • Mistral 7B Instruct: Vielseitig, gute Balance zwischen Geschwindigkeit und Qualität

Chat mit Ollama

Modell wählen:

Llama 3.2 3B (schnell, kompakt) Gemma 3 4B (sehr schnell, instruction-tuned) CodeLlama 7B (Code-Spezialist) Mistral 7B Instruct (vielseitig, präzise) Deine Frage: (0/200 Zeichen)

Antwort streamen (Token für Token sichtbar) Senden

Löschen Warte auf Antwort...

Antwort:

Streaming vs. normale Antwort

Ollama unterstützt zwei Antwortmodi: Normal und Streaming.

Im normalen Modus wartet der Client, bis die komplette Antwort generiert wurde. Du siehst dann den vollständigen Text auf einmal. Das dauert länger, aber Du bekommst ein fertiges Ergebnis.

Im Streaming-Modus werden Tokens sofort ausgegeben, sobald sie generiert werden. Du siehst die Antwort Wort für Wort entstehen. Das fühlt sich responsiver an und gibt Dir ein besseres Gefühl für die Geschwindigkeit des Modells. Naja, eigentlich ist es eher für ungeduldige Menschen, die dann das Gefühl bekommen, dass die KI echt schnell antwortet.

Performance-Beobachtungen

Nach dem Absenden siehst Du Metriken wie Token-Durchsatz und Antwortdauer. Diese Werte helfen Dir, die Performance verschiedener Modelle zu vergleichen.

Kleinere Modelle erreichen höhere Token-Raten, liefern aber manchmal weniger präzise Antworten. Größere Modelle brauchen länger, sind dafür oft kohärenter und detaillierter.

Die Token-Rate hängt stark von der Hardware ab. Moderne GPUs erreichen typisch 50-100 tokens/s, CPU-basierte Setups eher 5-15 tokens/s.

Wie man Ollama nutzen kann

Ollama bietet drei Hauptwege, um mit KI-Modellen zu arbeiten. Du kannst den Weg wählen, der am besten zu Deinem Kenntnisstand und Deinen Zielen passt.

Installation

Die Installation von Ollama ist bewusst einfach gehalten. Du lädst ein Programm herunter, installierst es und kannst loslegen. Keine komplizierte Konfiguration, keine versteckten Einstellungen.

Modelle

Ollama unterstützt eine breite Palette von KI-Modellen. Jedes Modell hat unterschiedliche Stärken, und die Wahl hängt davon ab, was Du damit vorhast.

Es gibt z.B. Llama 2 und Llama 3 von Meta – vielseitige Allrounder für viele Aufgaben. Wenn es schnell gehen soll, ist Gemma von Google eine gute Wahl. Für mehrsprachige Anwendungen bietet sich Qwen von Alibaba an. Und wer mit Code arbeitet, findet in DeepSeek Coder einen spezialisierten Begleiter.

Die Modellgröße wird in Parametern gemessen (z.B. 7B = 7 Milliarden Parameter). Größere Modelle liefern oft präzisere Antworten, brauchen aber auch mehr Speicher und Rechenleistung.

Hardware-Anforderungen: Die Modellgröße bestimmt, welche Hardware Du brauchst. Der Speicherbedarf unterscheidet sich je nachdem, ob Du eine GPU hast oder nicht. Die Werte gelten für 4-Bit-Quantisierung.

Mit GPU (empfohlen): 7B-Modelle brauchen circa 5-6 GB VRAM (GPU-Speicher), 13B-Modelle circa 9-12 GB VRAM, und 70B-Modelle circa 45-50 GB VRAM.

Ohne GPU (nur CPU): 7B-Modelle brauchen circa 8 GB RAM (Systemspeicher), 13B-Modelle circa 16 GB RAM, und 70B-Modelle circa 64 GB RAM.

Performance-Unterschied: Mit GPU sind Modelle 10-20× schneller. Ein 7B-Modell schafft mit High-End-GPU 30-100+ tokens/s, mit CPU 2-20 tokens/s (stark hardware-abhängig, Apple Silicon deutlich schneller als x86-CPUs).

Du kannst Modelle mit einfachen Befehlen verwalten: ollama pull llama2 lädt ein Modell herunter, ollama list zeigt alle installierten Modelle, und ollama rm llama2 entfernt ein Modell wieder. Die vollständige Liste verfügbarer Modelle findest Du in der Ollama Library.

Ollama ist production-ready und eignet sich für viele Einsatzszenarien. Für Anwendungen mit extrem hohem Durchsatz (120+ Anfragen pro Sekunde) gibt es spezialisierte Alternativen wie vLLM. Die beiden verfolgen unterschiedliche Ansätze: Ollama macht es einfach, vLLM optimiert für maximalen Durchsatz (bei entsprechend höherem Setup-Aufwand).

Abgrenzung zu vLLM

Ollama und vLLM sind beide Tools für lokale KI-Modelle. Aber sie verfolgen unterschiedliche Ziele und passen zu unterschiedlichen Situationen.

Kurzfazit

Ollama macht KI-Modelle zugänglich für alle. Du brauchst keine Cloud, keine monatlichen Kosten, keine komplizierten Setups. Einfach installieren, Modell laden, loslegen.

---