Zum Inhalt springen
Raspberry Pi Projekte Fortgeschrittene · Aktualisiert am 27. Juli 2026

Mit Ollama Sprachmodelle lokal nutzen

Ollama lokal verwenden

Hier auf Pollux Labs konntest du bereits darüber lesen, wie du z.B. die API von OpenAI nutzt, um mit ChatGPT zu interagieren. Aber das geht auch lokal auf deinem eigenen Rechner – zwar nicht mit ChatGPT, dafür jedoch mit anderen Sprachmodellen wie Llama 3.2, Gemma 3, Mistral, Qwen und vielen anderen. Hierfür nutzt du das Tool Ollama. In diesem Tutorial erfährst du, wie du es installierst, einrichtest und mit Python mit dem Modell deiner Wahl interagierst.

Ollama installieren

Wenn du einen Mac oder Windows benutzt, musst du Ollama erst hier auf der offiziellen Webseite herunterladen.

Ollama herunterladen

Falls du Linux verwendest, gib im Terminal den folgenden Befehl ein:

curl -fsSL https://ollama.com/install.sh | sh

Entpacke nach dem Download die ZIP-Datei (Mac) und starte das Programm oder starte direkt die .exe (Windows). Anschließend führt dich ein Wizard durch die nächsten Schritte, damit du Ollama im Terminal verwenden kannst. Am Ende erhältst du den Befehl für einen ersten Test.

Ollama-Wizard

Kopiere den Befehl und gib ihn im Terminal bzw. der Konsole ein. Anschließend wird das Sprachmodell Llama2 heruntergeladen. Dieses Modell stammt vom Facebook-Konzern Meta. Wie du auf dem Bild unten siehst, ist das mit 3,8 Gigabyte nicht gerade klein – achte also auf genügend Speicherplatz.

Hinweis: Inzwischen schlägt dir Ollama beim ersten Start meist ein neueres Modell vor (zum Beispiel llama3.2). Die Screenshots unten zeigen noch Llama2 – am grundsätzlichen Ablauf ändert das nichts. Weiter unten stelle ich dir aktuellere Modelle vor.

Download von Llama2 im Terminal

Ollama im Terminal verwenden

Um mit deinem ersten Sprachmodell (Llama2) loszulegen, kannst du direkt im selben Fenster bleiben. Du erhältst nach der erfolgreichen Installation eine Eingabeaufforderung, über die du deine erste Frage stellen kannst – so wie du es vermutlich bereits von ChatGPT kennst. Nach wenigen Sekunden erhältst du dann die Antwort ebenfalls im Terminal:

Llama2 über Ollama im Terminal

Das funktioniert also schon einmal ganz gut. Das Beispiel oben ist auf Englisch – du kannst deine Fragen jedoch auch ebenso auf Deutsch stellen. Die Antwort erhältst du von Llama2 jedoch wiederum auf Englisch. Um Antworten auf Deutsch zu erhalten füge deinem Prompt noch eine entsprechende Anweisung hinzu.

Wenn du deine Session beenden möchtest, gib einfach den Befehl /bye ein.

Ein anderes Sprachmodell in Ollama installieren

Du bist natürlich nicht auf Llama2 beschränkt. Auf der Ollama-Webseite sowie auf deren GitHub-Seite kannst du alle verfügbaren Sprachmodelle einsehen – dort steht auch, wieviel Arbeitsspeicher ein Modell benötigt. Seit dem Erscheinen dieses Tutorials sind viele neue und teils deutlich kompaktere Modelle dazugekommen, die sich besser für den Alltag und für sparsame Hardware eignen. Ein paar aktuelle Empfehlungen:

  • llama3.2 – Metas kompakter Nachfolger von Llama2, in den Größen 1B und 3B und bereits ordentlich auf Deutsch.
  • gemma3 – Googles aktuelles Modell, ebenfalls in kleinen Größen (1B, 4B) verfügbar.
  • qwen2.5 – sehr stark über mehrere Sprachen hinweg, von 0,5B bis 3B und damit ideal für kleine Rechner.
  • mistral (4,1 GB) – der bewährte Klassiker, wenn genügend Arbeitsspeicher vorhanden ist.

Ein neues Modell installierst du genauso wie zuvor – gib hierfür im Terminal folgenden Befehl ein, nachdem du deine aktive Session mit /bye beendet hast:

ollama run llama3.2

Nach der Installation kannst du mit dem neuen Modell interagieren, so wie du es vorher mit Llama2 getan hast.

Ollama auf dem Raspberry Pi

Da du dieses Tutorial in der Raspberry-Pi-Kategorie findest: Ollama läuft auch auf dem Einplatinenrechner – allerdings ist hier der Arbeitsspeicher der begrenzende Faktor. Am besten eignet sich ein Raspberry Pi 5 mit 8 oder 16 GB RAM. Auf einem Pi 4 solltest du bei den ganz kleinen Modellen (1B bis 3B, etwa llama3.2 oder gemma3) bleiben. Rechne auf dem Pi generell mit deutlich längeren Antwortzeiten als auf einem Mac oder PC – zum Ausprobieren und für kleine Projekte reicht es aber allemal.

Das Sprachmodell von Mistral ist mit 4,1 GB sogar noch etwas größer als Llama2. Es ist also hilfreich zu wissen, wie du installierte Modelle wieder loswirst. Ganz einfach – Um z.B. Llama2 zu entfernen, gib im Terminal den folgenden Befehl ein:

ollama rm llama2

Falls du vergessen hast, welche Modelle du gerade installiert hast, hilft dir folgender Befehl weiter:

ollama list

Ollama mit Python verwenden

Bis jetzt hast du „nur“ im Terminal mit deinem lokalen Sprachmodell kommuniziert. Du kannst aber hierfür natürlich auch ein Python-Script verwenden, ähnlich wie ich es hier schon einmal für ChatGPT beschrieben habe.

Zunächst musst du hierfür die entsprechende Bibliothek installieren:

pip3 install ollama

Erstelle nach der erfolgreichen Installation ein leeres Python-Script mit folgendem Inhalt:

import ollama
response = ollama.chat(model='llama3.2', messages=[
  {
    'role': 'user',
    'content': 'Welche Farben können Bären haben? Antworte auf Deutsch.',
  },
])
print(response['message']['content'])

Im obigen Script ist das Sprachmodell Llama 3.2 hinterlegt. Falls du ein anderes verwendest, trage es in der zweiten Zeile hinter model= ein.

Speichere die Datei nun ab und führe sie aus. Vermutlich wirst du ziemlich lange warten müssen, bis die Antwort erscheint. Das kannst du mit einem Stream verbessern – hierdurch erscheint die lange Antwort Wort für Wort zum Mitlesen. Verwende hierfür den folgenden angepassten Code:

import ollama

stream = ollama.chat(
    model='llama3.2',
    messages=[{'role': 'user', 'content': 'Welche Farben können Bären haben? Antworte auf Deutsch'}],
    stream=True,
)

for chunk in stream:
  print(chunk['message']['content'], end='', flush=True)

Weitere Rollen verwenden

Ähnlich wie bei ChatGPT kannst du auch in Ollama in deinen Rollen zuteilen. Wenn du also deine Antworten z.B. immer auf Deutsch erhalten möchtest, hilft dir die Rolle system weiter. Dort kannst du die entsprechende Anweisung hinterlegen, sodass die Rolle user nur deine Frage enthält:

messages=[{'role': 'user', 'content': 'Welche Farben können Bären haben?'},
          {'role': 'system', 'content': 'Antworte auf Deutsch'}],

Jetzt kennst du die Grundlagen, um mit Ollama auf deinem eigenen Rechner Sprachmodelle auszuführen und in deine Projekte einzubinden. Es gibt natürlich noch viel mehr zu entdecken: Die verschiedenen Modelle besitzen alle unterschiedliche Fähigkeiten – hier lohnt sich ein intensiver Blick, besonders da die Entwicklung natürlich nicht stehen bleibt.