
Das lokale Ausführen von Large Language Models (LLMs) erfreut sich für Entwicklung, Datenschutz und Offline-Tests zunehmender Beliebtheit. Ollama macht dies bemerkenswert einfach, sodass Sie Modelle wie Llama 3 oder Mistral direkt auf Ihrem Rechner ausführen können.
Durch den Einsatz von Podman auf Fedora Linux können Sie Ollama in einem Container isolieren. Dieser Ansatz hält Ihr Host-System sauber und ermöglicht es, Ihre KI-Entwicklungsumgebung mühelos zu starten, zu verwalten und wieder zu entfernen.
Was ist Ollama?
Ollama ist ein Open-Source-Framework, das zum Ausführen, Erstellen und Teilen großer Sprachmodelle entwickelt wurde. Es bündelt Modellgewichte, Konfiguration und Daten in einem einheitlichen Verwaltungssystem. Durch den Betrieb in einem Container müssen Sie sich nicht mit komplexen lokalen Abhängigkeiten, Python-Umgebungen oder komplizierten GPU-Treiberkonfigurationen auf Ihrem Basissystem herumschlagen.
Podman überprüfen oder installieren
Podman ist in Fedora Workstation standardmäßig verfügbar. Falls es fehlt, kann es einfach mit DNF installiert werden:
$ sudo dnf install podman -y
Für Fedora Linux Silverblue-Benutzer ist Podman nativ im unveränderlichen Basissystem enthalten und es sind keine weiteren Schritte erforderlich.
Überprüfen Sie Ihre Installation mit:
$ podman --version
Schritt 1: Ein persistentes Volume für Ihre Modelle anlegen
LLM-Gewichtedateien können riesig sein – je nach Modellgröße oft zwischen 4 GB und über 40 GB. Um zu vermeiden, dass Sie diese Modelle bei jedem Neustart des Containers erneut herunterladen müssen, erstellen Sie ein persistentes Podman-Volume, das sie sicher auf Ihrer Host-Festplatte speichert:
$ podman volume create ollama_storage
Schritt 2: Den Ollama-Container starten
Als Nächstes starten Sie den Ollama-Container. Der folgende Befehl lädt das offizielle Image herunter, bindet das gerade erstellte Volume ein und leitet den Kommunikationsport (11434) an Ihren Host-Rechner weiter.
$ podman run -d \ -v ollama_storage:/root/.ollama \ -p 11434:11434 \ --name ollama \ ollama/ollama
Hinweis zur Hardware-Beschleunigung
Der obige Befehl führt Ollama auf Ihrer CPU aus. Wenn Sie Fedora Workstation oder Silverblue verwenden und eine Nvidia-GPU für schnelle Hardware-Beschleunigung durchreichen möchten, stellen Sie sicher, dass das Nvidia Container Toolkit installiert ist, und fügen Sie das GPU-Flag hinzu:
--device nvidia.com/gpu=all
Schritt 3: Ein KI-Modell herunterladen und ausführen
Wenn der Container im Hintergrund läuft, können Sie mit Podmans Ausführungsbefehl damit interagieren. Laden wir Llama 3 herunter und führen es aus – ein hochfähiges, schlankes Modell, das sich perfekt für die lokale Entwicklung eignet:
$ podman exec -it ollama ollama run llama3
Beim ersten Ausführen lädt Podman die Modellgewichte in Ihr ollama_storage-Volume. Sobald der Download abgeschlossen ist, gelangen Sie direkt in eine interaktive Terminal-Eingabeaufforderung:
>>> Send a message (/? for help) >>> Erzähl mir eine lustige Tatsache über Fedora Linux. Fedora Linux ist nach dem ikonischen Filzhut benannt, den der Red Hat Shadowman im Logo trägt! Es begann als Community-Projekt, um zusätzliche Pakete für Red Hat Linux bereitzustellen. >>>
Um die interaktive Eingabeaufforderung zu verlassen, geben Sie einfach /exit ein.
Schritt 4: Mit der lokalen API interagieren
Da wir Port 11434 an unser Host-System weitergeleitet haben, können Sie auch über die integrierte REST-API mit Ihrer lokalen Ollama-Instanz kommunizieren. Öffnen Sie ein normales Terminalfenster und senden Sie eine curl-Anfrage:
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Why use containers?",
"stream": false
}'
Dies liefert eine strukturierte JSON-Antwort mit Ihrer Antwort, sodass Sie Ihr lokales Modell problemlos mit Webanwendungen, Skripten oder IDE-Erweiterungen verbinden können.
Container-Status überprüfen
Um Ihre laufende lokale KI-Instanz zu überwachen, verwenden Sie die klassischen Podman-Verwaltungsbefehle, etwa:
$ podman ps
Sie können auch die Protokolle überprüfen, um sicherzustellen, dass der API-Server korrekt lauscht:
$ podman logs ollama
Wenn Sie Ihre Entwicklungssitzung beendet haben und Systemspeicher freigeben möchten, stoppen Sie den Container:
$ podman stop ollama
Falls Sie die Container-Umgebung jemals vollständig entfernen müssen, verwenden Sie:
$ podman rm ollama
Hinweis: Ihre heruntergeladenen Modelle bleiben im ollama_storage-Volume vollständig sicher und werden beim nächsten Start des Containers sofort wieder eingebunden.
Fazit
Die Verwendung von Podman zur Verwaltung von Ollama auf Fedora Linux oder Fedora Silverblue bietet eine saubere, containerisierte Methode, um Anwendungen mit LLMs vollständig offline zu entwickeln und zu testen. Sie vermeidet eine Verschmutzung der Host-Umgebung, isoliert große Modellspeicher sauber in einem benannten Volume und behandelt Ihren KI-Stack genauso wie jeden anderen Microservice.



