Ollama
Kostenlos
Ollama ist ein Open-Source-Tool zum Ausführen lokaler Großmodelle mit über 173.000 Sternen auf GitHub. Sie können Llama, DeepSeek, Qwen, Gemma, Mistral und andere Mainstream-AI open source models auf macOS, Windows oder Linux mit einer Befehlszeile ausführen. Es ist keine Cloud erforderlich, die Daten sind vollständig lokal und es werden OpenAI-kompatible API-Schnittstellen bereitgestellt, um die Anwendungsintegration zu erleichtern.
Ollama – Lokales Open-Source-Lauftool für große Modelle
Kernparameter und Statistiken
| Parameter | Einzelheiten |
|---|---|
| GitHub-Sterne | 173.100+ (Stand Juni 2026) |
| GitHub Forks | 16.400+ |
| Open-Source-Lizenz | MIT-Lizenz |
| Unterstützte Betriebssysteme | macOS, Windows, Linux |
| Anzahl unterstützter Modelle | 200+ (die offizielle Modellbibliothek wächst weiter) |
| Neueste Version | v0.30.4 (03.06.2026) |
| API-Kompatibilität | OpenAI API-kompatible Schnittstelle |
| Hardware-Unterstützung | CPU, NVIDIA GPU (CUDA), AMD GPU (ROCm), Apple Silicon (Metall) |
Die zentrale Designphilosophie von Ollama besteht darin, dass „das lokale Ausführen großer Modelle so einfach sein sollte wie die Verwendung von Docker zum Verwalten von Containern“: „ollama pull“ lädt das Modell herunter, „ollama run“ startet die Inferenz und „ollama serve“ stellt die lokale API bereit – der gesamte Prozess wird in drei Schritten abgeschlossen, und Entwickler müssen sich nicht mit komplexer kontextbezogener Konfiguration und Abhängigkeitsverwaltung befassen.
Benutzer- und Markterkennung
– Mit über 173.000 Sternen auf GitHub ist es das am häufigsten heruntergeladene lokale LLM-Lauftool der Welt und verfügt über über 16.000 Forks.
- Die Modellbibliothek unterstützt mehr als 200 gängige Open-Source-Modelle, darunter Llama, DeepSeek, Qwen, Gemma, Mistral, Phi, MiniMax und andere Serien.
- Erhält seit langem eine extrem hohe Aufmerksamkeit in der Entwickler-Community (Hacker News, Reddit r/LocalLLaMA) und steht viele Male ganz oben auf der Liste der GitHub-Trends.
- Nativ in gängige KI-Entwicklungsframeworks wie LangChain, LlamaIndex, Open WebUI und Dify integriert, wodurch ein riesiges Ökosystem entsteht. – Ab Juni 2026 auf die v0.30.x-Serie aktualisiert und wird zu einem der bevorzugten Tools für den privatisierten KI-Einsatz.
Kostenvorteil
| Planen | Kosten | Beschreibung |
|---|---|---|
| Ollama-Ontologie | Völlig kostenlos | Open-Source-MIT-Lizenz, keine Nutzungsbeschränkungen |
| Modell-Download | Völlig kostenlos | Alle offiziellen Modellbibliotheken können kostenlos heruntergeladen werden |
| Cloud API (Vergleich) | 0,01–30 $/Million Token | Typische Auswahl an kommerziellen APIs wie OpenAI, Claude usw. |
| Lokale laufende fortgeführte Anschaffungskosten | Nur Hardware-Abschreibung | Grenzkosten nahe Null bei Hochfrequenznutzung |
Im Vergleich zur Verwendung kommerzieller APIs ist der Kostenvorteil der lokalen Ausführung in Hochfrequenzszenarien erheblich: Wenn eine RTX 4090-Grafikkarte (ca. ¥ 15.000) ein 70B-Parametermodell ausführt und durchschnittlich 10.000 Inferenzen pro Tag durchführt, sind die amortisierten Kosten innerhalb eines Jahres viel niedriger als die Kosten gleichwertiger API-Aufrufe. Darüber hinaus ist für den lokalen Betrieb keine Internetverbindung erforderlich, es gibt keine Geschwindigkeitsbegrenzung und die Antwortverzögerung ist stabiler.
Hauptfunktionen
- Einzeiliger Befehl zum Ausführen des Modells: „ollama run llama3.1“ lädt Llama 3.1 herunter und startet es, wobei Abhängigkeiten und Konfiguration während des gesamten Prozesses automatisch verwaltet werden.
- 200+ Open-Source-Modellunterstützung: Die offizielle Modellbibliothek (ollama.com/library) umfasst Llama, DeepSeek, Qwen, Gemma, Mistral, Phi, Kimi, GLM und andere Serien und aktualisiert kontinuierlich die neuesten Modelle.
- OpenAI-kompatible API: „ollama dienen“ Nach dem Start des lokalen Dienstes stellt dieser eine mit der OpenAI-API kompatible Schnittstelle bereit (
http://localhost:11434). Jede Anwendung, die OpenAI SDK unterstützt, kann zum lokalen Modell wechseln, ohne den Code zu ändern. - Multi-Backend-Hardwarebeschleunigung: Erkennt und nutzt automatisch NVIDIA CUDA, AMD ROCm und Apple Silicon Metal für die GPU-Beschleunigung, die auch auf der CPU läuft (mit einer langsameren Rate).
- Benutzerdefinierte Modelldatei: Die Syntax der Modelldatei ähnelt der von Dockerfile, unterstützt benutzerdefinierte Eingabeaufforderungen für das Modellsystem, Kontextlänge, Sampling-Parameter und Modellzusammenführung und erstellt persönliche exklusive Modellkonfigurationen.
- Unterstützung multimodaler Modelle: Unterstützt visuelle Sprachmodelle wie LLaVA und Llama 3.2 Vision, die Bildverständnisaufgaben lokal erledigen können.
- Modellquantisierungsunterstützung: Bietet verschiedene Quantisierungspräzisionsversionen wie Q4, Q5, Q8 usw., wobei Qualität und Geschwindigkeit flexibel unter RAM-Beschränkungen abgewogen werden.
- Unterstützung eingebetteter Modelle: Unterstützt nomic-embed-text, mxbai-embed-large und andere eingebettete Modelle und kann Vektordatenbanken lokal erstellen.
- REST-API: Zusätzlich zur OpenAI-kompatiblen Schnittstelle wird auch eine native Ollama-REST-API bereitgestellt, die Streaming-Ausgabe und detaillierte Steuerung der Generierungsparameter unterstützt.
Modell- und Versionsentwicklung
Die Ollama-Versionsnummer verwendet das Format „v0.x.y“. Der Schwerpunkt jedes Updates liegt auf der Unterstützung neuerer Modelle, Leistungsoptimierung und Fehlerbehebungen.
| Meilenstein | Zeit |
|---|---|
| Erste öffentliche Version, unterstützt macOS + Llama 2 | 2023-07 |
| Windows offiziell unterstützt | 2024-06 |
| OpenAI-kompatible API online | 2024-09 |
| Unterstützen Sie DeepSeek-R1 | 2025-01 |
| Unterstützt die Qwen 3/3.5-Serie | 2026-04 |
| Unterstützt Kimi-K2.6, GLM-5.1, GPT-oss | 2026-06 |
| Die neueste Version 0.30.4 | 03.06.2026 |
Technische Vorteile
llama.cpp-Kernel: Die unterste Ebene von Ollama verwendet llama.cpp als Inferenz-Engine. llama.cpp ist derzeit die am weitesten verbreitete lokale LLM-Inferenzbibliothek. Es ist umfassend für CPU- und GPU-Hybrid-Inferenz optimiert und unterstützt das GGUF-Formatmodell (quantifizierter Speicher, Reduzierung der Videospeichernutzung).
OpenAI API-Kompatibilitätsschicht: Ollama ist 1:1 kompatibel mit der OpenAI Chat Completions and Embeddings API, was bedeutet, dass Entwickler nur „base_url“ von „https://api.openai.com“ in „http://localhost:11434“ ändern müssen und der gesamte vorhandene Code nahtlos auf dem lokalen Modell ausgeführt werden kann – dies ist eine wichtige Designentscheidung für das explosive Wachstum des Ollama-Ökosystems.
Vollständig lokalisierte Daten: Alle Inferenzprozesse werden auf dem lokalen Gerät abgeschlossen und es werden keine Daten an einen externen Server gesendet, wodurch die Anforderungen finanzieller, medizinischer, rechtlicher und anderer Szenarien erfüllt werden, die strenge Anforderungen an den Datenschutz stellen.
Plattformübergreifende einheitliche Erfahrung: Die CLI-Befehle und API-Verhaltensweisen des Installationspakets von macOS (Apple Silicon + Intel), Windows (x64) und Linux sind vollständig konsistent, und Entwickler müssen keine unterschiedlichen Konfigurationen für verschiedene Plattformen pflegen.
Wie man es benutzt
| Plattform | Installationsmethode |
|---|---|
| macOS | Laden Sie Ollama.app herunter oder „brew install olama“ |
| Windows | Laden Sie das Installationspaket OllamaSetup.exe herunter |
| Linux | curl -fsSL https://ollama.com/install.sh \ | sh |
| Docker | docker run -d -v olama:/root/.ollama -p 11434:11434 olama/ollama |
Typische Schritte:
- Installieren Sie Ollama nach Plattform (Tabelle oben).
- Führen Sie „ollama pull llama3.1“ im Terminal aus (Download-Modell, ca. 4-8 GB).
- Führen Sie „ollama run llama3.1“ aus, um an einer interaktiven Sitzung teilzunehmen.
- Oder starten Sie „Ollama Serve“ und rufen Sie „http://localhost:11434“ mit einem beliebigen OpenAI-Client/SDK auf.
Verwendung mit Open WebUI (empfohlen für Nicht-Befehlszeilenbenutzer): „ docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway ghcr.io/open-webui/open-webui:main „ Besuchen Sie „http://localhost:3000“, um eine ChatGPT-ähnliche visuelle Oberfläche zum Betrieb des lokalen Modells zu erhalten.
Produktpreise
Ollama selbst und alle offiziellen Modelle sind völlig kostenlos und unterliegen der MIT-Open-Source-Lizenz ohne kommerzielle Einschränkungen.
Die einzigen Kosten sind die Hardware-Ressourcen, die zum Ausführen erforderlich sind:
- Start (7B-Modell): Läuft mit 8 GB RAM oder VRAM, z. B. MacBook Air M2 mit Llama 3.2 8B reibungslos.
- Advanced (14-32B-Modell): Erfordert 16-32 GB RAM/VRAM, z. B. Mac Studio M2 Ultra oder RTX 4090.
- Flaggschiff (Modell 70B+): Erfordert 48 GB+ VRAM oder Multi-GPU-Konfiguration.
Für die Bereitstellung eines Unternehmens-Intranets wird „Ollama Serve“ normalerweise auf dem Server ausgeführt. Der Zugriff auf alle Geräte im Intranet erfolgt über die API, und die Hardwarekosten sind viel niedriger als bei langfristigen kommerziellen API-Gebühren.
Anwendungsszenarien
1. Szenario zum Schutz der Privatsphäre Anwälte, Ärzte oder Forscher, die mit sensiblen Daten umgehen, verwenden Ollama, um Modelle zur Dokumentenanalyse und Inhaltserstellung lokal auszuführen. So wird sichergestellt, dass die Daten das lokale Gerät nicht verlassen und das Risiko eines Datenlecks in der Cloud vermieden wird.
2. Lokales Debuggen und Testen für Entwickler Nutzen Sie bei der Entwicklung von KI-Anwendungen das lokale Ausführungsmodell von Ollama, um kommerzielle APIs zu ersetzen, Verzögerungen und Kosten für API-Aufrufe zu vermeiden und den Iterationszyklus zu beschleunigen; Wenn es offiziell gestartet wird, wechselt es zur Cloud-API, ohne den Code zu ändern.
3. Private Bereitstellung eines Unternehmensintranets In Unternehmen, die keinen Zugang zum Internet haben oder strengen Beschränkungen beim Datenexport unterliegen, wird Ollama auf internen Servern bereitgestellt, um ChatGPT-ähnliche private KI-Dienste für das gesamte Unternehmen bereitzustellen, und ist in Kombination mit Front-End-Tools wie Open WebUI schnell implementiert.
4. Lokales RAG-Wissensdatenbanksystem In Kombination mit Einbettungsmodellen wie nomic-embed-text und lokalen Vektordatenbanken wie Chroma und Qdrant kann ein vollständig offline arbeitendes Wissensdatenbank-F&A-System für Unternehmen aufgebaut werden, ohne auf Cloud-Dienste angewiesen zu sein.
Anwendbare Personen
- Entwickler: Ein Standardtool für die lokale Entwicklung und das Testen von KI-Anwendungen. Die OpenAI-kompatible Schnittstelle reduziert die Integrationsschwelle erheblich.
- Privatsphäre-hungrige Fachleute (Anwälte, Ärzte, Forscher): Lokale Inferenz stellt sicher, dass Daten das Gerät niemals verlassen.
- Unternehmens-IT/DevOps-Teams: Stellen Sie private KI-Dienste im Intranet bereit, um Compliance-Anforderungen zu erfüllen und gleichzeitig die langfristigen Kosten zu senken.
- KI-Enthusiasten/Forscher: Probieren Sie bequem verschiedene aktuelle Open-Source-Modelle aus und vergleichen Sie die Auswirkungen verschiedener Modelle.
- Ungeeignete Szenarien: In Produktionsszenarien, die eine extrem hohe Inferenzleistung erfordern (z. B. Dienste mit hoher Parallelität) oder wenn die Gerätehardware nicht ausreicht (weniger als 8 GB RAM), wird die lokale Inferenzerfahrung erheblich eingeschränkt.
Zusammenfassung und Ausblick
Durch minimalistisches Interaktionsdesign und vollständige Kompatibilität mit der OpenAI-API hat Ollama den ursprünglich hochschwelligen Vorgang des „lokalen Ausführens großer Open-Source-Modelle“ erfolgreich in eine öffentlich zugängliche Funktion umgewandelt. Sein über 173.000 GitHub Star ist ein starker Beweis für dieses Wertversprechen.
Die zentrale Wettbewerbsfähigkeit liegt in: kostenlosem Open Source, einer vollständig lokalen OpenAI-kompatiblen Schnittstelle für Daten zur Reduzierung der Migrationskosten und der kontinuierlichen Nachverfolgung der neuesten Open Source-Modelle (können normalerweise innerhalb weniger Tage nach Veröffentlichung der Mainstream-Modelle über Ollama ausgeführt werden).
Haupteinschränkungen: Die Leistung des gleichzeitigen Argumentierens ist nicht so gut wie bei professionellen Cloud-Argumentationsdiensten. Modelle mit sehr großen Parametern (70B+) stellen höhere Hardwareanforderungen. Mangel an Verwaltungs- und Überwachungsfunktionen auf Unternehmensebene.
Nachfolgender Schwerpunkt: Unterstützung weiterer Modellquantifizierungstechnologien (wie EXL2, AWQ), verteilte Inferenz mit mehreren Knoten, tiefe Integration in das MCP-Ökosystem sowie Unternehmensverwaltungs- und Kontrolltools rund um die Ollama-API.
Verwandte Tools:
Umarmendes Gesicht, replicate
Technische Vorteile und Leistungsgrenzen
Als KI-Modell und API-Produkt lassen sich die Kernkompetenzen von Ollama anhand der folgenden Dimensionen tiefgreifend verstehen, die sich direkt auf die Auswirkungen der Technologieauswahl und -implementierung auswirken.
Inferenzleistung und Benchmark-Leistung Die Argumentationsleistung des Modells spiegelt sich in seiner Leistung bei Standard-NLP-Aufgaben wider (Textgenerierung, Codevervollständigung, semantisches Verständnis, Dialog mit mehreren Runden, Informationsextraktion usw.). Es wird empfohlen, einen horizontalen Vergleich anhand öffentlicher Benchmark-Testlisten (wie MMLU, HumanEval, GSM8K usw.) durchzuführen. Bitte beachten Sie jedoch, dass zwischen Benchmark-Testergebnissen und der tatsächlichen Leistung des Geschäftsszenarios eine Lücke bestehen kann. Zu den Schlüsselindikatoren, die sich auf die tatsächliche Benutzererfahrung auswirken, gehören: Inferenzgeschwindigkeit (Token/s oder Antwortverzögerung, die direkt die reibungslose Benutzererfahrung bestimmt), Kontextfensterlänge (die die Eingabegröße bestimmt, die gleichzeitig verarbeitet werden kann, was sich auf die Komplexität der Aufgaben auswirkt, die verarbeitet werden können) und Konsistenz der Ausgabequalität (die Stabilität der Ergebnisse mehrerer Ausgaben derselben Eingabe, die sich auf die Wahrnehmung der Zuverlässigkeit auswirkt).
API-Kompatibilität und Entwicklungsökosystem Die Tiefe der API-Kompatibilität mit gängigen Entwicklungsframeworks (LangChain, LlamaIndex, Semantic Kernel usw.) wirkt sich direkt auf die Kosten und den Zyklus der integrierten Entwicklung aus. Es wird empfohlen, auf die folgenden Integrationsdimensionen zu achten: die Abdeckung der vom SDK unterstützten Sprachtypen (ob Mainstream-Sprachen wie Python, JavaScript, Go und Java über offizielle SDKs verfügen), Streaming-Ausgabeunterstützung (SSE/WebSocket-Protokollkompatibilität), Funktionen für Funktionsaufrufe und Toolnutzung (ob die Zuordnung von Modellausgaben zu strukturierten Funktionsaufrufen unterstützt wird), die Flexibilität der strukturierten Ausgabe (JSON-Modus) und die Fähigkeit zur Integration in die Infrastruktur auf Unternehmensebene (VPC-Bereitstellung, Private Link, einheitliche Identitätsauthentifizierung). Eine vollständige API-Dokumentation und umfangreiche Codebeispiele können die Eintrittsbarriere für die Entwicklung erheblich senken und Integrationszeit und -kosten reduzieren.
Bereitstellungsflexibilität vs. Kostenkompromiss Je nach Datenschutzanforderungen, Latenzempfindlichkeit und Nutzungsumfang kann Ollama zwischen Cloud-API-Aufrufen oder lokalen Bereitstellungsoptionen wählen. Die Vorteile der Cloud-Bereitstellung sind null Betriebs- und Wartungskosten und eine elastische Skalierbarkeit, die sich für Szenarien mit großen Nutzungsschwankungen und einer schnellen Prototypenentwicklung eignet; Die lokale Bereitstellung bietet vollständige Datensouveränität und geringe Latenz (kein Netzwerk-Round-Trip-Overhead), Sie müssen jedoch die Kosten für den Kauf von Hardware wie GPUs sowie Betriebs- und Wartungspersonal tragen. Es wird empfohlen, ein monatliches API-Aufrufvolumen von 1 Million Mal oder eine monatliche Gebühr von 1.000 US-Dollar als Referenztrennlinie zu verwenden: Unterhalb dieses Schwellenwerts weisen Cloud-APIs eine bessere Kosteneffizienz und Flexibilität auf. Nach Überschreiten dieses Schwellenwerts sollten die Gesamtbetriebskosten der Self-Deployment-Lösung umfassend bewertet werden, wobei Faktoren wie Hardware-Abschreibung, Strom, Betriebs- und Wartungspersonal usw. berücksichtigt werden.
Modellauswahl und Versionsstrategie
Für die Auswahl der Modelle der Ollama-Serie wird empfohlen, die Modellfunktionen verschiedener Versionen entsprechend spezifischer Nutzungsszenarien abzustimmen. Die Version mit großen Parametern schneidet bei komplexen Überlegungen und mehrstufigen Aufgaben besser ab, ist jedoch mit höheren Kosten und längeren Verzögerungen verbunden. Die Version mit kleinen Parametern kann in Szenarien wie täglichen Gesprächen und einfachen Fragen und Antworten bereits eine zufriedenstellende Ausgabequalität liefern, und die Kosten betragen nur einen Bruchteil der Kosten der großen Version. Die empfohlene Auswahlstrategie lautet: Verwenden Sie kleine und mittlere Versionen in Standardszenarien, um die Kosten zu senken, und rufen Sie Modelle mit großen Versionen nur auf, wenn komplexe Inferenzaufgaben verarbeitet werden müssen. Diese hierarchische Aufrufstrategie kann die gesamten API-Kosten um 40–60 % senken, ohne die Ausgabequalität wesentlich zu beeinträchtigen.
Versionsinfo
- Ollama v0.30.4 :Die neueste stabile Version unterstützt neue Modelle wie Kimi-K2.6, GLM-5.1, MiniMax, GPT-oss, Gemma 4, Qwen 3.5/3-Coder usw. und optimiert weiterhin die Inferenzleistung und Kompatibilität.
- Ollama v0.24.0 :Wichtige Funktionsaktualisierungen finden Sie im offiziellen Änderungsprotokoll.
- Ollama v0.30.0 :Die Hauptversionsiteration fügt Unterstützung für mehrere neueste Open-Source-Modelle hinzu.
- Ollama erste Open-Source-Version :Die erste öffentliche Version unterstützt die lokale Ausführung von Llama 2 unter macOS und schafft so ein interaktives Paradigma für die „Ausführung von lokalem LLM mit einer Befehlszeile“.
Benutzerbewertungen