KI-Vergleich

Beste Open-Source-KI-Modelle 2026: Der Daten-Vergleich

10 Min. Lesezeit

Wichtigste Erkenntnisse

Kimi K3 ist derzeit der stärkste Open-Weight-Allrounder. Es führt das offene Leaderboard bei Gesamt-, Reasoning- und Coding-Index an und unterstützt ein Kontextfenster von 1.048.576 Tokens.
GLM-5.2 ist der stärkste günstigere Zweitplatzierte in der erfassten Tabelle. Es erreicht 46.8 insgesamt und 38.4 beim Coding, bietet eine Million Tokens Kontext und MIT-lizenzierte Gewichte.
DeepSeek V4 Flash ist der API-Preisführer. DeepSeek nennt derzeit $0.14 pro Million nicht gecachter Input-Tokens und $0.28 pro Million Output-Tokens bei einer Million Tokens Kontext.
Eine Million Tokens Kontext ist nicht mehr einzigartig. Kimi K3, GLM-5.2 und beide DeepSeek-V4-Stufen geben ungefähr eine Million Input-Tokens an.
„Offen“ bedeutet nicht uneingeschränkt. Kimi K3 nutzt eine eigene Lizenz mit kommerziellen Bedingungen; andere Modellfamilien verwenden andere Regeln. Prüfe das konkrete Modellartefakt und die genaue Version.
Die Hardware verändert das Ranking. Ein Modell, das über eine gehostete API günstig ist, kann beim Self-Hosting eine kostspielige Multi-GPU-Infrastruktur verlangen.

Die meisten Produkte, die als „Open-Source-KI“ bezeichnet werden, sind genauer gesagt Open-Weight-Modelle: Ihre Gewichte können heruntergeladen werden, doch Trainingsdaten, Code oder Lizenz erfüllen möglicherweise nicht die vollständige Open-Source-Definition. Im Snapshot des LLM Stats Open LLM Leaderboards vom 7. August 2026 ist Kimi K3 mit einem Gesamtscore von 55.4, einem Reasoning-Index von 54.5 und einem Coding-Index von 45.4 der klare Open-Weight-Spitzenreiter. GLM-5.2 folgt mit 46.8 insgesamt, während DeepSeek V4 Flash als besonders günstige API-Option auffällt.

Die beste Wahl hängt dennoch vom Deployment ab. Kimi K3 bietet die höchste gemessene Leistungsfähigkeit, hat aber insgesamt 2,8 Billionen Parameter. GLM-5.2 ist kleiner, bleibt mit 744 Milliarden Parametern jedoch ein großes Mixture-of-Experts-Modell. DeepSeek V4 Flash aktiviert weniger Parameter und veröffentlicht sehr niedrige API-Preise. Herunterladbare Gewichte machen keines dieser Modelle automatisch günstig im Self-Hosting.

Kurze Antwort: Welches Open-Source-KI-Modell ist das beste?

Wähle Kimi K3, wenn maximale Open-Weight-Leistung zählt, GLM-5.2 für ein starkes MIT-lizenziertes Coding- und Agenten-Modell und DeepSeek V4 Flash, wenn API-Kosten und Durchsatz am wichtigsten sind. Für die lokale Bereitstellung auf einer Workstation passt keines dieser Frontier-Modelle automatisch; vergleiche kleinere quantisierte Modelle separat anhand deiner tatsächlichen Speicher- und Latenzgrenzen.

Vergleich: Die besten Open-Weight-Modelle

Die folgenden Scores stammen aus dem Live-Leaderboard für offene Modelle von LLM Stats. Der Blended-Preis verwendet ein Verhältnis von 8:1 zwischen Input und Output sowie aktuelle öffentliche API-Preise, soweit verfügbar. Ein Gedankenstrich bedeutet, dass im Snapshot kein verlässlich vergleichbarer Wert aufgeführt war.

ModellAnbieterGesamtReasoningCodingKontextBlended-API-Preis/1M
Kimi K3Moonshot AI55.454.545.41.0M$4.33
GLM-5.2Z.ai46.846.138.41.0M$1.18*
Kimi K2.6Moonshot AI44.644.835.2262K$1.06*
DeepSeek-V4-Pro-MaxDeepSeek43.743.933.71.0M$0.48**
GLM-5.1Z.ai40.440.133.1200K$1.73*
Qwen3.5-397B-A17BQwen39.739.523.1
DeepSeek-V4-Flash-MaxDeepSeek39.440.229.41.0M$0.16**

* Vom Anbieter erfasster Preis im LLM-Stats-Snapshot. ** Berechnet aus den aktuellen offiziellen API-Preisen von DeepSeek für deepseek-v4-pro und deepseek-v4-flash; LLM Stats verwendet für die entsprechenden erfassten Einträge die Bezeichnung „Max“.

Daten-Ansicht: Gesamtscore offener Modelle

Kimi K3 führt in diesem Snapshot mit großem Abstand. Die Scores sind dynamisch und können sich ändern, wenn Benchmark-Eingaben oder Live-Messungen aktualisiert werden. Behandle das Diagramm deshalb als datierte Shortlist und nicht als dauerhaftes Urteil.

LLM StatsSnapshot: 7. August 2026
Gesamtscore führender Open-Weight-Modelle
Score aus statischem LLM-Stats-Snapshot. Keine Live-API im Browser.

Daten-Ansicht: Reasoning und Coding

Die beiden Indizes belohnen unterschiedliches Verhalten. Reasoning bildet Signale für schwierige Problemlösung ab; Coding kombiniert Software-Engineering-Benchmarks und Arena-Daten. Kimi K3 führt in der aktuellen Tabelle offener Modelle bei beiden Werten, GLM-5.2 ist der nächste erfasste Herausforderer.

LLM StatsSnapshot: 7. August 2026
Reasoning-Index der Open-Weight-Modelle
Score aus statischem LLM-Stats-Snapshot. Keine Live-API im Browser.
LLM StatsSnapshot: 7. August 2026
Coding-Index der Open-Weight-Modelle
Score aus statischem LLM-Stats-Snapshot. Keine Live-API im Browser.

Was hat sich seit Juni 2026 verändert?

Die vorherige Version dieses Artikels nannte Kimi K2.6, GLM-5.1 und DeepSeek V4 Pro als Spitzenreiter. Zwei Releases haben diese Reihenfolge verändert:

  • Moonshot AI veröffentlichte Kimi K3, ein nativ multimodales Mixture-of-Experts-Modell mit insgesamt 2,8 Billionen und 104 Milliarden aktivierten Parametern sowie einem Kontextfenster von 1.048.576 Tokens.
  • Z.ai veröffentlichte die offizielle GLM-5.2-Modellkarte unter der MIT-Lizenz, mit insgesamt 744 Milliarden, 40 Milliarden aktivierten Parametern und einer Million Tokens Kontext.
  • DeepSeek aktualisierte den aktuellen Flash-Endpunkt auf DeepSeek-V4-Flash-0731 und stellte die alten Aliase deepseek-chat und deepseek-reasoner nach dem 24. Juli ein.

Modellkarten der Anbieter sind für Architektur-, Lizenz- und Deployment-Details hilfreich. Die modellübergreifenden Scores in diesem Artikel stammen von LLM Stats und nicht aus einem Vergleich der von jedem Anbieter bevorzugten eigenen Benchmarks.

Beste Open-Weight-KI nach Anwendungsfall

Bester Open-Weight-Allrounder: Kimi K3

Kimi K3 ist das erste Modell, das du prüfen solltest, wenn du die derzeit höchste Open-Weight-Leistung suchst. Es führt das offene Leaderboard an, akzeptiert Text und Bilder und unterstützt eine Million Tokens. Moonshot positioniert es für langfristige Coding- und Wissensarbeit.

Der Kompromiss ist die Größe. Insgesamt 2,8 Billionen Parameter und die eigene Kimi-K3-Lizenz bedeuten, dass das Deployment sowohl einen Infrastrukturplan als auch eine rechtliche Prüfung benötigt. „Open Weights“ heißt weder laptopfreundlich noch frei von Einschränkungen.

Bestes offenes Modell für Coding und Agenten: GLM-5.2

GLM-5.2 ist nach Kimi K3 die stärkste erfasste Alternative und das Modell mit dem zweithöchsten Coding-Score in der Tabelle. Z.ai veröffentlicht MIT-lizenzierte BF16- und FP8-Gewichte sowie Deployment-Anleitungen. Sein Kontext von einer Million Tokens ist für lang laufende Aufgaben ausgelegt, doch ein 744B-A40B-Modell erfordert weiterhin erhebliche Hardware.

Günstigste gehostete API: DeepSeek V4 Flash

DeepSeek V4 Flash ist die praktische Kostenwahl. Die offizielle API nennt derzeit $0.14 pro Million nicht gecachter Input-Tokens und $0.28 pro Million Output-Tokens sowie deutlich niedrigere Preise bei Cache-Treffern. Das Modell unterstützt Thinking- und Non-Thinking-Modi, Tool-Aufrufe und eine Million Tokens Kontext.

DeepSeek kündigt außerdem eine Preiserhöhung an. Prüfe vor der Kalkulation von Produktionskosten die aktuelle Preisseite, statt den heutigen Preis als dauerhaft anzunehmen.

Am besten für maximalen offenen Kontext

Kimi K3, GLM-5.2, DeepSeek V4 Pro und DeepSeek V4 Flash geben alle ungefähr eine Million Input-Tokens an. Es gibt keinen einzelnen Kontext-Sieger. Entscheide anhand von Retrieval-Qualität, nutzbarem Output-Limit, Latenz und der Genauigkeit, mit der das Modell weit hinten im Prompt liegendes Material zitiert.

Am besten für Workstation oder kleinen Server

Dieses Frontier-Leaderboard ist für diese Entscheidung das falsche Werkzeug. Die Spitzenreiter sind enorme Mixtures of Experts. Definiere für den lokalen Einsatz zuerst den verfügbaren RAM oder VRAM und vergleiche dann kleinere quantisierte Varianten bei der konkreten Aufgabe. Ein niedriger bewertetes Modell, das in den Speicher passt und zuverlässig antwortet, kann das bessere System sein.

Open Source vs. Open Weights

„Open Weights“ bedeutet, dass die Modellparameter heruntergeladen werden können. Echtes Open Source verlangt normalerweise breitere Transparenz und eine offene Lizenz für die Software, die zum Untersuchen, Ändern und Weitergeben des Systems nötig ist. Trainingsdaten und der vollständige Trainingsprozess sind häufig nicht enthalten.

Die Unterscheidung ist für die kommerzielle Nutzung wichtig:

  • die GLM-5.2-Modellgewichte sind unter MIT veröffentlicht;
  • Kimi K3 nutzt die eigene Kimi-K3-Lizenz mit Bedingungen für einige große kommerzielle Dienste und Produkte;
  • DeepSeek veröffentlicht Gewichte und eigene Modellbedingungen;
  • einzelne Qwen-Modelle können unterschiedliche Lizenzen haben.

Prüfe immer die Lizenz des konkreten Checkpoints und nicht nur die Marketingseite der Modellfamilie.

So vergleichst du offene Modelle fair

Öffentliche Scores sind eine Shortlist, keine Beschaffungsentscheidung. Teste jeden Kandidaten mit deiner Sprache, deinem Tool-Stack, deinen Sicherheitsanforderungen und deiner Deployment-Form. Miss:

  1. Aufgabengenauigkeit und Fehlerrate;
  2. Latenz und Durchsatz bei der erwarteten Parallelität;
  3. GPU-Speicher, Energie- und Betriebskosten;
  4. Kontexttreue bei deinen echten Dokumenten;
  5. Eignung von Lizenz und Data Governance.

Vergleiche die Gesamtkosten von Hosting und Self-Hosting getrennt. Ein niedriger Tokenpreis enthält die Infrastruktur des Anbieters; beim Self-Hosting verlagern sich diese Kosten auf deine GPUs, Engineering, Monitoring und Kapazitätsplanung.

Fazit

Am 7. August 2026 ist Kimi K3 der führende Open-Weight-Allrounder, GLM-5.2 der stärkste erfasste Zweitplatzierte für Coding und lang laufende Agenten und DeepSeek V4 Flash die günstige Wahl für eine gehostete API. Alle drei unterstützen ungefähr eine Million Tokens, sodass die Kontextgröße allein das Ranking nicht mehr entscheidet. Prüfe vor dem Deployment die genaue Lizenz und führe eine hardwarebewusste Evaluation durch.

Weiterlesen: KI-Vergleich 2026 · Beste KI zum Programmieren · ChatGPT-Alternativen

Referenzen

  1. LLM Stats: Snapshot zu Leistung, Kontext und Anbieterpreisen offener Modelle. Open LLM Leaderboard
  2. LLM Stats: Methodik für Benchmarks und Live-Daten. LLM Stats Methodology
  3. Moonshot AI: Architektur, Deployment und Lizenz von Kimi K3. Kimi-K3-Modellkarte
  4. Z.ai: Architektur, Checkpoints, Deployment und MIT-Lizenz von GLM-5.2. GLM-5.2-Modellkarte
  5. DeepSeek: Veröffentlichung von V4 Pro und Flash, offene Gewichte und Kontext. DeepSeek-V4-Release
  6. DeepSeek: aktuelle Modellnamen, Kontext, Funktionen und API-Preise. DeepSeek-Modelle und -Preise

Alle diese Modelle an einem Ort nutzen

PUNKU.AI verbindet Claude, Gemini, GPT und weitere Modelle in einer Plattform. Erstellen Sie daraus KI-Agenten für Ihre Aufgaben, ohne Abo-Chaos und ohne Code.

Kostenlos starten

Kostenlos testen • Modelle frei wechseln • Jederzeit kündbar

Häufig gestellte Fragen

Welches ist 2026 das beste Open-Source-KI-Modell?

Im LLM-Stats-Snapshot vom 7. August führt Kimi K3 die Open-Weight-Modelle mit einem Gesamtscore von 55.4, einem Reasoning-Index von 54.5 und einem Coding-Index von 45.4 an. GLM-5.2 ist mit 46.8 insgesamt der nächste erfasste Allrounder.

Sind Open-Weight-Modelle so gut wie ChatGPT oder Claude?

Kimi K3 liegt im aktuellen Composite-Leaderboard nahe an den Frontier-Modellen, aber kein einzelner Score beweist Gleichwertigkeit über alle Aufgaben hinweg. Produkt-Tools, Sicherheitsverhalten, Latenz, Modalitäten und Zuverlässigkeit können wichtiger sein als der aggregierte Abstand.

Was ist der Unterschied zwischen Open Source und Open Weights?

Open Weights bedeutet, dass die trainierten Parameter heruntergeladen werden können. Open Source ist ein breiterer Standard, der außerdem von Lizenzen und dem Zugang zu Code und Materialien abhängt, die zur Untersuchung und Änderung des Systems nötig sind. Prüfe immer die genaue Modelllizenz.

Welches Open-Weight-Modell ist am günstigsten?

Für die Nutzung über eine gehostete API hat DeepSeek V4 Flash unter den hier verglichenen Frontier-Modellen derzeit den niedrigsten offiziellen Preis: $0.14 pro Million nicht gecachter Input-Tokens und $0.28 pro Million Output-Tokens. DeepSeek weist darauf hin, dass diese Preise steigen können. Prüfe sie daher vor dem Deployment.

Kann ich diese Modelle selbst hosten?

Ja, ihre Gewichte sind verfügbar, aber die Spitzenmodelle sind sehr groß. Kimi K3 hat insgesamt 2,8 Billionen Parameter und GLM-5.2 744 Milliarden. Self-Hosting erfordert kompatible Inferenzsoftware, mehrere Beschleuniger mit viel Speicher und ein Betriebsbudget; kleinere quantisierte Modelle können praktischer sein.