Zum Hauptinhalt springen

Neue KI-Modelle August 2026: Sonnet 5, Opus 5, GPT-5.6 und Kimi K3 im Vergleich

Claude Sonnet 5 wird dauerhaft günstig, GPT-5.6 fällt im Preis, und aus China kommen zwei neue Open-Source-Modelle. Was das für dein Unternehmen bedeutet.

8 min readTill OberhummerTill Oberhummer
Neue KI-Modelle August 2026: Sonnet 5, Opus 5, GPT-5.6 und Kimi K3 im Vergleich

Update September 2026: Seit diesem Artikel sind GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash und DeepSeek V4.1 Flash erschienen. Die aktuelle Ausgabe mit allen neuen Modellen im Vergleich: Neue KI-Modelle September 2026.

Das Wichtigste in Kürze

Zwischen 24. Juli und 11. August 2026 gab es fünf relevante Ereignisse: Claude Opus 5 (neues Anthropic-Flaggschiff, 24. Juli), Kimi K3 aus China mit frei verfügbaren Gewichten (26. Juli), ein OpenAI-Preisschnitt bei GPT-5.6 Luna und Terra (30. Juli, plus unlimitierter Gratis-Zugang seit 6. August), Qwen 3.8 Max von Alibaba (3. August) — und Anthropic machte am 11. August die günstige Einführungspreisung von Claude Sonnet 5 dauerhaft. Der rote Faden diesen Monat: Die Preise für vergleichbare Leistung sinken spürbar, während aus China zwei ernstzunehmende, aber für die meisten KMU praktisch schwer selbst zu hostende Alternativen dazukommen.

5 Modell-Ereignisse in 18 Tagen
Opus 5 (24.07.), Kimi K3 offene Gewichte (26.07.), GPT-5.6-Preissenkung (30.07.), Qwen 3.8 Max GA (03.08.), Sonnet-5-Preis dauerhaft (11.08.)
Key Takeaways (5)
  • Claude Sonnet 5 bleibt dauerhaft bei $2 / $10 pro Million Tokens (Input/Output) — die für den 1. September angekündigte Preiserhöhung auf $3 / $15 wurde am 11. August zurückgenommen.
  • Claude Opus 5 kommt nah an die Fähigkeiten von Fable 5 heran, kostet aber wie bisher Opus 4.8: $5 / $25 pro Million Tokens — kein Grund mehr, beim Vorgänger zu bleiben.
  • OpenAI senkte GPT-5.6 Luna um 80 % (jetzt $0,20 / $1,20) und Terra um 20 % (jetzt $2 / $12); seit 6. August ist Luna zudem im ChatGPT-Gratis-Tarif unlimitiert nutzbar (nur Text).
  • Kimi K3 (Moonshot AI, China) ist mit 2,8 Billionen Parametern das derzeit größte frei verfügbare Modell und schlägt Fable 5 in einem Coding-Benchmark zum Bruchteil des Preises — Self-Hosting braucht aber Rechenzentrums-Hardware.
  • Kein Modellwechsel-Zwang: Wer ein funktionierendes Setup hat, muss nicht migrieren — die neuen Modelle sind zusätzliche Optionen, vor allem beim Preis.

Was zwischen 24. Juli und 11. August 2026 passiert ist

Nach dem turbulenten Modell-Juli (Fable 5, Grok 4.5, GPT-5.6) ging es im August vor allem um zwei Dinge: Preise und Alternativen. Anthropic brachte mit Opus 5 ein neues Flaggschiff, senkte aber keinen Preis — dafür machte OpenAI bei den günstigeren GPT-5.6-Stufen ernst und strich innerhalb weniger Tage sowohl den Preis als auch die Nutzungsgrenzen im Gratis-Tarif zusammen. Parallel dazu bestätigte sich, was sich im Juli bereits angedeutet hatte: China schickt mit Kimi K3 (Moonshot AI) und Qwen 3.8 Max (Alibaba) zwei neue, offen bzw. günstig verfügbare Großmodelle ins Feld, die bei einzelnen Aufgaben mit den teuersten US-Modellen mithalten können.

Claude Sonnet 5 und Opus 5 (Anthropic)

Sonnet 5 — vom Einführungspreis zum Dauerpreis

Sonnet 5 ist bereits seit 30. Juni 2026 verfügbar; neu im August: Am 11. August 2026 machte Anthropic die Einführungspreisung von $2 pro Million Input-Tokens und $10 pro Million Output-Tokens dauerhaft. Die ursprünglich für 1. September angekündigte Erhöhung auf $3 / $15 findet nicht statt. Laut Anthropic liegt die Leistung nah an der von Opus 4.8, bei deutlich niedrigerem Preis — positioniert als agentisches Alltags-Arbeitspferd mit Planungs-, Tool- und Browser-Fähigkeiten.

Opus 5 — neues Flaggschiff zum alten Preis

Am 24. Juli 2026 veröffentlichte Anthropic Opus 5: 1 Million Token Kontext, bis zu 128.000 Output-Tokens, adaptives Thinking standardmäßig aktiv. Preis: $5 / $25 pro Million Tokens — unverändert gegenüber Opus 4.8. Berichten zufolge kommt Opus 5 nah an die Fähigkeiten von Fable 5 heran, bei etwa der Hälfte des Preises (Fable 5 kostet weiterhin $10 / $50).

Optimal für: Sonnet 5 für die meisten täglichen Aufgaben und Automatisierungen; Opus 5 für anspruchsvollere Einzelfälle, bei denen bisher Opus 4.8 lief — der Wechsel kostet nichts extra.

GPT-5.6: Luna und Terra werden deutlich günstiger (OpenAI)

Drei Wochen nach dem Marktstart senkte OpenAI am 30. Juli 2026 die Preise der beiden günstigeren GPT-5.6-Stufen: Luna fiel von $1 / $6 auf $0,20 / $1,20 pro Million Tokens (−80 %), Terra von $2,50 / $15 auf $2 / $12 (−20 %). OpenAI begründete den Schritt mit Effizienzgewinnen — unter anderem dadurch, dass GPT-5.6 selbst am eigenen Produktions-Code mitoptimiert habe.

Am 6. August 2026 legte OpenAI nach: GPT-5.6 Luna wurde zum Standardmodell im ChatGPT-Gratis- und Go-Tarif, mit unlimitierten Text-Chats (Datei-Uploads und Bildfunktionen bleiben limitiert, Missbrauchsschutz greift weiterhin). Für Plus/Pro-Nutzer gab es zudem ein auf Alltagsgespräche nachjustiertes Sol-Update.

Optimal für: Teams mit hohem Aufgabenvolumen und geringen Einzelansprüchen — Luna deckt jetzt einen Großteil der Alltagsfälle praktisch zum Nulltarif ab (im Chat) bzw. zu einem Bruchteil des bisherigen API-Preises.

Kimi K3 und Qwen 3.8 Max — zwei neue Modelle aus China

Kimi K3 (Moonshot AI) — offene Gewichte, Rechenzentrums-Format

Moonshot AI stellte Kimi K3 am 16. Juli 2026 vor und veröffentlichte die vollständigen Modellgewichte am 26. Juli. Mit 2,8 Billionen Parametern (Mixture-of-Experts, nur ein Teil davon pro Anfrage aktiv) ist es das derzeit größte offen verfügbare Modell weltweit, mit nativer Bildverarbeitung und bis zu 1 Million Token Kontext. In einem Coding-Benchmark (Frontend Code Arena) schlug Kimi K3 Claude Fable 5 — bei $15 pro Million Output-Tokens über die Moonshot-API gegenüber $50 bei Fable 5.

Wichtiger Haken für DACH-KMU: Selbst-Hosting der offenen Gewichte erfordert laut technischer Dokumentation acht oder mehr High-End-GPUs und rund 1,6 Terabyte Speicherplatz für die Modelldatei — keine Option nebenbei für ein KMU ohne eigene Infrastruktur-Abteilung. Wer Kimi K3 nutzen will, greift entweder auf die Moonshot-API zu (Datenverarbeitung außerhalb der EU) oder auf Drittanbieter, die die offenen Gewichte in einem EU-Rechenzentrum hosten. Und: Offene Modellgewichte befreien nicht von den Pflichten des EU AI Act — die konkreten Vorgaben hängen vom Einsatzzweck ab und sollten vor produktivem Einsatz geprüft werden.

Qwen 3.8 Max (Alibaba) — günstig und multimodal

Alibaba brachte Qwen 3.8 Max am 3. August 2026 zur allgemeinen Verfügbarkeit — mit veröffentlichter Benchmark-Tabelle und Preisen von $2 / $6 pro Million Tokens. Das Modell verarbeitet nativ Text, Bild und Video bei bis zu 1 Million Token Kontext. Bei Benchmarks wie OSWorld-Verified und Terminal-Bench 2.1 liegt Qwen 3.8 Max vorn bzw. gleichauf mit Fable 5 und Opus 4.8, fällt aber bei reinen Softwareentwicklungs-Benchmarks (SWE-bench Pro, FrontierSWE) deutlich hinter Fable 5 zurück.

Sinnvoll vor allem für Teams, die bereits mit Open-Weight-Modellen arbeiten oder eine zusätzliche, günstige multimodale Option prüfen wollen — für die meisten DACH-KMU realistischer über eine gehostete API (Moonshot, Alibaba Cloud oder EU-Drittanbieter) als über eigenes Self-Hosting.

Preise im direkten Vergleich

ModellInput/Output pro Mio. TokensPositionierung
GPT-5.6 Sol (OpenAI)$5,00 / $30,00 (unverändert)Flaggschiff-Reasoning
Claude Opus 5 (Anthropic)$5,00 / $25,00 (= Opus 4.8)Premium, nah an Fable 5 zum halben Preis
Kimi K3 (Moonshot AI, China)$0,30–3,00 / $15,00Offene Gewichte, stärkstes China-Modell
GPT-5.6 Terra (OpenAI)$2,00 / $12,00 (−20 % seit 30.07.)Value-Tier
Claude Sonnet 5 (Anthropic)$2,00 / $10,00 (jetzt dauerhaft)agentisches Alltags-Arbeitspferd
Qwen 3.8 Max (Alibaba, China)$2,00 / $6,00günstig, multimodal (Text/Bild/Video)
GPT-5.6 Luna (OpenAI)$0,20 / $1,20 (−80 % seit 30.07.)High-Volume, im ChatGPT-Gratis-Tarif unlimitiert

Zum Vergleich bleiben Claude Fable 5 ($10,00 / $50,00) und Gemini 3.1 Pro ($2,00 / $12,00 unter 200k Kontext) unverändert — Details dazu im Juli-Vergleich (unten verlinkt). Preise Stand 12. August 2026, ändern sich kurzfristig — aktuelle Preise immer direkt beim Anbieter prüfen (platform.claude.com, openai.com/api/pricing, platform.moonshot.ai, alibabacloud.com).

Was das für dein Unternehmen bedeutet

Kein Modellwechsel-Zwang. Wer im Juli bereits ein funktionierendes Setup gewählt hat, muss nicht erneut migrieren. Trotzdem lohnen sich diesen Monat drei konkrete Checks:

Erstens: Wenn du noch auf älteren Sonnet-Versionen oder den GPT-5.6-Startpreisen unterwegs bist, prüf jetzt den Umstieg — Sonnet 5 kostet dauerhaft weniger bei mehr Leistung, und GPT-5.6 Luna/Terra sind seit Ende Juli deutlich günstiger als beim Marktstart. Bei reinem Chat-Einsatz ohne API-Anbindung deckt der unlimitierte ChatGPT-Gratis-Tarif mit Luna inzwischen viele einfache Alltagsfälle kostenlos ab.

Zweitens: Wenn bei euch bisher Opus 4.8 für anspruchsvollere Aufgaben lief, gibt es mit Opus 5 keinen Grund mehr, beim Vorgänger zu bleiben — gleicher Preis, mehr Leistung.

Drittens: Kimi K3 und Qwen 3.8 Max sind vor allem dann relevant, wenn ihr bereits mit offenen Modellen arbeitet oder eine Alternative zu US-Anbietern prüft — für die meisten KMU ist der praktische Zugang eine gehostete API (nicht eigenes Hosting), und die EU-AI-Act-Pflichten gelten unabhängig davon, ob die Gewichte offen sind.

Kurzes Update zum Juli-Vergleich: Grok 4.5 (xAI), im Juli-Post noch ohne EU-Verfügbarkeit gelistet, ist seit 17. Juli 2026 auch in der EU nutzbar ($2 / $6 pro Million Tokens) — die im Juli-Post genannte Einschränkung ist damit überholt.

Häufige Fragen

Muss ich mein KI-Setup jetzt umstellen?

Nein. Ein funktionierendes, wirtschaftliches Setup bleibt gültig. Lohnend ist meist nur ein Preis-Check: Sonnet 5 und die günstigeren GPT-5.6-Stufen sind seit Ende Juli/August spürbar billiger geworden, ohne dass sich an der grundsätzlichen Modellwahl etwas ändern muss.

Welches Modell ist für ein KMU aktuell am günstigsten?

Für reinen Chat-Einsatz: GPT-5.6 Luna im ChatGPT-Gratis-Tarif (unlimitiert, nur Text). Für API-Einsatz: GPT-5.6 Luna ($0,20 / $1,20) oder Qwen 3.8 Max ($2 / $6), je nach Anforderung. Der günstigste Preis pro Token ist aber nicht automatisch die günstigste Lösung insgesamt — die Aufgabe muss zuverlässig genug gelöst werden.

Kann ich Kimi K3 oder Qwen 3.8 Max einfach für mein Unternehmen nutzen?

Ja, über die jeweilige Anbieter-API oder über Drittanbieter, die die offenen Gewichte hosten. Eigenes Self-Hosting ist für die meisten KMU nicht praktikabel — Kimi K3 braucht laut Dokumentation mehrere High-End-GPUs und rund 1,6 Terabyte Speicher. Bei personenbezogenen Daten gilt: EU-AI-Act-Pflichten und DSGVO gelten unabhängig davon, ob ein Modell offene Gewichte hat — vor produktivem Einsatz prüfen, wo die Daten tatsächlich verarbeitet werden.

Was ist mit Grok 4.5 aus dem Juli-Vergleich?

Seit 17. Juli 2026 ist Grok 4.5 auch in der EU verfügbar (zuvor durch die EU-AI-Act-Einstufung als Modell mit systemischem Risiko blockiert). Preislich bleibt es bei $2 / $6 pro Million Tokens.

Anthropic: Claude Sonnet 5 & Pricing (anthropic.com/news, platform.claude.com); Claude Opus 5 Release (anthropic.com/news, Axios 24.07.2026); OpenAI: GPT-5.6-Preissenkung (CNBC/VentureBeat/Axios, 30.07.2026) und unlimitierter Luna-Gratis-Zugang (06.08.2026); Moonshot AI: Kimi K3 (Tom's Hardware, Northflank-Doku); Alibaba: Qwen 3.8 Max (Artificial Analysis, DataCamp); Grok 4.5 EU-Verfügbarkeit (Cybernews). Stand: 12. August 2026 — Preise und Verfügbarkeit ändern sich kurzfristig, aktuelle Angaben immer beim Anbieter prüfen.

Kostenloser Check

KI-Readiness-Check

Wie bereit ist dein Betrieb für KI-Automatisierung? 10 Fragen, persönliche Auswertung mit PDF — und du weißt, wo du stehst.

Readiness prüfen (3 Min) →

Cut the Prompt — Newsletter

Schließe dich 1.200 DACH-Geschäftsführer:innen an, die unseren KI-Newsletter lesen.

Jede Woche: 3 anonymisierte Beobachtungen aus echten KMU-Projekten, 1 Tool-Update aus unserem KI-Stack und 1 Idee zum Selber-Bauen. 5 Minuten Lesezeit. Kein Hype, kein Sales-Pitch.

Mit Eintragung Datenschutzerklärung akzeptiert. Abmeldung jederzeit per Link in jeder E-Mail.

1.200 lesen uns bereits auf LinkedIn — jetzt auch per E-Mail in deiner Inbox.

Erstgespräch

Willst du das für deinen Betrieb umsetzen?

In einem 30-Minuten-Gespräch analysieren wir deinen größten Zeitfresser und zeigen dir, was in deinem Betrieb sofort automatisiert werden kann.

Kostenloses Erstgespräch anfragen →

Antwort innerhalb von 48 Stunden — persönlich von Till.

Passend dazu

Weitere Artikel