SOTA Überblick
SOTA-Überblick: Warum Ranglisten nur der Anfang sind
Autor: Prof. Dr. Sebastian P. Bayerl, Technische Hochschule Rosenheim
Stand: 24.08.2026
Kurzfassung
SOTA ist keine Kaufempfehlung.
Der KI-Markt bewegt sich weiter sehr schnell, und rund um den August 2026 wurden unter anderem GPT-5.6, Claude Opus 5, Gemini 3.7 Flash, GLM-5.3, Qwen3.8-Modelle und ein aktualisiertes DeepSeek V4-Pro sichtbar in die Debatte geschoben [OpenAI zu GPT-5.6], [OpenAI August-Update], [Anthropic zu Claude Opus 5], [Artificial Analysis zu Gemini 3.7 Flash], [Artificial Analysis zu GLM-5.3], [Alibaba zu Qwen3.8-Max], [The Decoder zu DeepSeek].
Benchmarks helfen, aber sie ersetzen keine eigene Evaluation. Die beste Modellwahl für regionale Unternehmen ist fast immer aufgabenbezogen, kostenbewusst und governance-fähig. Wichtiger als eine einfache Rangliste ist die Passung zwischen Aufgabe, Kosten, Geschwindigkeit, Datenschutz, Integrationsaufwand und Fehlertoleranz.
GPT-5.6
OpenAI veröffentlichte GPT-5.6 am 9. Juli 2026 allgemein und beschreibt die Familie mit drei Stufen: Sol als Flaggschiff, Terra als ausgewogenes Modell für Alltagsarbeit und Luna als schnellste und günstigste Variante [OpenAI].
Am 6. August 2026 folgte ein ChatGPT-Update, bei dem Free- und Go-Nutzer ein neues Standardmodell erhalten und zahlende Nutzer eine aktualisierte GPT-5.6-Sol-Erfahrung mit steuerbarem Reasoning-Aufwand bekommen [OpenAI Deployment Safety Hub].
Für Unternehmen ist daran vor allem die Produktlogik interessant. Frontier-Leistung wird nicht mehr nur als einzelnes Spitzenmodell angeboten, sondern als Modellfamilie mit unterschiedlichen Kosten-, Geschwindigkeits- und Leistungsprofilen. Das erleichtert differenzierte Architekturen, in denen einfache Aufgaben günstiger laufen und schwierige Aufgaben gezielt an ein stärkeres Modell eskaliert werden.
Claude Opus 5
Anthropic veröffentlichte Claude Opus 5 am 24. Juli 2026 und positioniert das Modell als nahe an Claude Fable 5, aber zu etwa halbem Preis und mit starkem Fokus auf Coding, Wissensarbeit und agentische Aufgaben [Anthropic].
Damit gehört Opus 5 nicht formal zu den August-Releases, ist für die August-Einordnung aber relevant, weil es unmittelbar vor der aktuellen Modellwelle veröffentlicht wurde und in vielen praktischen Workflows mit GPT-5.6, Gemini 3.7 Flash und GLM-5.3 verglichen wird.
Die Botschaft ist ähnlich wie bei GPT-5.6: Anbieter versuchen, Frontier-Fähigkeiten näher an den produktiven Alltag zu bringen, ohne jede Anfrage auf das teuerste Spitzenmodell zu routen.
Gemini 3.7 Flash
Artificial Analysis ordnet Gemini 3.7 Flash als Modell ein, das bei hoher Reasoning-Einstellung einen Intelligence-Index von 56 erreicht und zugleich deutlich schneller pro Aufgabe sein soll als mehrere starke Vergleichsmodelle [Artificial Analysis].
Google nennt für Gemini 3.7 Flash ein langes Kontextfenster und multimodale Eingaben, darunter Text, Bild, Video und Sprache [Google DeepMind].
Geschwindigkeit und Kosten pro Aufgabe werden neben der Modellgüte zunehmend zu harten Auswahlkriterien. Die Flash-Variante von Gemini positioniert sich hier eindeutig.
GLM-5.3
Artificial Analysis führt GLM-5.3 als proprietäres Modell mit einem Intelligence-Index von 60, einem Kontextfenster von einer Million Tokens und Preisen von 1,40 US-Dollar pro Million Eingabetokens sowie 4,40 US-Dollar pro Million Ausgabetokens [Artificial Analysis].
Das macht GLM-5.3 vor allem für lange Coding-, Agenten- und Wissensarbeitsaufgaben interessant. Der proprietäre Status bleibt aber ein Beschaffungs- und Governance-Thema. Wer stark in agentische Workflows investiert, sollte nicht nur Benchmarkwerte vergleichen, sondern auch Toolzugriffe, Logging, Datenflüsse, Auditierbarkeit und Exit-Optionen prüfen.
Qwen3.8
Alibaba beschreibt Qwen3.8-Max als 2,4-Billionen-Parameter-MoE-Modell mit 95 Milliarden aktiven Parametern und einem Kontextfenster von bis zu einer Million Tokens [Alibaba Group]. Qwen3.8-27B ist zugleich als deutlich kleineres Open-Weights-Modell relevant, weil Artificial Analysis es mit Apache-2.0-Lizenz, 27 Milliarden Parametern und multimodaler Eingabe führt [Artificial Analysis].
Diese Kombination zeigt die aktuelle Marktlogik. Ein Anbieter kann gleichzeitig ein großes Cloud-Flaggschiff und kleinere offene Modelle für kontrolliertere Einsatzformen anbieten.
DeepSeek V4-Pro
DeepSeek hat laut The Decoder V4-Pro aktualisiert, die Agentensoftware DeepSeek Harness als Open Source veröffentlicht und zugleich die API-Preise geändert [The Decoder].
Besonders relevant ist hier ein Blick auf die Preisstrategie. The Decoder beschreibt, dass DeepSeek ab dem 16. August 2026 Peak- und Off-Peak-Preise für V4-Pro eingeführt hat und Cache-Hits im Vergleich zur vorherigen Preislogik deutlich teurer wurden [The Decoder].
Damit wird sichtbar, dass API-Kosten strategisch beweglich sind. Wer ein Produkt oder einen internen Prozess auf einem Anbieter aufbaut, braucht Kostenmonitoring und Wechseloptionen.
Entscheidungslogik für Unternehmen
Ein sinnvoller SOTA-Vergleich beginnt mit der Aufgabe. Sollte diese nicht klar sein, lohnt sich der Blick auf immer stärkere Modelle nicht. Ein Kundensupport-Assistent braucht andere Eigenschaften als ein Code-Agent, ein Recherchewerkzeug, ein lokaler Dokumentenassistent oder ein Automatisierungsworkflow.
Danach sollten mindestens sechs Kriterien verglichen werden:
- Erstens Qualität auf eigenen Testfällen.
- Zweitens Kosten pro korrekt erledigter Aufgabe.
- Drittens Latenz und Durchsatz.
- Viertens Datenschutz und Speicherorte.
- Fünftens Integrationsaufwand in bestehende Systeme.
- Sechstens Stabilität von Preisen, Schnittstellen und Modellversionen.
-------
Nächster Artikel: Veranstaltungen
Zurück zur Übersicht KI-Kompass Ausgabe 1