Zum Inhalt springen

Euer KI-Test mit Gratis-Accounts hat den Tarif bewertet, nicht die KI

ChatGPT Free und Go laufen seit August auf GPT-5.6 Luna, Claude Free auf Sonnet 5. Bei maximalem Denkaufwand liegen beide gleichauf, 15 Indexpunkte hinter GPT-6 Astra und Claude Fable 5.1. Wer KI auf Gratis-Accounts testet, misst vor allem den Tarif.

Euer KI-Test mit Gratis-Accounts hat den Tarif bewertet, nicht die KI

Das Modell hinter ChatGPT Free und das Modell hinter Claude Free erreichen im Intelligence Index von Artificial Analysis bei maximalem Denkaufwand exakt denselben Wert: 38 Punkte. GPT-6 Astra und Claude Fable 5.1, die Flaggschiffe, für die man bezahlen muss, stehen ebenfalls gleichauf, beide bei 53. Zwischen OpenAI und Anthropic liegen damit null Punkte. Zwischen gratis und bezahlt beim selben Anbieter liegen fünfzehn.

Die Werte stammen aus Version 4.3 des Index, abgerufen am 17. September 2026. Gemessen sind GPT-5.6 Luna, seit August Standardmodell in ChatGPT Free und Go, Claude Sonnet 5, seit Ende Juni Standardmodell in Claude Free, sowie GPT-6 Astra und Claude Fable 5.1.

Wer seitdem ChatGPT gegen Claude auf Gratis-Accounts getestet hat, hat zwei gleich starke Modelle verglichen, beide weit unter den Spitzenmodellen, die derselbe Anbieter gegen Geld liefert. Und wenn ihr daraus geschlossen habt, KI reiche für eure Verträge oder Auswertungen noch nicht, habt ihr vor allem den Tarif bewertet.

Unser Modell-Ranking vom Mai kam zu dem Schluss, dass „bestes Modell“ die falsche Frage ist, weil an der Spitze nur drei Punkte die Anbieter trennten. Vier Monate später lässt sich der Gedanke zu Ende führen. Wenn die Anbieter gleichauf liegen, entscheidet die Stufe, und ein Pilot auf Gratis-Accounts misst genau die Variable, die ihr gar nicht vergleichen wolltet.

Gratis heißt seit August ein anderes Modell, nicht dasselbe mit Limit

Wer ChatGPT gratis nutzt, geht leicht davon aus, dasselbe ChatGPT zu bekommen, nur mit weniger Nachrichten. Seit dem 6. August 2026 stimmt das nicht mehr. An diesem Tag kündigte OpenAI im eigenen Blog an, das Standardmodell für Gratisnutzer auf GPT-5.6 Luna umzustellen.

Das OpenAI Help Center nennt Luna das schnellste und günstigste Modell der GPT-5.6-Familie. Free und Go haben laut derselben Seite keinen Zugriff auf das stärkere GPT-5.6 Sol (Stand 17. September 2026).

Besonders tückisch ist der Denk-Knopf, mit dem Gratisnutzer Luna mehr Zeit für eine Antwort geben. Ein stärkeres Modell holt er nicht dazu. Laut Help Center läuft auch die Denkfunktion auf GPT-5.6 Luna, nicht auf GPT-5.6 Sol. Wer im Test bei den schweren Aufgaben auf diesen Knopf gedrückt hat, hat dasselbe Modell nur länger rechnen lassen.

Bezahlen allein schützt nicht. ChatGPT Go kostet laut OpenAI-Preisseite 8 Euro im Monat und läuft trotzdem auf Luna. Und wie in Free können laut OpenAI auch in Go Anzeigen erscheinen, ab Plus nicht mehr.

Bei Anthropic fällt die Spaltung weniger auf. Claude Sonnet 5 wurde laut Anthropic bei seiner Einführung am 30. Juni 2026 Standardmodell in Free und in Pro. Das stärkere Claude Opus 5 wurde am 24. Juli Standard in Claude Max, für Pro nennt Anthropic es nur das stärkste verfügbare Modell. Fable gibt es laut Claude-Preisseite in Pro nur gegen Nutzungsguthaben.

Solange niemand das Modell umstellt, startet ein bezahlter Claude-Pro-Pilot nach diesen Angaben auf demselben Sonnet 5 wie der Gratis-Account am Nachbartisch.

Zwischen den Tarifen liegt ein Vielfaches des Abstands zwischen den Anbietern

ModellWo ihr es bekommtIntelligence Index v4.3AA-Briefcase (Elo, Platz von 168)
GPT-5.6 LunaChatGPT Free und Go381332 (Platz 37)
Claude Sonnet 5Claude Free, Standard in Pro381355 (Platz 34)
Claude Opus 5Claude Pro und Team (selbst auswählen), Standard in Max511645 (Platz 3)
GPT-6 AstraChatGPT Pro und Business, kontingentiert; Enterprise nach Freigabe531562 (Platz 9)
Claude Fable 5.1Claude Pro gegen Guthaben, Claude Max531662 (Platz 1)

Alle Werte von Artificial Analysis bei maximalem Denkaufwand, die Tarifzuordnung nach den Seiten der beiden Anbieter, Stand jeweils 17. September 2026.

Für einen Pilot zählt die rechte Spalte mehr, weil sie Büroarbeit misst. Das AA-Briefcase ist ein nicht öffentlicher Test, in dem KI-Agenten realistische Geschäftsabläufe erledigen und Tabellen oder Präsentationen abliefern müssen. Dort liegen die beiden Gratismodelle 23 Elo-Punkte auseinander. Innerhalb eines Anbieters sind es 230 Punkte von Luna zu Astra und 307 von Sonnet 5 zu Fable 5.1.

Selbst an der Spitze, wo sich die Anbieter im Arbeitstest am deutlichsten unterscheiden, trennen sie nur 100 Punkte. Das ist weniger als die Hälfte des Sprungs zwischen den Tarifen. Und Opus 5, im Pro-Abo ohne Aufpreis wählbar, steht im AA-Briefcase 290 Punkte über dem Sonnet 5, mit dem Pro startet.

Wer die Denkstufe nicht einstellt, testet auch mit Abo zu tief

Die 38 Punkte sind Lunas Obergrenze. Ohne Reasoning misst Artificial Analysis dasselbe Modell mit 16 Punkten, auf mittlerer Stufe mit 25. Auf derselben Stufe kommen Sonnet 5 auf 28 und Fable 5.1 auf 49 sowie Astra auf 50.

Zwischen den Anbietern liegen dann 3 Punkte bei den Gratismodellen und einer an der Spitze, zwischen den Tarifen dagegen 25 bei OpenAI und 21 bei Anthropic. Der Tarifabstand wächst sogar.

Mit welcher Stufe ChatGPT Free und Claude Free im Chat antworten, legen weder OpenAI noch Anthropic offen. Wir kennen nur einen dokumentierten Fall, und der betrifft das Spitzenmodell: Fable 5.1 läuft auf Claude.ai laut Anthropic standardmäßig mit mittlerem Denkaufwand, also auf der Stufe mit 49 statt 53 Punkten. Warum Denkaufwand ein eigenes Werkzeug ist und kein automatisches Upgrade, steht in unserem Beitrag zu Reasoning Models.

Seit dem 14. September 2026 schaltet ChatGPT in Plus und Pro laut den Release Notes nicht mehr automatisch von Instant auf Thinking um. Laut Help Center bleibt es selbst dann bei Instant, wenn ihr ausdrücklich um gründlicheres Nachdenken bittet. GPT-5.6 Sol ohne Reasoning steht im AA-Briefcase mit 1015 Punkten auf Platz 74, weit unter Luna mit maximalem Denkaufwand auf Platz 37. Welcher Messung der Instant-Modus genau entspricht, sagt OpenAI nicht.

Die Größenordnung reicht trotzdem, um die These zu schärfen. Ein Pilot misst den Tarif und die Einstellung. Wer unterhalb der Konfiguration testet, mit der das Team später arbeiten soll, unterschätzt die KI, gratis wie bezahlt.

Drei von vier Unternehmen stellen keinen KI-Zugang bereit. Getestet wird trotzdem.

Wir haben kein Unternehmen gefunden, auch keine Behörde oder Kanzlei, die öffentlich dokumentiert hat, dass sie KI auf Gratis-Accounts getestet und deshalb verworfen hat. Einen solchen Fall erfinden wir auch nicht. Das Umfeld, in dem solche Entscheidungen fallen, ist dagegen gut vermessen.

Laut dem Bitkom-Studienbericht „Künstliche Intelligenz in Deutschland“ (Befragung von 604 Unternehmen im Sommer 2025) stellen nur 26 Prozent der Unternehmen ihren Beschäftigten einen direkten Zugang zu generativer KI bereit. In 8 Prozent der Unternehmen ist KI-Nutzung außerhalb der Firmenangebote weit verbreitet, in weiteren 17 Prozent gibt es Einzelfälle. Von den Unternehmen, die generative KI einsetzen, nutzen 70 Prozent ChatGPT.

In der Bevölkerung setzt laut derselben Studie die Mehrheit der KI-Nutzer ausschließlich auf kostenlose Angebote, nur 8 Prozent nutzen kostenpflichtige Dienste. Der Bericht „The GenAI Divide“ der MIT-Initiative NANDA (Juli 2025, vorläufige Ergebnisse ohne Peer Review) fand international dasselbe Muster. Nur 40 Prozent der Unternehmen hatten ein offizielles Abo für ein Sprachmodell gekauft, aber Beschäftigte aus über 90 Prozent der befragten Unternehmen nutzten regelmäßig private KI-Tools für die Arbeit.

Beide Erhebungen stammen aus der Zeit vor der Tarif-Spaltung und belegen, wo der erste Kontakt stattfindet, nicht einen konkreten Fehlschluss. Seit August heißt „kostenlos“ bei ChatGPT aber Luna. Und weil echte Firmendaten nicht auf ein privates Konto gehören, testet dort, wer sich daran hält, mit ausgedachten Fällen. Warum private Konten der schlechteste Ort für Firmendaten sind, erklären wir im Beitrag zum KI-Verbot.

Für Mails reicht Luna. Die Frage war aber nie, ob KI Mails kann.

Der stärkste Einwand steht ausgerechnet im MIT-Bericht. Die Kluft zwischen erfolgreichen und gescheiterten KI-Vorhaben hänge offenbar nicht an der Modellqualität, schreiben die Autoren, sondern am Vorgehen. Für Mail-Entwürfe ziehen 70 Prozent der Befragten KI vor.

Und OpenAI meldet für Luna selbst einen Sprung. In einer internen Auswertung zu Finanzen und Medizin sowie Rechtsfragen waren Antworten mit mindestens einem Faktenfehler rund 62 Prozent seltener als beim früheren Gratismodell GPT-5.5 Instant, bei Sol 68 Prozent. Was mit Luna klappt, ist demnach konservativ gemessen.

Für einfache Einzelaufgaben trägt das. Drehte sich euer Pilot aber um den langen Vertrag oder die Auswertung über mehrere Tabellen, zeigt derselbe Bericht, wo es hakt. Bei allem, was komplex oder langfristig ist, ziehen die Befragten Menschen mit 9 zu 1 vor. Die Trennlinie sei nicht Intelligenz, sondern unter anderem Gedächtnis.

Zumindest der Kontext, also wie viel Text ein Modell auf einmal im Blick hat, ist nach Tarif gestaffelt. Laut OpenAI-Preisseite passen im Instant-Modus von ChatGPT Free nach eigener Näherung rund 12 Seiten Text in eine Eingabe, in Plus rund 40 und in Pro rund 250.

Die 62 Prozent messen Luna zudem am eigenen Vorgänger, nicht an Sol oder Astra. Ein Erfolg auf Luna zeigt, dass eine Aufgabe lösbar ist. Ein Misserfolg auf Luna zeigt nur, dass Luna sie nicht löst.

Zweiter Einwand: Benchmarks sind wacklig. Artificial Analysis hatte Astra zunächst gleichauf mit dem Vorgänger Sol eingestuft und den Index nach Kritik überarbeitet, wie The Decoder am 5. September 2026 berichtete. Heute gilt Version 4.3. Wie schnell Benchmarks verschleißen, haben wir selbst beschrieben. Das Argument hier ruht aber nicht allein auf Punkten: OpenAI nennt Luna selbst das günstigste Modell der Familie und sperrt Free und Go von Sol aus, und der Abstand zwischen den Tarifen hält auf jeder gemessenen Denkstufe.

Einen dritten Punkt muss man einräumen: Prompts wandern nicht verlustfrei nach oben. Laut OpenAI-Entwicklerblog, über den The Decoder am 12. September 2026 berichtete, können Freigaberegeln für ältere Modelle GPT-6 Astra bei Arbeit stoppen, die eigentlich weiterlaufen dürfte. Wer den Pilot auf Luna einübt und dann umzieht, arbeitet oben mit Anweisungen für unten. Das spricht gegen einen Gratis-Start und für einen Pilot, der von Anfang an auf der Zielstufe läuft.

Bleibt das Geld. Ein Standard-Platz in Claude Team kostet laut Anthropic 25 Dollar im Monat bei monatlicher Abrechnung, zuzüglich Steuern (Stand 17. September 2026). Darin steckt Opus 5, Platz 3 im AA-Briefcase, und anders als im privaten Pro-Abo trainiert Anthropic dort standardmäßig nicht mit euren Inhalten. Fünf Personen über drei Monate: 375 Dollar.

Bei OpenAI liegt die Schwelle höher. Plus kostet 23 Euro und bringt im Chat GPT-5.6 Sol bis zur Stufe High. Sol auf hoher Stufe steht im AA-Briefcase mit 1361 auf Platz 33, kaum über Luna mit maximalem Denkaufwand. GPT-6 Astra gibt es in Plus laut Help Center nur in ChatGPT Work und Codex, im Chat erst ab Pro und Business.

Welches Modell geantwortet hat, verrät der Chat immer seltener

Die Anbieter bauen die Stufen aus, und das Modell hinter einer Antwort wird unsichtbarer. Laut OpenAI Help Center kann ChatGPT mit einem anderen verfügbaren Modell weitermachen, sobald ihr ein Limit für GPT-5.6 Thinking erreicht habt. In Business Standard teilen sich GPT-6 Pro und GPT-5.6 Sol Pro 15 Nachrichten im Monat.

In Enterprise war Astra laut heise online zum Start standardmäßig abgeschaltet, bis ein Admin es freigibt. Auch ein teurer Pilot kann also auf dem Vorgänger laufen.

Microsoft 365 Copilot Chat wählt das Modell laut Microsoft Learn standardmäßig per Echtzeit-Router. Ohne Copilot-Lizenz hängt der Zugang an freier Kapazität, Vorrang bei Reasoning-Modellen gibt es nur mit Lizenz. Nach einem Test mit Copilot Chat ohne Copilot-Lizenz wisst ihr nicht sicher, welches Modell geantwortet hat.

Eine Analystenprognose dazu haben wir nicht gefunden. Die Folgerung ziehen wir selbst aus diesen Produktentscheidungen: In den nächsten 12 bis 24 Monaten ist ein Pilot-Ergebnis ohne Protokoll von Tarif, Modell, Denkstufe und Datum nicht reproduzierbar. Die Beschaffungsfrage verschiebt sich von „welcher Anbieter“ zu „welche Stufe mit welcher Einstellung für welche Aufgabe“.

Holt die schwersten Aufgaben aus eurem Pilot zurück

Erstens: Rekonstruiert, worauf ihr getestet habt. Steht in euren Notizen nur „ChatGPT“ oder „Claude“, ohne Tarif und Denkstufe, ist ein Nein aus diesem Test kein Nein.

Zweitens: Wiederholt die drei Aufgaben, an denen der Pilot gescheitert ist, auf der Zielkonfiguration. Bei Claude heißt das ein Team-Platz mit selbst gewähltem Opus 5, bei OpenAI ein Business-Platz mit Astra im Chat. Die Denkstufe stellt ihr ausdrücklich ein, und sobald euer Datenschutz das Firmenkonto freigegeben hat, testet ihr mit echten Unterlagen statt mit ausgedachten Fällen.

Drittens: Protokolliert für jede Antwort Tarif, Modell, Denkstufe und Datum. Sonst wisst ihr beim nächsten stillen Modellwechsel nicht, was sich geändert hat.

Wenn im Protokoll eures Tests nur „ChatGPT Free“ steht, beantwortet es nicht, ob KI eure Aufgabe kann. Es beantwortet, ob Luna sie kann.

Mehr KI-Wissen

KI-Wochenbriefing: jeden Freitag KI-News, Praxistipps und Tools

Kostenlos abonnieren, jederzeit abmeldbar, kein Spam.

Diesen Artikel teilen:

Autor und Redaktion

Prof. Dr. Daniel Sonnet

Prof. Dr. Daniel Sonnet

Gründer von KI-Syndikat, Professor an der Hochschule Fresenius

Daniel ist Data- und KI-Experte, Hochschullehrer an der Hochschule Fresenius (Professur Quantitative Methoden und Data Science) und Mitgründer der Gerabo GmbH in Hamburg. Er verbindet über ein Jahrzehnt Hochschullehre mit unternehmerischer Praxis und bringt KI-Wissen direkt in die Community.

Zum Profil

Freddie Feder

KI-Assistent und Lektor

Hat diesen Artikel mit recherchiert und geschrieben und ihn danach Satz für Satz lektoriert: Fakten geprüft, Ton geglättet und alles rausgeworfen, was klingt, als hätte es eine Maschine gebaut. Die inhaltliche Verantwortung liegt bei den menschlichen Autoren.

Mehr über unser Team

Das könnte dich auch interessieren

Bestes KI-Modell? GPT vs. Gemini vs. Claude, Mai 2026

GPT-5.5, Gemini 3.1 und Claude Opus 4.7 im Ranking Mai 2026: Nur drei Punkte trennen Sieger und Schlusslicht. Warum das beste Modell die falsche Frage ist und was du stattdessen entscheiden musst.

8 Min.

OpenAI schafft Custom GPTs ab. Die privaten GPTs deiner Kollegen rettet kein Admin.

OpenAI schaltet Custom GPTs ab, in Enterprise-Workspaces geplant zum 11. Dezember 2026. Migrieren darf nur der Ersteller oder ein Admin. Für GPTs in privaten Accounts gibt es keinen Admin, deshalb ist der Stichtag deine erste Schatten-KI-Inventur.

12 Min.

Die neue Kollegin ist der falsche Testfall für deinen Onboarding-Bot

Rolloutpläne machen die nächste neue Mitarbeiterin zur Pilotperson für den Onboarding-Assistenten, unser eigener auch. Sie ist die einzige Nutzerin, die eine falsche Antwort strukturell nicht erkennen kann.

10 Min.

Die Eskalationsliste ist selbst ein ungetesteter Klassifikator

Der E-Mail-Copilot formuliert nicht nur, er ordnet vorher ein. Die Kategorien, die kritische Mails stoppen sollen, kommen aus demselben Modell, das die Entwürfe schreibt.

8 Min.

Deine Wissensdatenbank ist dann nützlich, wenn sie nichts findet

Der Business-Case für eine interne KI-Wissensdatenbank rechnet mit gesparter Suchzeit. Der nützlichere Teil sind die Fragen, auf die das System nichts findet.

8 Min.

Von fünf Bewertungswerten fällt bei 1.611 KI-Fällen genau einer durch.

Wir haben alle 1.611 KI-Anwendungsfälle in unserem Korpus auf fünf Achsen bewertet. Nur eine liegt im Schnitt unter 3: wie schnell sich der Einstieg umsetzen lässt. KI scheitert im Mittelstand nicht am Nutzen, sondern an der Einstiegshürde.

7 Min.

Kommentare

Kommentare werden in Kürze freigeschaltet. Bis dahin freuen wir uns über dein Feedback per E-Mail an kontakt@ki-syndikat.de.

Kostenloser Newsletter

Bleib auf dem neuesten
Stand der KI

Wähle deine Themen und erhalte relevante KI-News, Praxistipps und exklusive Inhalte direkt in dein Postfach – kein Spam, jederzeit abmeldbar.

Was interessiert dich? Wähle 1 bis 4 Themen, du bekommst nur Inhalte dazu.

Mit der Anmeldung stimmst du unserer Datenschutzerklärung zu. Jederzeit abmeldbar.

Kostenlos
Kein Spam
Jederzeit abmeldbar